Gratis APILLMAPI-nyckelOfficiell
Cerebras Inference
Wafer-scale-chips som kör öppna modeller med extremt hög tokens per sekund, gratisnivå
Cerebras Inference kör open-weight-modeller (gpt-oss-120b, GLM, Llama, Qwen) på sin wafer-scale-hårdvara och levererar ett av de högsta genomflödena som finns tillgängliga. En gratisnivå finns utan kreditkort via cloud.cerebras.ai och exponerar en OpenAI-kompatibel chattendpoint.
Gratisnivå
Gratisnivå, inget kreditkort krävs. Begränsat tokenanslag per dag; betalda nivåer höjer gränserna.Anropsgränser
Gratisnivå (verifierad juni 2026): 5 RPM, 30 000 tokens/min, 1 000 000 tokens/dag per modell. Den fria modellmenyn har inkluderat gpt-oss-120b och zai-glm-4.7. En reducerad kontextgräns kan gälla för vissa gratismodeller. Se Limits-sidan i ditt konto för aktuella värden.Autentisering
API-nyckelBas-URL
https://api.cerebras.ai/v1Vad du kan bygga med det
- Latenskritiska demonstrationer där rå genereringshastighet är det imponerande momentet
- Burstiga automatiseringssteg som ryms inom budgeten på 1M tokens/dag
- Benchmarking av öppna modeller mot varandra avseende genomflöde
- Resonemangstunga single-shot-uppgifter där snabba långa utdata är en fördel
Centrala endpoints
- POST
/chat/completionsOpenAI-kompatibel chattgenerering (streaming stöds) - POST
/completionsTextgenerering - GET
/modelsLista modeller tillgängliga för ditt konto
Medlemmar
Medlemmar får det körbara receptet
Logga in gratis för att kopiera exempelanropet, se ett exempelsvar och läsa om fallgroparna.
Taggar
llminferenceopenai-compatiblehigh-throughputopen-weights