Gratis APILLMAPI-sleutelOfficieel
Cerebras Inference
Wafer-scale chips voor open modellen met extreme tokens per seconde, gratis tier
Cerebras Inference draait open-weight modellen (gpt-oss-120b, GLM, Llama, Qwen) op zijn wafer-scale hardware en levert daarmee een van de hoogste doorvoersnelheden die momenteel beschikbaar zijn. Er is een gratis tier zonder creditcard via cloud.cerebras.ai, met een OpenAI-compatibel chat-endpoint.
Gratis tier
Gratis tier, geen creditcard vereist. Dagelijks tokenlimiet per dag; betaalde tiers verhogen de limieten.Limieten
Gratis tier (geverifieerd juni 2026): 5 RPM, 30.000 tokens/min, 1.000.000 tokens/dag per model. Het gratis modelaanbod bevatte onder andere gpt-oss-120b en zai-glm-4.7. Voor sommige gratis modellen kan een lager contextlimiet gelden. Raadpleeg de Limits-pagina in je account voor de actuele waarden.Authenticatie
API-sleutelBasis-URL
https://api.cerebras.ai/v1Wat je ermee zou bouwen
- Latentiegevoelige demo's waarbij ruwe generatiesnelheid de grote troef is
- Stapsgewijze automatisering die binnen het dagbudget van 1M tokens past
- Open modellen head-to-head benchmarken op doorvoersnelheid
- Redeneer-intensieve single-shot taken waarbij snelle, lange uitvoer helpt
Belangrijkste endpoints
- POST
/chat/completionsOpenAI-compatibele chatcompletion (streaming ondersteund) - POST
/completionsTekstcompletion - GET
/modelsBeschikbare modellen voor je account opvragen
Leden
Leden krijgen het kant-en-klare recept
Log gratis in om het voorbeeldverzoek te kopiëren, een voorbeeldantwoord te bekijken en de valkuilen te lezen.
Tags
llminferenceopenai-compatiblehigh-throughputopen-weights