Alle gratis API's
Gratis APILLMAPI-sleutelOfficieel

Cerebras Inference

Wafer-scale chips voor open modellen met extreme tokens per seconde, gratis tier

Cerebras Inference draait open-weight modellen (gpt-oss-120b, GLM, Llama, Qwen) op zijn wafer-scale hardware en levert daarmee een van de hoogste doorvoersnelheden die momenteel beschikbaar zijn. Er is een gratis tier zonder creditcard via cloud.cerebras.ai, met een OpenAI-compatibel chat-endpoint.

Gratis tier

Gratis tier, geen creditcard vereist. Dagelijks tokenlimiet per dag; betaalde tiers verhogen de limieten.

Limieten

Gratis tier (geverifieerd juni 2026): 5 RPM, 30.000 tokens/min, 1.000.000 tokens/dag per model. Het gratis modelaanbod bevatte onder andere gpt-oss-120b en zai-glm-4.7. Voor sommige gratis modellen kan een lager contextlimiet gelden. Raadpleeg de Limits-pagina in je account voor de actuele waarden.

Authenticatie

API-sleutel

Basis-URL

https://api.cerebras.ai/v1

Wat je ermee zou bouwen

  • Latentiegevoelige demo's waarbij ruwe generatiesnelheid de grote troef is
  • Stapsgewijze automatisering die binnen het dagbudget van 1M tokens past
  • Open modellen head-to-head benchmarken op doorvoersnelheid
  • Redeneer-intensieve single-shot taken waarbij snelle, lange uitvoer helpt

Belangrijkste endpoints

  • POST/chat/completionsOpenAI-compatibele chatcompletion (streaming ondersteund)
  • POST/completionsTekstcompletion
  • GET/modelsBeschikbare modellen voor je account opvragen
Leden

Leden krijgen het kant-en-klare recept

Log gratis in om het voorbeeldverzoek te kopiëren, een voorbeeldantwoord te bekijken en de valkuilen te lezen.

Tags

llminferenceopenai-compatiblehigh-throughputopen-weights