Kostenlose APILLMAPI-SchlüsselOffiziell
Cerebras Inference
Wafer-Scale-Chips für Open Models mit extrem hohem Tokens-per-Second-Durchsatz, kostenloser Tarif
Cerebras Inference betreibt Open-Weight-Modelle (gpt-oss-120b, GLM, Llama, Qwen) auf seiner Wafer-Scale-Hardware und liefert damit einen der höchsten verfügbaren Durchsätze. Über cloud.cerebras.ai steht ein kostenloser Tarif ohne Kreditkarte bereit, der einen OpenAI-kompatiblen Chat-Endpunkt bereitstellt.
Free Tier
Kostenloser Tarif, keine Kreditkarte erforderlich. Tägliches Token-Kontingent begrenzt; kostenpflichtige Tarife erhöhen die Limits.Ratenlimits
Kostenloser Tarif (Stand Juni 2026): 5 RPM, 30.000 Tokens/min, 1.000.000 Tokens/Tag pro Modell. Das kostenlose Modell-Angebot umfasste u. a. gpt-oss-120b und zai-glm-4.7. Bei einigen kostenlosen Modellen kann ein reduziertes Kontextfenster gelten. Aktuelle Werte finden sich auf der Limits-Seite in Ihrem Account.Auth
API-SchlüsselBasis-URL
https://api.cerebras.ai/v1Was du damit bauen kannst
- Latenz-kritische Demos, bei denen die reine Generierungsgeschwindigkeit beeindruckt
- Stoßweise Automatisierungsschritte, die ins 1M-Tokens/Tag-Budget passen
- Benchmarking von Open Models im direkten Durchsatzvergleich
- Reasoning-intensive Single-Shot-Aufgaben, bei denen schnelle lange Ausgaben helfen
Wichtige Endpunkte
- POST
/chat/completionsOpenAI-kompatibler Chat-Completion-Endpunkt (Streaming unterstützt) - POST
/completionsText-Completion - GET
/modelsVerfügbare Modelle für Ihren Account auflisten
Mitglieder
Mitglieder erhalten das ausführbare Rezept
Melde dich kostenlos an, um die Beispielanfrage zu kopieren, eine Beispielantwort zu sehen und die Stolperfallen zu lesen.
Tags
llminferenceopenai-compatiblehigh-throughputopen-weights