Alle kostenlosen APIs
Kostenlose APILLMAPI-SchlüsselOffiziell

Cerebras Inference

Wafer-Scale-Chips für Open Models mit extrem hohem Tokens-per-Second-Durchsatz, kostenloser Tarif

Cerebras Inference betreibt Open-Weight-Modelle (gpt-oss-120b, GLM, Llama, Qwen) auf seiner Wafer-Scale-Hardware und liefert damit einen der höchsten verfügbaren Durchsätze. Über cloud.cerebras.ai steht ein kostenloser Tarif ohne Kreditkarte bereit, der einen OpenAI-kompatiblen Chat-Endpunkt bereitstellt.

Free Tier

Kostenloser Tarif, keine Kreditkarte erforderlich. Tägliches Token-Kontingent begrenzt; kostenpflichtige Tarife erhöhen die Limits.

Ratenlimits

Kostenloser Tarif (Stand Juni 2026): 5 RPM, 30.000 Tokens/min, 1.000.000 Tokens/Tag pro Modell. Das kostenlose Modell-Angebot umfasste u. a. gpt-oss-120b und zai-glm-4.7. Bei einigen kostenlosen Modellen kann ein reduziertes Kontextfenster gelten. Aktuelle Werte finden sich auf der Limits-Seite in Ihrem Account.

Auth

API-Schlüssel

Basis-URL

https://api.cerebras.ai/v1

Was du damit bauen kannst

  • Latenz-kritische Demos, bei denen die reine Generierungsgeschwindigkeit beeindruckt
  • Stoßweise Automatisierungsschritte, die ins 1M-Tokens/Tag-Budget passen
  • Benchmarking von Open Models im direkten Durchsatzvergleich
  • Reasoning-intensive Single-Shot-Aufgaben, bei denen schnelle lange Ausgaben helfen

Wichtige Endpunkte

  • POST/chat/completionsOpenAI-kompatibler Chat-Completion-Endpunkt (Streaming unterstützt)
  • POST/completionsText-Completion
  • GET/modelsVerfügbare Modelle für Ihren Account auflisten
Mitglieder

Mitglieder erhalten das ausführbare Rezept

Melde dich kostenlos an, um die Beispielanfrage zu kopieren, eine Beispielantwort zu sehen und die Stolperfallen zu lesen.

Tags

llminferenceopenai-compatiblehigh-throughputopen-weights