Alle gratis API-er
Gratis APILLMAPI-nøkkelOffisiell

Cerebras Inference

Wafer-scale-brikker som serverer åpne modeller med ekstremt høy tokens-per-sekund, gratisnivå

Cerebras Inference kjører åpne modeller (gpt-oss-120b, GLM, Llama, Qwen) på sin wafer-scale-maskinvare og leverer noe av den høyeste gjennomstrømningen som er tilgjengelig. Et gratisnivå er tilgjengelig uten kredittkort via cloud.cerebras.ai, og eksponerer et OpenAI-kompatibelt chat-endepunkt.

Gratisnivå

Gratisnivå, ingen kredittkortregistrering kreves. Begrenset daglig tokenkvote; betalte nivåer hever grensene.

Hastighetsgrenser

Gratisnivå (verifisert juni 2026): 5 RPM, 30 000 tokens/min, 1 000 000 tokens/dag per modell. Den gratis modellmenyen har inkludert gpt-oss-120b og zai-glm-4.7. Et redusert konteksttak kan gjelde for noen gratismodeller. Sjekk Limits-siden i kontoen din for gjeldende verdier.

Autentisering

API-nøkkel

Base-URL

https://api.cerebras.ai/v1

Hva du kan bygge med det

  • Latenskritiske demoer der rå genereringshastighet er imponerende
  • Burst-automatiseringstrinn som passer innenfor budsjettet på 1M tokens/dag
  • Benchmarking av åpne modeller mot hverandre på gjennomstrømning
  • Tunge resonneringsoppgaver med én enkelt forespørsel der raske, lange svar hjelper

Sentrale endepunkter

  • POST/chat/completionsOpenAI-kompatibel chat-fullføring (streaming støttet)
  • POST/completionsTekstfullføring
  • GET/modelsList modeller tilgjengelige for kontoen din
Medlemmer

Medlemmer får den kjørbare oppskriften

Logg inn gratis for å kopiere eksempelforespørselen, se et eksempelsvar og lese fallgruvene.

Tagger

llminferenceopenai-compatiblehigh-throughputopen-weights