Tutte le API gratuite
API gratuitaLLMChiave APIUfficiale

Cerebras Inference

Chip wafer-scale per modelli open a token-per-second estremi, tier gratuito

Cerebras Inference esegue modelli open-weight (gpt-oss-120b, GLM, Llama, Qwen) sul proprio hardware wafer-scale, offrendo alcuni dei throughput più elevati disponibili. È disponibile un tier gratuito senza carta di credito tramite cloud.cerebras.ai, che espone un endpoint di chat compatibile con OpenAI.

Piano gratuito

Tier gratuito, nessuna carta di credito richiesta. Quota giornaliera di token limitata; i tier a pagamento alzano i limiti.

Limiti di frequenza

Tier gratuito (verificato giugno 2026): 5 RPM, 30.000 token/min, 1.000.000 token/giorno per modello. Il catalogo modelli gratuiti ha incluso gpt-oss-120b e zai-glm-4.7. Per alcuni modelli gratuiti può essere applicato un limite ridotto alla finestra di contesto. Consultare la pagina Limits nel proprio account per i valori aggiornati.

Autenticazione

Chiave API

URL base

https://api.cerebras.ai/v1

Cosa puoi costruirci

  • Demo latency-critical in cui la velocità di generazione grezza è il fattore wow
  • Step di automazione a burst che rientrano nel budget di 1M di token/giorno
  • Benchmark di modelli open in testa a testa sul throughput
  • Task single-shot di ragionamento intensivo in cui output lunghi e veloci sono utili

Endpoint principali

  • POST/chat/completionsChat completion compatibile con OpenAI (streaming supportato)
  • POST/completionsText completion
  • GET/modelsElenco dei modelli disponibili per l'account
Membri

I membri ottengono la ricetta eseguibile

Accedi gratuitamente per copiare la richiesta di esempio, vedere una risposta di esempio e leggere le insidie.

Tag

llminferenceopenai-compatiblehigh-throughputopen-weights