API gratuitaLLMChiave APIUfficiale
Cerebras Inference
Chip wafer-scale per modelli open a token-per-second estremi, tier gratuito
Cerebras Inference esegue modelli open-weight (gpt-oss-120b, GLM, Llama, Qwen) sul proprio hardware wafer-scale, offrendo alcuni dei throughput più elevati disponibili. È disponibile un tier gratuito senza carta di credito tramite cloud.cerebras.ai, che espone un endpoint di chat compatibile con OpenAI.
Piano gratuito
Tier gratuito, nessuna carta di credito richiesta. Quota giornaliera di token limitata; i tier a pagamento alzano i limiti.Limiti di frequenza
Tier gratuito (verificato giugno 2026): 5 RPM, 30.000 token/min, 1.000.000 token/giorno per modello. Il catalogo modelli gratuiti ha incluso gpt-oss-120b e zai-glm-4.7. Per alcuni modelli gratuiti può essere applicato un limite ridotto alla finestra di contesto. Consultare la pagina Limits nel proprio account per i valori aggiornati.Autenticazione
Chiave APIURL base
https://api.cerebras.ai/v1Cosa puoi costruirci
- Demo latency-critical in cui la velocità di generazione grezza è il fattore wow
- Step di automazione a burst che rientrano nel budget di 1M di token/giorno
- Benchmark di modelli open in testa a testa sul throughput
- Task single-shot di ragionamento intensivo in cui output lunghi e veloci sono utili
Endpoint principali
- POST
/chat/completionsChat completion compatibile con OpenAI (streaming supportato) - POST
/completionsText completion - GET
/modelsElenco dei modelli disponibili per l'account
Membri
I membri ottengono la ricetta eseguibile
Accedi gratuitamente per copiare la richiesta di esempio, vedere una risposta di esempio e leggere le insidie.
Tag
llminferenceopenai-compatiblehigh-throughputopen-weights