API gratuitaLLMClave APIOficial
Cerebras Inference
Chips de escala de oblea que sirven modelos abiertos a tokens por segundo extremos, con nivel gratuito
Cerebras Inference ejecuta modelos de pesos abiertos (gpt-oss-120b, GLM, Llama, Qwen) en su hardware de escala de oblea, ofreciendo uno de los throughputs más altos disponibles. Hay un nivel gratuito sin necesidad de tarjeta de crédito en cloud.cerebras.ai, que expone un endpoint de chat compatible con OpenAI.
Nivel gratuito
Nivel gratuito sin tarjeta de crédito. Límite de tokens diario; los niveles de pago amplían los límites.Límites de uso
Nivel gratuito (verificado junio 2026): 5 RPM, 30.000 tokens/min, 1.000.000 tokens/día por modelo. El catálogo de modelos gratuitos ha incluido gpt-oss-120b y zai-glm-4.7. Algunos modelos gratuitos pueden tener un límite de contexto reducido. Consulta la página de Límites en tu cuenta para ver los valores actuales.Autenticación
Clave APIURL base
https://api.cerebras.ai/v1Qué podrías construir con ella
- Demos con requisitos críticos de latencia donde la velocidad de generación bruta es el factor diferenciador
- Pasos de automatización en ráfagas que encajan dentro del presupuesto de 1M de tokens/día
- Benchmarking comparativo de modelos abiertos por throughput
- Tareas de razonamiento intensivo en un solo disparo donde los outputs largos y rápidos son ventajosos
Endpoints clave
- POST
/chat/completionsCompletado de chat compatible con OpenAI (streaming soportado) - POST
/completionsCompletado de texto - GET
/modelsListar modelos disponibles en tu cuenta
Miembros
Los miembros obtienen la receta lista para ejecutar
Inicia sesión gratis para copiar la solicitud de ejemplo, ver una respuesta de muestra y leer las trampas.
Etiquetas
llminferenceopenai-compatiblehigh-throughputopen-weights