Todas las APIs gratuitas
API gratuitaLLMClave APIOficial

Cerebras Inference

Chips de escala de oblea que sirven modelos abiertos a tokens por segundo extremos, con nivel gratuito

Cerebras Inference ejecuta modelos de pesos abiertos (gpt-oss-120b, GLM, Llama, Qwen) en su hardware de escala de oblea, ofreciendo uno de los throughputs más altos disponibles. Hay un nivel gratuito sin necesidad de tarjeta de crédito en cloud.cerebras.ai, que expone un endpoint de chat compatible con OpenAI.

Nivel gratuito

Nivel gratuito sin tarjeta de crédito. Límite de tokens diario; los niveles de pago amplían los límites.

Límites de uso

Nivel gratuito (verificado junio 2026): 5 RPM, 30.000 tokens/min, 1.000.000 tokens/día por modelo. El catálogo de modelos gratuitos ha incluido gpt-oss-120b y zai-glm-4.7. Algunos modelos gratuitos pueden tener un límite de contexto reducido. Consulta la página de Límites en tu cuenta para ver los valores actuales.

Autenticación

Clave API

URL base

https://api.cerebras.ai/v1

Qué podrías construir con ella

  • Demos con requisitos críticos de latencia donde la velocidad de generación bruta es el factor diferenciador
  • Pasos de automatización en ráfagas que encajan dentro del presupuesto de 1M de tokens/día
  • Benchmarking comparativo de modelos abiertos por throughput
  • Tareas de razonamiento intensivo en un solo disparo donde los outputs largos y rápidos son ventajosos

Endpoints clave

  • POST/chat/completionsCompletado de chat compatible con OpenAI (streaming soportado)
  • POST/completionsCompletado de texto
  • GET/modelsListar modelos disponibles en tu cuenta
Miembros

Los miembros obtienen la receta lista para ejecutar

Inicia sesión gratis para copiar la solicitud de ejemplo, ver una respuesta de muestra y leer las trampas.

Etiquetas

llminferenceopenai-compatiblehigh-throughputopen-weights