Todas las APIs gratuitas
API gratuitaLLMClave APIOficial

Groq API

La inferencia de modelos abiertos más rápida del mercado, gratuita sin tarjeta de crédito

Groq ejecuta LLMs de pesos abiertos (Llama 3.x, gpt-oss, Qwen) en hardware LPU personalizado a tokens por segundo muy elevados. La consola de desarrolladores proporciona una clave de API gratuita sin necesidad de tarjeta, y la API es compatible con OpenAI, por lo que el código SDK existente funciona cambiando solo la URL base.

Nivel gratuito

Nivel Developer gratuito, sin tarjeta de crédito. Límites diarios y por minuto por modelo; actualiza para obtener límites más altos y descuentos por volumen.

Límites de uso

Nivel gratuito (verificado junio 2026): llama-3.1-8b-instant = 30 RPM, 14.400 solicitudes/día, 6.000 TPM, 500.000 TPD; llama-3.3-70b-versatile = 30 RPM, 1.000 solicitudes/día, 12.000 TPM, 100.000 TPD. Los límites son por organización y por modelo; los modelos más grandes tienen menores límites de tokens.

Autenticación

Clave API

URL base

https://api.groq.com/openai/v1

Qué podrías construir con ella

  • Bucles de agentes con baja latencia y llamadas a herramientas donde la velocidad de ida y vuelta importa
  • Automatizaciones de chat o voz en tiempo real que necesitan streaming de tokens por debajo del segundo
  • Transcripción con Whisper para pipelines de ingesta de audio en el nivel gratuito
  • Clasificación por lotes de alto throughput dentro del presupuesto diario de tokens

Endpoints clave

  • POST/chat/completionsCompletado de chat compatible con OpenAI (streaming soportado)
  • POST/audio/transcriptionsTranscripción de voz a texto basada en Whisper
  • GET/modelsListar modelos disponibles y sus metadatos
Miembros

Los miembros obtienen la receta lista para ejecutar

Inicia sesión gratis para copiar la solicitud de ejemplo, ver una respuesta de muestra y leer las trampas.

Etiquetas

llminferenceopenai-compatiblelow-latencyopen-weights