API gratuitaLLMClave APIOficial
Groq API
La inferencia de modelos abiertos más rápida del mercado, gratuita sin tarjeta de crédito
Groq ejecuta LLMs de pesos abiertos (Llama 3.x, gpt-oss, Qwen) en hardware LPU personalizado a tokens por segundo muy elevados. La consola de desarrolladores proporciona una clave de API gratuita sin necesidad de tarjeta, y la API es compatible con OpenAI, por lo que el código SDK existente funciona cambiando solo la URL base.
Nivel gratuito
Nivel Developer gratuito, sin tarjeta de crédito. Límites diarios y por minuto por modelo; actualiza para obtener límites más altos y descuentos por volumen.Límites de uso
Nivel gratuito (verificado junio 2026): llama-3.1-8b-instant = 30 RPM, 14.400 solicitudes/día, 6.000 TPM, 500.000 TPD; llama-3.3-70b-versatile = 30 RPM, 1.000 solicitudes/día, 12.000 TPM, 100.000 TPD. Los límites son por organización y por modelo; los modelos más grandes tienen menores límites de tokens.Autenticación
Clave APIURL base
https://api.groq.com/openai/v1Qué podrías construir con ella
- Bucles de agentes con baja latencia y llamadas a herramientas donde la velocidad de ida y vuelta importa
- Automatizaciones de chat o voz en tiempo real que necesitan streaming de tokens por debajo del segundo
- Transcripción con Whisper para pipelines de ingesta de audio en el nivel gratuito
- Clasificación por lotes de alto throughput dentro del presupuesto diario de tokens
Endpoints clave
- POST
/chat/completionsCompletado de chat compatible con OpenAI (streaming soportado) - POST
/audio/transcriptionsTranscripción de voz a texto basada en Whisper - GET
/modelsListar modelos disponibles y sus metadatos
Miembros
Los miembros obtienen la receta lista para ejecutar
Inicia sesión gratis para copiar la solicitud de ejemplo, ver una respuesta de muestra y leer las trampas.
Etiquetas
llminferenceopenai-compatiblelow-latencyopen-weights