Toutes les API gratuites
API gratuiteLLMClé APIOfficiel

Groq API

L'inférence de modèles open source la plus rapide du marché, gratuite sans carte bancaire

Groq exécute des LLM open-weight (Llama 3.x, gpt-oss, Qwen) sur du matériel LPU personnalisé à très haute cadence de tokens par seconde. La console développeur délivre une clé API gratuite sans carte requise, et l'API est compatible OpenAI, donc le code SDK existant fonctionne en changeant simplement l'URL de base.

Palier gratuit

Niveau Developer gratuit, sans carte bancaire. Quotas journaliers et par minute par modèle ; passez à un niveau supérieur pour des limites plus élevées et des remises à l'usage.

Limites de débit

Niveau gratuit (vérifié juin 2026) : llama-3.1-8b-instant = 30 RPM, 14 400 requêtes/jour, 6 000 TPM, 500 000 TPD ; llama-3.3-70b-versatile = 30 RPM, 1 000 requêtes/jour, 12 000 TPM, 100 000 TPD. Les limites sont par organisation et par modèle ; les grands modèles ont des quotas de tokens plus bas.

Authentification

Clé API

URL de base

https://api.groq.com/openai/v1

Ce que vous pourriez construire avec

  • Boucles d'agents à faible latence et appels d'outils où la vitesse aller-retour est primordiale
  • Chat en temps réel ou automatisations vocales nécessitant un streaming de tokens sous la seconde
  • Transcription Whisper pour des pipelines d'ingestion audio sur le niveau gratuit
  • Classification en batch à haut débit dans le budget journalier de tokens

Endpoints clés

  • POST/chat/completionsComplétion de chat compatible OpenAI (streaming pris en charge)
  • POST/audio/transcriptionsTranscription speech-to-text basée sur Whisper
  • GET/modelsLister les modèles disponibles et leurs métadonnées
Membres

Les membres accèdent à la recette exécutable

Inscrivez-vous gratuitement pour copier l'exemple de requête, voir une réponse type et lire les pièges à éviter.

Tags

llminferenceopenai-compatiblelow-latencyopen-weights