Tutte le API gratuite
API gratuitaLLMChiave APIUfficiale

Groq API

L'inferenza di modelli open più veloce in circolazione, gratuita senza carta di credito

Groq esegue LLM open-weight (Llama 3.x, gpt-oss, Qwen) su hardware LPU personalizzato con token-per-second molto elevati. La console sviluppatori rilascia una chiave API gratuita senza carta, e l'API è compatibile con OpenAI, quindi il codice esistente funziona cambiando solo il base URL.

Piano gratuito

Tier Developer gratuito, nessuna carta di credito. Limiti giornalieri e per minuto per modello; effettua l'upgrade per limiti più elevati e sconti sull'utilizzo.

Limiti di frequenza

Tier gratuito (verificato giugno 2026): llama-3.1-8b-instant = 30 RPM, 14.400 req/giorno, 6.000 TPM, 500.000 TPD; llama-3.3-70b-versatile = 30 RPM, 1.000 req/giorno, 12.000 TPM, 100.000 TPD. I limiti sono per organizzazione e per modello; i modelli più grandi hanno limiti di token inferiori.

Autenticazione

Chiave API

URL base

https://api.groq.com/openai/v1

Cosa puoi costruirci

  • Loop di agenti a bassa latenza e tool-calling in cui la velocità round-trip è importante
  • Automazioni di chat o voce in tempo reale che necessitano di streaming di token sub-secondo
  • Trascrizione Whisper per pipeline di ingestione audio sul tier gratuito
  • Classificazione batch ad alto throughput entro il budget giornaliero di token

Endpoint principali

  • POST/chat/completionsChat completion compatibile con OpenAI (streaming supportato)
  • POST/audio/transcriptionsTrascrizione speech-to-text basata su Whisper
  • GET/modelsElenca i modelli disponibili e i metadati
Membri

I membri ottengono la ricetta eseguibile

Accedi gratuitamente per copiare la richiesta di esempio, vedere una risposta di esempio e leggere le insidie.

Tag

llminferenceopenai-compatiblelow-latencyopen-weights