Kostenlose APILLMAPI-SchlüsselOffiziell
Groq API
Schnellste Open-Model-Inferenz am Markt, kostenlos ohne Kreditkarte
Groq betreibt Open-Weight-LLMs (Llama 3.x, gpt-oss, Qwen) auf seiner LPU-Hardware mit sehr hohem Tokens-per-Second-Durchsatz. Die Entwicklerkonsole stellt einen kostenlosen API-Key ohne Kreditkarte aus, und die API ist OpenAI-kompatibel, sodass bestehender SDK-Code durch Änderung der Base-URL funktioniert.
Free Tier
Kostenloser Developer-Tarif, keine Kreditkarte. Tägliche und minutenbasierte Limits pro Modell; Upgrade für höhere Limits und Nutzungsrabatte.Ratenlimits
Kostenloser Tarif (Stand Juni 2026): llama-3.1-8b-instant = 30 RPM, 14.400 Anfragen/Tag, 6.000 TPM, 500.000 TPD; llama-3.3-70b-versatile = 30 RPM, 1.000 Anfragen/Tag, 12.000 TPM, 100.000 TPD. Limits gelten pro Organisation und pro Modell; größere Modelle haben niedrigere Token-Caps.Auth
API-SchlüsselBasis-URL
https://api.groq.com/openai/v1Was du damit bauen kannst
- Latenz-sensitive Agent-Loops und Tool-Calling, bei denen die Round-Trip-Geschwindigkeit entscheidend ist
- Echtzeit-Chat oder Sprachautomationen mit Sub-Sekunden-Token-Streaming
- Whisper-Transkription für Audio-Ingest-Pipelines im kostenlosen Tarif
- Hochdurchsatz-Batch-Klassifizierung innerhalb des täglichen Token-Budgets
Wichtige Endpunkte
- POST
/chat/completionsOpenAI-kompatibler Chat-Completion-Endpunkt (Streaming unterstützt) - POST
/audio/transcriptionsWhisper-basierte Speech-to-Text-Transkription - GET
/modelsVerfügbare Modelle und Metadaten auflisten
Mitglieder
Mitglieder erhalten das ausführbare Rezept
Melde dich kostenlos an, um die Beispielanfrage zu kopieren, eine Beispielantwort zu sehen und die Stolperfallen zu lesen.
Tags
llminferenceopenai-compatiblelow-latencyopen-weights