API gratuiteLLMClé APIOfficiel
Cerebras Inference
Puces wafer-scale servant des modèles open source à une cadence extrême de tokens par seconde, niveau gratuit
Cerebras Inference exécute des modèles open-weight (gpt-oss-120b, GLM, Llama, Qwen) sur son matériel wafer-scale, offrant parmi les meilleurs débits disponibles. Un niveau gratuit est accessible sans carte bancaire via cloud.cerebras.ai, exposant un endpoint de complétion de chat compatible OpenAI.
Palier gratuit
Niveau gratuit, aucune carte bancaire requise. Quota journalier de tokens plafonné ; les niveaux payants relèvent les limites.Limites de débit
Niveau gratuit (vérifié juin 2026) : 5 RPM, 30 000 tokens/min, 1 000 000 tokens/jour par modèle. Le catalogue de modèles gratuits a inclus gpt-oss-120b et zai-glm-4.7. Une fenêtre de contexte réduite peut s'appliquer à certains modèles gratuits. Consultez la page Limits de votre compte pour les valeurs actuelles.Authentification
Clé APIURL de base
https://api.cerebras.ai/v1Ce que vous pourriez construire avec
- Démos sensibles à la latence où la vitesse brute de génération est le facteur impressionnant
- Étapes d'automatisation en rafale qui tiennent dans le budget de 1M tokens/jour
- Comparaison des modèles open source en termes de débit
- Tâches de raisonnement intensif en shot unique où des sorties longues et rapides sont un atout
Endpoints clés
- POST
/chat/completionsComplétion de chat compatible OpenAI (streaming pris en charge) - POST
/completionsComplétion de texte - GET
/modelsLister les modèles disponibles sur votre compte
Membres
Les membres accèdent à la recette exécutable
Inscrivez-vous gratuitement pour copier l'exemple de requête, voir une réponse type et lire les pièges à éviter.
Tags
llminferenceopenai-compatiblehigh-throughputopen-weights