Toutes les API gratuites
API gratuiteLLMClé APIOfficiel

GitHub Models

Modèles frontier et open source gratuitement avec seulement votre token GitHub

GitHub Models offre à chaque compte GitHub une inférence gratuite soumise à des limites de débit sur un catalogue de modèles (famille OpenAI GPT, Llama, Mistral, Phi, et plus) via un endpoint compatible OpenAI. L'authentification se fait avec un personal access token GitHub ayant la portée models:read ; aucune facturation ou carte séparée n'est requise pour l'usage gratuit.

Palier gratuit

Gratuit pour l'expérimentation, lié à votre compte GitHub (sans carte). Optez pour un usage payant pour des limites de niveau production et un contexte plus large.

Limites de débit

Gratuit, par compte, varie selon le niveau de modèle (vérifié juin 2026, Copilot Free) : modèles haut de gamme 10 RPM / 50 requêtes/jour ; modèles bas de gamme 15 RPM / 150 requêtes/jour ; embeddings 15 RPM / 150 RPD. Des limites de tokens par requête s'appliquent (ex. 8 000 en entrée / 4 000 en sortie sur les modèles bas de gamme). Limites susceptibles de changer.

Authentification

Clé API

URL de base

https://models.github.ai/inference

Ce que vous pourriez construire avec

  • Prototyper avec des modèles GPT et open source en utilisant le token GitHub que vous possédez déjà
  • Étapes CI/automatisation dans GitHub Actions qui appellent un modèle avec le token intégré
  • Embeddings bon marché pour un proof-of-concept RAG rapide
  • Un fournisseur de secours gratuit pour un Claude Skill multi-modèles

Endpoints clés

  • POST/chat/completionsComplétion de chat compatible OpenAI sur les modèles du catalogue
  • POST/embeddingsGénérer des embeddings de texte
  • GET/catalog/modelsLister les modèles disponibles dans le catalogue
Membres

Les membres accèdent à la recette exécutable

Inscrivez-vous gratuitement pour copier l'exemple de requête, voir une réponse type et lire les pièges à éviter.

Tags

llminferenceopenai-compatiblegithubembeddings