Open SourceLocal83k
llama.cpp
Inférence LLM en C/C++ pur avec quantification ; tourne presque partout.
llama.cpp est un moteur d'inférence en C/C++ pour exécuter des LLM efficacement sur du matériel grand public, y compris des CPU et une large gamme de GPU. Il a été pionnier du format de modèle GGUF et d'une quantification agressive (par exemple 4 bits, 5 bits) permettant de faire tourner de grands modèles sur des machines de consommateurs, et il sous-tend de nombreux outils LLM locaux de plus haut niveau. Il embarque un CLI, un serveur avec une API compatible OpenAI, ainsi que des bindings utilisés dans tout l'écosystème.
Dépôt
ggml-org/llama.cppLangage
C++Ce que vous pourriez construire avec
- Exécuter des modèles GGUF quantifiés sur CPU ou des GPU modestes où les frameworks plus lourds ne tiendraient pas
- Intégrer l'inférence LLM bas niveau directement dans des applications C/C++ ou edge
- Servir des modèles locaux via son serveur intégré compatible OpenAI pour l'intégration applicative
Tags
inferencequantizationcpu