Código abiertoLocal83k
llama.cpp
Inferencia LLM en C/C++ puro con cuantización; funciona casi en cualquier parte.
llama.cpp es un motor de inferencia en C/C++ para ejecutar LLMs de forma eficiente en hardware convencional, incluidas CPUs y una amplia variedad de GPUs. Fue pionero en el formato de modelos GGUF y en la cuantización agresiva (por ejemplo, 4 bits, 5 bits) que permite ejecutar grandes modelos en máquinas de consumo, y sirve de base a muchas herramientas de LLM local de nivel superior. Incluye una CLI, un servidor con API compatible con OpenAI y bindings utilizados en todo el ecosistema.
Repositorio
ggml-org/llama.cppLenguaje
C++Lo que construirías con esto
- Ejecutar modelos GGUF cuantizados en CPU o GPUs modestas donde frameworks más pesados no caben
- Integrar inferencia LLM de bajo nivel directamente en aplicaciones C/C++ o de borde
- Servir modelos locales a través de su servidor integrado compatible con OpenAI para integración en aplicaciones
Etiquetas
inferencequantizationcpu