Todo el código abierto
Código abiertoLocal83k

llama.cpp

Inferencia LLM en C/C++ puro con cuantización; funciona casi en cualquier parte.

llama.cpp es un motor de inferencia en C/C++ para ejecutar LLMs de forma eficiente en hardware convencional, incluidas CPUs y una amplia variedad de GPUs. Fue pionero en el formato de modelos GGUF y en la cuantización agresiva (por ejemplo, 4 bits, 5 bits) que permite ejecutar grandes modelos en máquinas de consumo, y sirve de base a muchas herramientas de LLM local de nivel superior. Incluye una CLI, un servidor con API compatible con OpenAI y bindings utilizados en todo el ecosistema.

Repositorio

ggml-org/llama.cpp

Lenguaje

C++

Lo que construirías con esto

  • Ejecutar modelos GGUF cuantizados en CPU o GPUs modestas donde frameworks más pesados no caben
  • Integrar inferencia LLM de bajo nivel directamente en aplicaciones C/C++ o de borde
  • Servir modelos locales a través de su servidor integrado compatible con OpenAI para integración en aplicaciones

Etiquetas

inferencequantizationcpu