Open SourceLokal83k
llama.cpp
LLM-Inferenz in purem C/C++ mit Quantisierung; läuft nahezu überall.
llama.cpp ist eine C/C++-Inferenz-Engine zum effizienten Ausführen von LLMs auf handelsüblicher Hardware, einschließlich CPUs und einer breiten Palette von GPUs. Es hat das GGUF-Modellformat und aggressive Quantisierung (z. B. 4-Bit, 5-Bit) geprägt, die es ermöglicht, große Modelle auf Consumer-Maschinen auszuführen, und bildet die Grundlage vieler übergeordneter lokaler LLM-Tools. Es enthält eine CLI, einen Server mit OpenAI-kompatibler API und Bindings, die im gesamten Ökosystem verwendet werden.
Repository
ggml-org/llama.cppSprache
C++Was du damit bauen kannst
- Ausführen quantisierter GGUF-Modelle auf CPUs oder bescheidenen GPUs, wo schwergewichtigere Frameworks nicht passen
- Einbetten von Low-Level-LLM-Inferenz direkt in C/C++- oder Edge-Anwendungen
- Bereitstellen lokaler Modelle über den integrierten OpenAI-kompatiblen Server zur App-Integration
Tags
inferencequantizationcpu