Alle Open Source
Open SourceLokal83k

llama.cpp

LLM-Inferenz in purem C/C++ mit Quantisierung; läuft nahezu überall.

llama.cpp ist eine C/C++-Inferenz-Engine zum effizienten Ausführen von LLMs auf handelsüblicher Hardware, einschließlich CPUs und einer breiten Palette von GPUs. Es hat das GGUF-Modellformat und aggressive Quantisierung (z. B. 4-Bit, 5-Bit) geprägt, die es ermöglicht, große Modelle auf Consumer-Maschinen auszuführen, und bildet die Grundlage vieler übergeordneter lokaler LLM-Tools. Es enthält eine CLI, einen Server mit OpenAI-kompatibler API und Bindings, die im gesamten Ökosystem verwendet werden.

Repository

ggml-org/llama.cpp

Sprache

C++

Was du damit bauen kannst

  • Ausführen quantisierter GGUF-Modelle auf CPUs oder bescheidenen GPUs, wo schwergewichtigere Frameworks nicht passen
  • Einbetten von Low-Level-LLM-Inferenz direkt in C/C++- oder Edge-Anwendungen
  • Bereitstellen lokaler Modelle über den integrierten OpenAI-kompatiblen Server zur App-Integration

Tags

inferencequantizationcpu