Alle open source
Open SourceLokaal83k

llama.cpp

Pure C/C++ LLM-inferentie met kwantisatie; draait op vrijwel elke hardware.

llama.cpp is een C/C++-inferentie-engine voor het efficiënt uitvoeren van LLMs op gangbare hardware, inclusief CPU's en een breed scala aan GPU's. Het introduceerde het GGUF-modelformaat en agressieve kwantisatie (bijv. 4-bit, 5-bit) waardoor grote modellen op consumentenmachines kunnen draaien, en vormt de basis voor veel hogere-niveau lokale LLM-tools. Het bevat een CLI, een server met een OpenAI-compatibele API en bindings die breed in het ecosysteem worden gebruikt.

Opslagplaats

ggml-org/llama.cpp

Taal

C++

Wat je ermee zou bouwen

  • Gekwantiseerde GGUF-modellen uitvoeren op CPU of bescheiden GPU's waar zwaardere frameworks niet op passen
  • Laagniveau LLM-inferentie direct inbedden in C/C++- of edge-applicaties
  • Lokale modellen serveren via de ingebouwde OpenAI-compatibele server voor app-integratie

Tags

inferencequantizationcpu