Open SourceLokaal83k
llama.cpp
Pure C/C++ LLM-inferentie met kwantisatie; draait op vrijwel elke hardware.
llama.cpp is een C/C++-inferentie-engine voor het efficiënt uitvoeren van LLMs op gangbare hardware, inclusief CPU's en een breed scala aan GPU's. Het introduceerde het GGUF-modelformaat en agressieve kwantisatie (bijv. 4-bit, 5-bit) waardoor grote modellen op consumentenmachines kunnen draaien, en vormt de basis voor veel hogere-niveau lokale LLM-tools. Het bevat een CLI, een server met een OpenAI-compatibele API en bindings die breed in het ecosysteem worden gebruikt.
Opslagplaats
ggml-org/llama.cppTaal
C++Wat je ermee zou bouwen
- Gekwantiseerde GGUF-modellen uitvoeren op CPU of bescheiden GPU's waar zwaardere frameworks niet op passen
- Laagniveau LLM-inferentie direct inbedden in C/C++- of edge-applicaties
- Lokale modellen serveren via de ingebouwde OpenAI-compatibele server voor app-integratie
Tags
inferencequantizationcpu