Öppen källkodLokalt83k
llama.cpp
LLM-inferens i C/C++ med kvantisering; körs nästan överallt.
llama.cpp är en inferensmotor i C/C++ för att köra LLM:er effektivt på konsumenthårdvara, inklusive CPU:er och ett brett urval GPU:er. Den banade väg för GGUF-modellformatet och aggressiv kvantisering (t.ex. 4-bitars, 5-bitars) som låter stora modeller köras på konsumentdatorer, och är grunden för många verktyg för lokal LLM på högre nivå. Den levereras med ett CLI, en server med ett OpenAI-kompatibelt API och bindningar som används i hela ekosystemet.
Kodförråd
ggml-org/llama.cppSpråk
C++Vad du kan bygga med det
- Köra kvantiserade GGUF-modeller på CPU eller blygsamma GPU:er där tyngre ramverk inte ryms
- Bädda in LLM-inferens på låg nivå direkt i C/C++- eller edge-applikationer
- Servera lokala modeller via den inbyggda OpenAI-kompatibla servern för appintegration
Taggar
inferencequantizationcpu