All öppen källkod
Öppen källkodLokalt83k

llama.cpp

LLM-inferens i C/C++ med kvantisering; körs nästan överallt.

llama.cpp är en inferensmotor i C/C++ för att köra LLM:er effektivt på konsumenthårdvara, inklusive CPU:er och ett brett urval GPU:er. Den banade väg för GGUF-modellformatet och aggressiv kvantisering (t.ex. 4-bitars, 5-bitars) som låter stora modeller köras på konsumentdatorer, och är grunden för många verktyg för lokal LLM på högre nivå. Den levereras med ett CLI, en server med ett OpenAI-kompatibelt API och bindningar som används i hela ekosystemet.

Kodförråd

ggml-org/llama.cpp

Språk

C++

Vad du kan bygga med det

  • Köra kvantiserade GGUF-modeller på CPU eller blygsamma GPU:er där tyngre ramverk inte ryms
  • Bädda in LLM-inferens på låg nivå direkt i C/C++- eller edge-applikationer
  • Servera lokala modeller via den inbyggda OpenAI-kompatibla servern för appintegration

Taggar

inferencequantizationcpu