Tutto l'open source
Open SourceLocale83k

llama.cpp

Inferenza LLM in puro C/C++ con quantizzazione; gira praticamente ovunque.

llama.cpp è un motore di inferenza in C/C++ per eseguire LLM in modo efficiente su hardware commodity, incluse CPU e un'ampia gamma di GPU. Ha introdotto il formato GGUF e una quantizzazione aggressiva (es. 4-bit, 5-bit) che permette ai modelli di grandi dimensioni di girare su macchine consumer; è alla base di molti strumenti locali di alto livello per LLM. Include una CLI, un server con API compatibile con OpenAI e binding utilizzati in tutto l'ecosistema.

Repository

ggml-org/llama.cpp

Linguaggio

C++

Cosa ci costruiresti

  • Eseguire modelli GGUF quantizzati su CPU o GPU modeste dove i framework più pesanti non rientrano
  • Incorporare l'inferenza LLM di basso livello direttamente in applicazioni C/C++ o edge
  • Servire modelli locali tramite il server integrato compatibile con OpenAI per l'integrazione con le app

Tag

inferencequantizationcpu