Open SourceLocale83k
llama.cpp
Inferenza LLM in puro C/C++ con quantizzazione; gira praticamente ovunque.
llama.cpp è un motore di inferenza in C/C++ per eseguire LLM in modo efficiente su hardware commodity, incluse CPU e un'ampia gamma di GPU. Ha introdotto il formato GGUF e una quantizzazione aggressiva (es. 4-bit, 5-bit) che permette ai modelli di grandi dimensioni di girare su macchine consumer; è alla base di molti strumenti locali di alto livello per LLM. Include una CLI, un server con API compatibile con OpenAI e binding utilizzati in tutto l'ecosistema.
Repository
ggml-org/llama.cppLinguaggio
C++Cosa ci costruiresti
- Eseguire modelli GGUF quantizzati su CPU o GPU modeste dove i framework più pesanti non rientrano
- Incorporare l'inferenza LLM di basso livello direttamente in applicazioni C/C++ o edge
- Servire modelli locali tramite il server integrato compatibile con OpenAI per l'integrazione con le app
Tag
inferencequantizationcpu