Açık KaynakYerel83k
llama.cpp
Kuantizasyonlu saf C/C++ LLM çıkarımı; neredeyse her yerde çalışır.
llama.cpp, CPU'lar ve geniş bir GPU yelpazesi dahil olmak üzere sıradan donanımda LLM'leri verimli biçimde çalıştırmak için geliştirilmiş bir C/C++ çıkarım motorudur. Büyük modellerin tüketici makinelerinde çalışmasını sağlayan GGUF model formatını ve agresif kuantizasyonu (ör. 4-bit, 5-bit) öncüledi; pek çok üst düzey yerel LLM aracının temelini oluşturur. Bir CLI, OpenAI uyumlu API'ye sahip bir sunucu ve ekosistemde yaygın kullanılan bağlamalar sunar.
Depo
ggml-org/llama.cppDil
C++Bununla neler kurabilirsin
- Daha ağır framework'lerin sığmayacağı CPU'larda veya mütevazı GPU'larda kuantize GGUF modellerini çalıştırma
- Düşük seviyeli LLM çıkarımını doğrudan C/C++ veya edge uygulamalarına gömme
- Uygulama entegrasyonu için yerleşik OpenAI uyumlu sunucu aracılığıyla yerel modelleri sunma
Etiketler
inferencequantizationcpu