Tüm açık kaynaklar
Açık KaynakYerel83k

llama.cpp

Kuantizasyonlu saf C/C++ LLM çıkarımı; neredeyse her yerde çalışır.

llama.cpp, CPU'lar ve geniş bir GPU yelpazesi dahil olmak üzere sıradan donanımda LLM'leri verimli biçimde çalıştırmak için geliştirilmiş bir C/C++ çıkarım motorudur. Büyük modellerin tüketici makinelerinde çalışmasını sağlayan GGUF model formatını ve agresif kuantizasyonu (ör. 4-bit, 5-bit) öncüledi; pek çok üst düzey yerel LLM aracının temelini oluşturur. Bir CLI, OpenAI uyumlu API'ye sahip bir sunucu ve ekosistemde yaygın kullanılan bağlamalar sunar.

Depo

ggml-org/llama.cpp

Dil

C++

Bununla neler kurabilirsin

  • Daha ağır framework'lerin sığmayacağı CPU'larda veya mütevazı GPU'larda kuantize GGUF modellerini çalıştırma
  • Düşük seviyeli LLM çıkarımını doğrudan C/C++ veya edge uygulamalarına gömme
  • Uygulama entegrasyonu için yerleşik OpenAI uyumlu sunucu aracılığıyla yerel modelleri sunma

Etiketler

inferencequantizationcpu