Åpen kildekodeLokal83k
llama.cpp
Ren C/C++ LLM-inferens med kvantisering; kjører nesten hvor som helst.
llama.cpp er en C/C++-inferensmotor for å kjøre LLM-er effektivt på vanlig maskinvare, inkludert CPU-er og et bredt spekter av GPU-er. Det var banebrytende for GGUF-modellformatet og aggressiv kvantisering (f.eks. 4-bit, 5-bit) som lar store modeller kjøre på forbrukermaskiner, og det er grunnlaget for mange høyere nivå lokale LLM-verktøy. Det leveres med et CLI, en server med OpenAI-kompatibelt API og bindinger som brukes på tvers av økosystemet.
Kodelager
ggml-org/llama.cppSpråk
C++Det du kan bygge med den
- Kjøre kvantiserte GGUF-modeller på CPU eller beskjedne GPU-er der tyngre rammeverk ikke passer
- Bygge inn lavnivå LLM-inferens direkte i C/C++- eller edge-applikasjoner
- Serve lokale modeller via den innebygde OpenAI-kompatible serveren for appintegrasjon
Tagger
inferencequantizationcpu