All åpen kildekode
Åpen kildekodeLokal83k

llama.cpp

Ren C/C++ LLM-inferens med kvantisering; kjører nesten hvor som helst.

llama.cpp er en C/C++-inferensmotor for å kjøre LLM-er effektivt på vanlig maskinvare, inkludert CPU-er og et bredt spekter av GPU-er. Det var banebrytende for GGUF-modellformatet og aggressiv kvantisering (f.eks. 4-bit, 5-bit) som lar store modeller kjøre på forbrukermaskiner, og det er grunnlaget for mange høyere nivå lokale LLM-verktøy. Det leveres med et CLI, en server med OpenAI-kompatibelt API og bindinger som brukes på tvers av økosystemet.

Kodelager

ggml-org/llama.cpp

Språk

C++

Det du kan bygge med den

  • Kjøre kvantiserte GGUF-modeller på CPU eller beskjedne GPU-er der tyngre rammeverk ikke passer
  • Bygge inn lavnivå LLM-inferens direkte i C/C++- eller edge-applikasjoner
  • Serve lokale modeller via den innebygde OpenAI-kompatible serveren for appintegrasjon

Tagger

inferencequantizationcpu