API gratuitaLLMChiave APIUfficiale
Cloudflare Workers AI
Esegui 40+ modelli open all'edge con un budget giornaliero gratuito di Neuron
Workers AI serve modelli open (Llama, Mistral, Qwen, embeddings, image, ASR) dall'edge di Cloudflare, richiamabile da un Worker o direttamente tramite REST API usando l'account ID e un API token. Il piano gratuito include un'allocazione giornaliera misurata in Neuron, un'unità di GPU compute.
Piano gratuito
Allocazione gratuita di 10.000 Neuron/giorno sul piano Workers Free (nessuna carta per iniziare). Sopra tale soglia, $0,011 per 1.000 Neuron su Workers Paid. Reset giornaliero alle 00:00 UTC.Limiti di frequenza
Throttled dal budget gratuito di 10.000 Neuron/giorno piuttosto che da un RPM fisso. I Neuron consumati per richiesta dipendono dal modello e dai token; una risposta di ~500 token con Llama 3 costa circa 400-600 Neuron.Autenticazione
Chiave APIURL base
https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/runCosa puoi costruirci
- Aggiungere inferenza a un edge Worker senza round-trip cold-start verso un provider separato
- Embeddings gratuiti + Vectorize per una piccola app RAG all'interno dello stack Cloudflare
- Trascrizione Whisper e modelli di immagini insieme al testo sulla stessa piattaforma
- Automazioni a volume ridotto comodamente entro i 10k Neuron/giorno
Endpoint principali
- POST
/@cf/meta/llama-3.1-8b-instructEsegui generazione di testo su Llama 3.1 8B - POST
/@cf/baai/bge-base-en-v1.5Genera embeddings di testo - POST
/@cf/openai/whisperTrascrizione speech-to-text
Membri
I membri ottengono la ricetta eseguibile
Accedi gratuitamente per copiare la richiesta di esempio, vedere una risposta di esempio e leggere le insidie.
Tag
llmedgeinferenceembeddingsopen-weights