All öppen källkod
Öppen källkodRöst och media12k

F5-TTS

Flow-matching-baserad zero-shot röstkloning-TTS som genererar flytande tal från ett kort referensklipp.

F5-TTS är en icke-autoregressiv text-till-tal-modell baserad på flow matching med diffusionstransformatorer, som producerar naturligt, flytande tal och zero-shot röstkloning från några sekunders referensljud. Den är känd för hög kvalitet och hastighet utan fonemjustering eller en separat längdmodell, och stöder flerspråkig och code-switched syntes.

Kodförråd

SWivid/F5-TTS

Språk

Python

Vad du kan bygga med det

  • Klona en röst från ett kort referensklipp för att berätta innehåll eller bygga en varumärkesröst
  • Generera uttrycksfullt, flerspråkigt tal för dubning, ljudböcker eller karaktärer
  • Egenhosta en zero-shot TTS-endpoint i en röst-agent- eller mediapipeline

Taggar

ttsvoice-cloningflow-matchingzero-shot