Öppen källkodRöst och media12k
F5-TTS
Flow-matching-baserad zero-shot röstkloning-TTS som genererar flytande tal från ett kort referensklipp.
F5-TTS är en icke-autoregressiv text-till-tal-modell baserad på flow matching med diffusionstransformatorer, som producerar naturligt, flytande tal och zero-shot röstkloning från några sekunders referensljud. Den är känd för hög kvalitet och hastighet utan fonemjustering eller en separat längdmodell, och stöder flerspråkig och code-switched syntes.
Kodförråd
SWivid/F5-TTSSpråk
PythonVad du kan bygga med det
- Klona en röst från ett kort referensklipp för att berätta innehåll eller bygga en varumärkesröst
- Generera uttrycksfullt, flerspråkigt tal för dubning, ljudböcker eller karaktärer
- Egenhosta en zero-shot TTS-endpoint i en röst-agent- eller mediapipeline
Taggar
ttsvoice-cloningflow-matchingzero-shot