Open SourceVoce e media12k
F5-TTS
TTS con voice cloning zero-shot basato su flow matching che genera parlato fluente da un breve clip di riferimento.
F5-TTS è un modello text-to-speech non autoregressivo basato su flow matching con diffusion transformer, che produce parlato naturale e fluente con voice cloning zero-shot a partire da pochi secondi di audio di riferimento. È apprezzato per la qualità e la velocità elevate senza allineamento fonemico né un modello di durata separato, e supporta la sintesi multilingue e code-switched.
Repository
SWivid/F5-TTSLinguaggio
PythonCosa ci costruiresti
- Clonare una voce da un breve clip di riferimento per narrare contenuti o creare una voce brandizzata
- Generare parlato espressivo e multilingue per doppiaggio, audiolibri o personaggi
- Ospitare autonomamente un endpoint TTS zero-shot all'interno di un pipeline di voice agent o media
Tag
ttsvoice-cloningflow-matchingzero-shot