Tutto l'open source
Open SourceVoce e media12k

F5-TTS

TTS con voice cloning zero-shot basato su flow matching che genera parlato fluente da un breve clip di riferimento.

F5-TTS è un modello text-to-speech non autoregressivo basato su flow matching con diffusion transformer, che produce parlato naturale e fluente con voice cloning zero-shot a partire da pochi secondi di audio di riferimento. È apprezzato per la qualità e la velocità elevate senza allineamento fonemico né un modello di durata separato, e supporta la sintesi multilingue e code-switched.

Repository

SWivid/F5-TTS

Linguaggio

Python

Cosa ci costruiresti

  • Clonare una voce da un breve clip di riferimento per narrare contenuti o creare una voce brandizzata
  • Generare parlato espressivo e multilingue per doppiaggio, audiolibri o personaggi
  • Ospitare autonomamente un endpoint TTS zero-shot all'interno di un pipeline di voice agent o media

Tag

ttsvoice-cloningflow-matchingzero-shot