Código abiertoVoz y medios12k
F5-TTS
TTS de clonación de voz zero-shot basado en flow matching que genera habla fluida a partir de un clip de referencia breve.
F5-TTS es un modelo de síntesis de voz no autorregresivo basado en flow matching con transformers de difusión, que produce habla natural y fluida y clonación de voz zero-shot a partir de unos pocos segundos de audio de referencia. Destaca por su calidad y velocidad sin necesidad de alineación fonémica ni un modelo de duración separado, y admite síntesis multilingüe y con mezcla de idiomas.
Repositorio
SWivid/F5-TTSLenguaje
PythonLo que construirías con esto
- Clonar una voz a partir de un clip de referencia breve para narrar contenido o crear una voz de marca
- Generar habla expresiva y multilingüe para doblaje, audiolibros o personajes
- Autoalojar un endpoint TTS zero-shot dentro de un agente de voz o pipeline de medios
Etiquetas
ttsvoice-cloningflow-matchingzero-shot