Todo el código abierto
Código abiertoVoz y medios12k

F5-TTS

TTS de clonación de voz zero-shot basado en flow matching que genera habla fluida a partir de un clip de referencia breve.

F5-TTS es un modelo de síntesis de voz no autorregresivo basado en flow matching con transformers de difusión, que produce habla natural y fluida y clonación de voz zero-shot a partir de unos pocos segundos de audio de referencia. Destaca por su calidad y velocidad sin necesidad de alineación fonémica ni un modelo de duración separado, y admite síntesis multilingüe y con mezcla de idiomas.

Repositorio

SWivid/F5-TTS

Lenguaje

Python

Lo que construirías con esto

  • Clonar una voz a partir de un clip de referencia breve para narrar contenido o crear una voz de marca
  • Generar habla expresiva y multilingüe para doblaje, audiolibros o personajes
  • Autoalojar un endpoint TTS zero-shot dentro de un agente de voz o pipeline de medios

Etiquetas

ttsvoice-cloningflow-matchingzero-shot