Tout l'open source
Open SourceVoix et médias12k

F5-TTS

Modèle TTS zero-shot de clonage vocal par flow matching qui produit une parole fluide à partir d'un court clip de référence.

F5-TTS est un modèle de synthèse vocale non autorégressif basé sur le flow matching avec des transformers de diffusion, produisant une parole naturelle et fluide ainsi qu'un clonage vocal zero-shot à partir de quelques secondes d'audio de référence. Il se distingue par sa qualité et sa rapidité sans alignement phonémique ni modèle de durée séparé, et supporte la synthèse multilingue et le code-switching.

Dépôt

SWivid/F5-TTS

Langage

Python

Ce que vous pourriez construire avec

  • Cloner une voix à partir d'un court clip de référence pour narrer du contenu ou créer une voix de marque
  • Générer une parole expressive et multilingue pour le doublage, les livres audio ou des personnages
  • Auto-héberger un endpoint TTS zero-shot dans un agent vocal ou un pipeline média

Tags

ttsvoice-cloningflow-matchingzero-shot