Alle open source
Open SourceSpraak & Media12k

F5-TTS

Flow-matching zero-shot voice cloning TTS die vloeiende spraak genereert uit een korte referentieclip.

F5-TTS is een niet-autoregressief tekst-naar-spraak-model op basis van flow matching met diffusion transformers, dat natuurlijke, vloeiende spraak en zero-shot voice cloning produceert uit een paar seconden referentieaudio. Het is bekend om zijn sterke kwaliteit en snelheid zonder fonemuitlijning of een afzonderlijk duurmodel, en ondersteunt meertalige en code-switched synthese.

Opslagplaats

SWivid/F5-TTS

Taal

Python

Wat je ermee zou bouwen

  • Kloon een stem uit een korte referentieclip om content te vertellen of een merkgebonden stem te bouwen
  • Genereer expressieve, meertalige spraak voor nasynchronisatie, luisterboeken of personages
  • Host zelf een zero-shot TTS-endpoint binnen een spraakagent- of mediapipeline

Tags

ttsvoice-cloningflow-matchingzero-shot