Open SourceSpraak & Media12k
F5-TTS
Flow-matching zero-shot voice cloning TTS die vloeiende spraak genereert uit een korte referentieclip.
F5-TTS is een niet-autoregressief tekst-naar-spraak-model op basis van flow matching met diffusion transformers, dat natuurlijke, vloeiende spraak en zero-shot voice cloning produceert uit een paar seconden referentieaudio. Het is bekend om zijn sterke kwaliteit en snelheid zonder fonemuitlijning of een afzonderlijk duurmodel, en ondersteunt meertalige en code-switched synthese.
Opslagplaats
SWivid/F5-TTSTaal
PythonWat je ermee zou bouwen
- Kloon een stem uit een korte referentieclip om content te vertellen of een merkgebonden stem te bouwen
- Genereer expressieve, meertalige spraak voor nasynchronisatie, luisterboeken of personages
- Host zelf een zero-shot TTS-endpoint binnen een spraakagent- of mediapipeline
Tags
ttsvoice-cloningflow-matchingzero-shot