Open SourceSpraak & Media12k
F5-TTS
Flyt-matchende zero-shot stemmekopiering TTS som produserer flytende tale fra en kort referanseklipp.
F5-TTS er en ikke-autoregresiv tekst-til-tale-modell basert på flyt-matching med diffusjonstransformere, som produserer naturlig, flytende tale og zero-shot stemmekopiering fra noen sekunders referanseaudio. Det er kjent for høy kvalitet og hastighet uten fonemjustering eller en separat varighetsmodell, og støtter flerspråklig og kodevekslet syntese.
Opslagplaats
SWivid/F5-TTSTaal
PythonWat je ermee zou bouwen
- Kopier en stemme fra en kort referanseklipp for å fortelle innhold eller bygge en merkevarestemme
- Generer uttrykksfull, flerspråklig tale for dubbing, lydbøker eller karakterer
- Selvdriv et zero-shot TTS-endepunkt inne i en stemmeagent eller mediepipeline
Tags
ttsvoice-cloningflow-matchingzero-shot