Åpen kildekodeLyd og media12k
F5-TTS
Flyt-matchende zero-shot stemmekopiering TTS som produserer flytende tale fra en kort referanseklipp.
F5-TTS er en ikke-autoregresiv tekst-til-tale-modell basert på flyt-matching med diffusjonstransformere, som produserer naturlig, flytende tale og zero-shot stemmekopiering fra noen sekunders referanseaudio. Det er kjent for høy kvalitet og hastighet uten fonemjustering eller en separat varighetsmodell, og støtter flerspråklig og kodevekslet syntese.
Kodelager
SWivid/F5-TTSSpråk
PythonDet du kan bygge med den
- Kopier en stemme fra en kort referanseklipp for å fortelle innhold eller bygge en merkevarestemme
- Generer uttrykksfull, flerspråklig tale for dubbing, lydbøker eller karakterer
- Selvdriv et zero-shot TTS-endepunkt inne i en stemmeagent eller mediepipeline
Tagger
ttsvoice-cloningflow-matchingzero-shot