All åpen kildekode
Åpen kildekodeLyd og media12k

F5-TTS

Flyt-matchende zero-shot stemmekopiering TTS som produserer flytende tale fra en kort referanseklipp.

F5-TTS er en ikke-autoregresiv tekst-til-tale-modell basert på flyt-matching med diffusjonstransformere, som produserer naturlig, flytende tale og zero-shot stemmekopiering fra noen sekunders referanseaudio. Det er kjent for høy kvalitet og hastighet uten fonemjustering eller en separat varighetsmodell, og støtter flerspråklig og kodevekslet syntese.

Kodelager

SWivid/F5-TTS

Språk

Python

Det du kan bygge med den

  • Kopier en stemme fra en kort referanseklipp for å fortelle innhold eller bygge en merkevarestemme
  • Generer uttrykksfull, flerspråklig tale for dubbing, lydbøker eller karakterer
  • Selvdriv et zero-shot TTS-endepunkt inne i en stemmeagent eller mediepipeline

Tagger

ttsvoice-cloningflow-matchingzero-shot