Alle open source
Open SourceSpraak & Media12k

F5-TTS

Flyt-matchende zero-shot stemmekopiering TTS som produserer flytende tale fra en kort referanseklipp.

F5-TTS er en ikke-autoregresiv tekst-til-tale-modell basert på flyt-matching med diffusjonstransformere, som produserer naturlig, flytende tale og zero-shot stemmekopiering fra noen sekunders referanseaudio. Det er kjent for høy kvalitet og hastighet uten fonemjustering eller en separat varighetsmodell, og støtter flerspråklig og kodevekslet syntese.

Opslagplaats

SWivid/F5-TTS

Taal

Python

Wat je ermee zou bouwen

  • Kopier en stemme fra en kort referanseklipp for å fortelle innhold eller bygge en merkevarestemme
  • Generer uttrykksfull, flerspråklig tale for dubbing, lydbøker eller karakterer
  • Selvdriv et zero-shot TTS-endepunkt inne i en stemmeagent eller mediepipeline

Tags

ttsvoice-cloningflow-matchingzero-shot