Tutto l'open source
Open SourceVoce e media55k

Real-Time Voice Cloning

Clona una voce da cinque secondi di audio e sintetizza parlato arbitrario in tempo reale.

Real-Time Voice Cloning è un'implementazione ampiamente studiata del framework SV2TTS, che clona una voce da circa cinque secondi di audio di riferimento e genera nuovo parlato con essa. Concatena un encoder del parlante, un sintetizzatore Tacotron e un vocoder, ed è ancora oggi un riferimento popolare per comprendere l'architettura TTS encoder-sintetizzatore-vocoder.

Repository

CorentinJ/Real-Time-Voice-Cloning

Linguaggio

Python

Cosa ci costruiresti

  • Prototipare la clonazione vocale few-shot per apprendere il pipeline encoder/sintetizzatore/vocoder
  • Generare parlato campione in una voce target per demo ed esperimenti
  • Studiare e adattare un'implementazione SV2TTS di riferimento per lavori vocali personalizzati

Tag

ttsvoice-cloningfew-shotsv2tts