Open SourceVoce e media55k
Real-Time Voice Cloning
Clona una voce da cinque secondi di audio e sintetizza parlato arbitrario in tempo reale.
Real-Time Voice Cloning è un'implementazione ampiamente studiata del framework SV2TTS, che clona una voce da circa cinque secondi di audio di riferimento e genera nuovo parlato con essa. Concatena un encoder del parlante, un sintetizzatore Tacotron e un vocoder, ed è ancora oggi un riferimento popolare per comprendere l'architettura TTS encoder-sintetizzatore-vocoder.
Repository
CorentinJ/Real-Time-Voice-CloningLinguaggio
PythonCosa ci costruiresti
- Prototipare la clonazione vocale few-shot per apprendere il pipeline encoder/sintetizzatore/vocoder
- Generare parlato campione in una voce target per demo ed esperimenti
- Studiare e adattare un'implementazione SV2TTS di riferimento per lavori vocali personalizzati
Tag
ttsvoice-cloningfew-shotsv2tts