Alle Open Source
Open SourceSprache & Medien55k

Real-Time Voice Cloning

Eine Stimme aus fünf Sekunden Audio klonen und beliebige Sprache in Echtzeit synthetisieren.

Real-Time Voice Cloning ist eine viel beachtete Implementierung des SV2TTS-Frameworks, das eine Stimme aus ca. fünf Sekunden Referenzaudio klont und damit neue Sprache generiert. Es verkettet einen Speaker Encoder, einen Tacotron-Synthesizer und einen Vocoder und bleibt eine populäre Referenz zum Verständnis der Encoder-Synthesizer-Vocoder-TTS-Architektur.

Repository

CorentinJ/Real-Time-Voice-Cloning

Sprache

Python

Was du damit bauen kannst

  • Few-Shot-Voice-Cloning prototypisch umsetzen, um die Encoder/Synthesizer/Vocoder-Pipeline zu erlernen
  • Beispiel-Sprache in einer Zielstimme für Demos und Experimente generieren
  • Eine SV2TTS-Referenzimplementierung für individuelle Stimmprojekte studieren und anpassen

Tags

ttsvoice-cloningfew-shotsv2tts