Open SourceSprache & Medien55k
Real-Time Voice Cloning
Eine Stimme aus fünf Sekunden Audio klonen und beliebige Sprache in Echtzeit synthetisieren.
Real-Time Voice Cloning ist eine viel beachtete Implementierung des SV2TTS-Frameworks, das eine Stimme aus ca. fünf Sekunden Referenzaudio klont und damit neue Sprache generiert. Es verkettet einen Speaker Encoder, einen Tacotron-Synthesizer und einen Vocoder und bleibt eine populäre Referenz zum Verständnis der Encoder-Synthesizer-Vocoder-TTS-Architektur.
Repository
CorentinJ/Real-Time-Voice-CloningSprache
PythonWas du damit bauen kannst
- Few-Shot-Voice-Cloning prototypisch umsetzen, um die Encoder/Synthesizer/Vocoder-Pipeline zu erlernen
- Beispiel-Sprache in einer Zielstimme für Demos und Experimente generieren
- Eine SV2TTS-Referenzimplementierung für individuelle Stimmprojekte studieren und anpassen
Tags
ttsvoice-cloningfew-shotsv2tts