Tutto l'open source
Open SourceVoce e media55k

Real-Time Voice Cloning

Cloner une voix à partir de cinq secondes d'audio et synthétiser un discours arbitraire en temps réel.

Real-Time Voice Cloning est une implémentation largement étudiée du framework SV2TTS, clonant une voix à partir d'environ cinq secondes d'audio de référence et générant de nouveaux discours avec cette voix. Il enchaîne un encodeur de locuteur, un synthétiseur Tacotron et un vocodeur, et reste une référence populaire pour comprendre l'architecture TTS encodeur-synthétiseur-vocodeur.

Repository

CorentinJ/Real-Time-Voice-Cloning

Linguaggio

Python

Cosa ci costruiresti

  • Prototyper le clonage vocal few-shot pour apprendre le pipeline encodeur/synthétiseur/vocodeur
  • Générer des exemples de parole dans une voix cible pour des démonstrations et expérimentations
  • Étudier et adapter une implémentation SV2TTS de référence pour des travaux vocaux personnalisés

Tag

ttsvoice-cloningfew-shotsv2tts