Open SourceSprache & Medien12k
F5-TTS
Flow-Matching-Zero-Shot-Voice-Cloning-TTS, das aus einem kurzen Referenz-Clip flüssige Sprache erzeugt.
F5-TTS ist ein nicht-autoregressives Text-to-Speech-Modell auf Basis von Flow Matching mit Diffusion Transformers, das natürliche, flüssige Sprache und Zero-Shot-Voice-Cloning aus wenigen Sekunden Referenzaudio erzeugt. Es ist bekannt für hohe Qualität und Geschwindigkeit ohne Phonem-Alignment oder ein separates Dauernmodell und unterstützt mehrsprachige sowie code-geswitchte Synthese.
Repository
SWivid/F5-TTSSprache
PythonWas du damit bauen kannst
- Eine Stimme aus einem kurzen Referenz-Clip klonen, um Inhalte zu vertonen oder eine Markenstimme aufzubauen
- Ausdrucksstarke, mehrsprachige Sprache für Synchronisierungen, Hörbücher oder Charaktere generieren
- Einen Zero-Shot-TTS-Endpunkt selbst hosten und in eine Voice-Agent- oder Medienpipeline einbinden
Tags
ttsvoice-cloningflow-matchingzero-shot