Alle Open Source
Open SourceSprache & Medien12k

F5-TTS

Flow-Matching-Zero-Shot-Voice-Cloning-TTS, das aus einem kurzen Referenz-Clip flüssige Sprache erzeugt.

F5-TTS ist ein nicht-autoregressives Text-to-Speech-Modell auf Basis von Flow Matching mit Diffusion Transformers, das natürliche, flüssige Sprache und Zero-Shot-Voice-Cloning aus wenigen Sekunden Referenzaudio erzeugt. Es ist bekannt für hohe Qualität und Geschwindigkeit ohne Phonem-Alignment oder ein separates Dauernmodell und unterstützt mehrsprachige sowie code-geswitchte Synthese.

Repository

SWivid/F5-TTS

Sprache

Python

Was du damit bauen kannst

  • Eine Stimme aus einem kurzen Referenz-Clip klonen, um Inhalte zu vertonen oder eine Markenstimme aufzubauen
  • Ausdrucksstarke, mehrsprachige Sprache für Synchronisierungen, Hörbücher oder Charaktere generieren
  • Einen Zero-Shot-TTS-Endpunkt selbst hosten und in eine Voice-Agent- oder Medienpipeline einbinden

Tags

ttsvoice-cloningflow-matchingzero-shot