Açık KaynakSes ve Medya12k
F5-TTS
Kısa bir referans klibinden akıcı konuşma sentezleyen akış eşleştirmeli sıfır atışlı ses klonlama TTS.
F5-TTS, difüzyon transformerleri ile akış eşleştirmeye dayalı otoregresif olmayan bir metinden sese modelidir; birkaç saniyelik referans sesinden doğal ve akıcı konuşma ile sıfır atışlı ses klonlama üretir. Fonem hizalaması veya ayrı bir süre modeli gerektirmeksizin yüksek kalite ve hız sunmasıyla öne çıkar; çok dilli ve kod anahtarlamalı sentezi de destekler.
Depo
SWivid/F5-TTSDil
PythonBununla neler kurabilirsin
- Kısa bir referans klibinden ses klonlayarak içerik seslendirmek veya markalı bir ses oluşturmak
- Dublaj, sesli kitap veya karakterler için etkileyici çok dilli konuşma üretmek
- Bir sesli ajan ya da medya pipeline'ı içinde kendi barındırdığı sıfır atışlı bir TTS uç noktası kurmak
Etiketler
ttsvoice-cloningflow-matchingzero-shot