Tüm açık kaynaklar
Açık KaynakSes ve Medya12k

F5-TTS

Kısa bir referans klibinden akıcı konuşma sentezleyen akış eşleştirmeli sıfır atışlı ses klonlama TTS.

F5-TTS, difüzyon transformerleri ile akış eşleştirmeye dayalı otoregresif olmayan bir metinden sese modelidir; birkaç saniyelik referans sesinden doğal ve akıcı konuşma ile sıfır atışlı ses klonlama üretir. Fonem hizalaması veya ayrı bir süre modeli gerektirmeksizin yüksek kalite ve hız sunmasıyla öne çıkar; çok dilli ve kod anahtarlamalı sentezi de destekler.

Depo

SWivid/F5-TTS

Dil

Python

Bununla neler kurabilirsin

  • Kısa bir referans klibinden ses klonlayarak içerik seslendirmek veya markalı bir ses oluşturmak
  • Dublaj, sesli kitap veya karakterler için etkileyici çok dilli konuşma üretmek
  • Bir sesli ajan ya da medya pipeline'ı içinde kendi barındırdığı sıfır atışlı bir TTS uç noktası kurmak

Etiketler

ttsvoice-cloningflow-matchingzero-shot