مفتوح المصدرالصوت والوسائط12k
F5-TTS
نموذج TTS لاستنساخ الصوت بدون أمثلة باستخدام مطابقة التدفق، يُنتج كلامًا طليقًا من مقطع مرجعي قصير.
F5-TTS هو نموذج تحويل نص إلى كلام غير تسلسلي ذاتي يعتمد على مطابقة التدفق مع محوّلات الانتشار، يُنتج كلامًا طبيعيًا طليقًا واستنساخًا للصوت بدون أمثلة من ثوانٍ قليلة من الصوت المرجعي. يتميز بجودة وسرعة عاليتين دون الحاجة إلى محاذاة صوتية أو نموذج مستقل للمدة، ويدعم التوليف متعدد اللغات والمختلط.
المستودع
SWivid/F5-TTSاللغة
Pythonما الذي يمكنك بناؤه به
- استنساخ صوت من مقطع مرجعي قصير لسرد المحتوى أو بناء صوت العلامة التجارية
- توليد كلام معبّر متعدد اللغات لدبلجة كتب صوتية أو شخصيات
- استضافة نقطة نهاية TTS بدون أمثلة ذاتيًا داخل وكيل صوتي أو مسار وسائط
الوسوم
ttsvoice-cloningflow-matchingzero-shot