كل المشاريع مفتوحة المصدر
مفتوح المصدرالصوت والوسائط12k

F5-TTS

نموذج TTS لاستنساخ الصوت بدون أمثلة باستخدام مطابقة التدفق، يُنتج كلامًا طليقًا من مقطع مرجعي قصير.

F5-TTS هو نموذج تحويل نص إلى كلام غير تسلسلي ذاتي يعتمد على مطابقة التدفق مع محوّلات الانتشار، يُنتج كلامًا طبيعيًا طليقًا واستنساخًا للصوت بدون أمثلة من ثوانٍ قليلة من الصوت المرجعي. يتميز بجودة وسرعة عاليتين دون الحاجة إلى محاذاة صوتية أو نموذج مستقل للمدة، ويدعم التوليف متعدد اللغات والمختلط.

المستودع

SWivid/F5-TTS

اللغة

Python

ما الذي يمكنك بناؤه به

  • استنساخ صوت من مقطع مرجعي قصير لسرد المحتوى أو بناء صوت العلامة التجارية
  • توليد كلام معبّر متعدد اللغات لدبلجة كتب صوتية أو شخصيات
  • استضافة نقطة نهاية TTS بدون أمثلة ذاتيًا داخل وكيل صوتي أو مسار وسائط

الوسوم

ttsvoice-cloningflow-matchingzero-shot