ورقة بحثيةالصوت · الدارجة

تطوير نموذج صوتي تونسي

تطوير نموذج صوتي تونسي

الملخّص

كيف بنينا أول نموذج لتوليد الكلام (TTS) والتعرّف عليه (STT) مخصّص للهجة التونسية: مدوّنة من 87.5 ساعة من الشمال والوسط والجنوب، ومسار تحضير للبيانات من خمس مراحل، وتدريب دقيق يخفّض نسبة الخطأ إلى الثلث تقريبًا.

87.5 ساعةمن الصوت التونسي
41متحدّثًا من 3 جهات
12.9%نسبة خطأ الكلمات في الهدوء
4.1 / 5تقييم جودة الصوت المولَّد

مقدّمة

نموذجنا مصمَّم ليفهم اللهجة التونسية ويتكلّمها، لكنّه قبل كلّ شيء مساعدك الصوتي. يتأقلم مع طريقتك في الكلام، ومع لهجة جهتك، ومع عباراتك الخاصة. ليس من حقّنا أن نقول لك كيف تتكلّم مع مساعدك.

يعرض هذا التقرير طريقة IyedeX في بناء أول نموذج صوتي TTS/STT مخصّص للهجة التونسية، انطلاقًا من مدوّنة أصيلة تضمّ:

  • أرشيفات إذاعية وتلفزية تونسية بتراخيص حرّة؛
  • تسجيلات عامة متاحة قانونيًا؛
  • أصواتنا الداخلية؛
  • أصوات متعاونين من الشمال والوسط والجنوب التونسي.

ويُضاف إلى ذلك مسار كامل لتنظيف الصوت وتوصيفه وتحضيره، ثمّ التدريب الدقيق لنموذج xTTS v2 للحصول على نطق تونسي حقيقي. الهدف: توليد طبيعي للكلام وتعرّف متين عليه، مدمجان في 3amAli، مساعد IyedeX.

رؤيتنا هي نموذج صوتي يلتقط أصالة اللهجة التونسية وثراءها بكلّ تنوّعها الجهوي.

المدوّنة

صُمّمت المدوّنة لتعكس التونسية كما تُحكى فعلًا. هذه هي النسخة العامة من إحصائياتها.

المصدر النوع الجهة المتحدّثون الساعات الترخيص التنظيف SNR (dB) ملاحظات
بثّ أ إذاعة الشمال 12 40.0 CC-BY 85% 18.5 برامج صباحية ونقاشات
بثّ ب صوت تلفزي الوسط 8 15.0 CC-BY-SA 80% 17.2 روبورتاجات
تسجيلات IyedeX داخلي الشمال 1 5.0 موافقة 95% 28.0 استوديو هاوٍ
أصوات الأصدقاء داخلي مختلط 14 20.0 موافقة 90% 20.1 تنوّع بين الشمال والجنوب
تسجيلات ميدانية ميداني الجنوب 6 12.5 موافقة 70% 12.2 بيئات صاخبة
المجموع 41 87.5

أكثر من نصف الساعات مصدرها الإذاعة والتلفزة، وقرابة الثلث أصوات سُجّلت بموافقة أصحابها، والباقي من الميدان، حيث الضجيج حقيقي.

pie showData title مصدر ساعات التسجيل "الإذاعة والتلفزة" : 55 "أصوات داخلية" : 29 "الميدان" : 16

حسب الجهات، يمثّل الشمال 45 ساعة، والوسط 15 ساعة، والجنوب 12.5 ساعة. أمّا الساعات العشرون المتبقية فتجمع متحدّثين من عدّة جهات.

تحضير البيانات

تمرّ كلّ ساعة من الصوت بالمراحل الخمس نفسها قبل استعمالها في التدريب.

flowchart LR A[التوحيد] --> B[التنظيف والتقطيع] B --> C[التوصيف] C --> D[الإثراء] D --> E[التقسيم النهائي]
  1. التوحيد. تحويل الصوت إلى أحادي بتردّد 16 أو 24 كيلوهرتز، PCM بـ16 بت، وتوحيد الملفات المصدرية.
  2. التنظيف والتقطيع. حذف فترات الصمت التي تتجاوز 500 ملّي ثانية، وتقطيع الصوت إلى مقاطع من 1 إلى 12 ثانية، وتصفية الضجيج آليًا.
  3. التوصيف. نسخ يدوي وشبه آلي، وتوحيد كتابة اللهجة، ووسوم جهوية (الشمال، الوسط، الجنوب).
  4. الإثراء. تغيير طبقة الصوت بـ±5%، وتمديد الزمن، وإضافة ضجيج مضبوط (أسواق، سيارات، موسيقى).
  5. التقسيم النهائي. ‏80% للتدريب، و10% للتحقّق، و10% للاختبار، مع فصل صارم للمتحدّثين بين الأقسام الثلاثة.

البنية

يقوم النموذج على جزأين متكاملين: xTTS v2 المدرَّب بدقّة لتوليد الكلام، وWav2Vec2 المدرَّب بدقّة للتعرّف عليه.

قبل التدريب الدقيق بعد التدريب الدقيق
النموذج عام ومتعدّد اللغات مخصّص للتونسية
النطق تقريبي أصيل
اللهجة غير تونسية تونسية طبيعية
العبارات المحلية فهم ضعيف مفهومة

توليد الكلام (TTS): ‏xTTS v2 مدرَّب بدقّة

  • نموذج متعدّد اللغات مكيَّف مع التونسية؛
  • تعلّم الإيقاع والنبرة التونسيين؛
  • دعم عدّة متحدّثين؛
  • التحكّم في الأسلوب والعاطفة.

التعرّف على الكلام (STT): ‏Wav2Vec2 مدرَّب بدقّة

  • Wav2Vec2 كأساس؛
  • تدريب دقيق كامل على مدوّنتنا؛
  • نسبة خطأ محسَّنة للظروف الحقيقية.

الكثير بالقليل

عمل فريقنا على أجهزة متواضعة، دون معالجات رسومية متطوّرة. لذلك راهنّا على الهندسة بدل القوّة الحسابية.

الابتكار لا يتوقّف على قوّة العتاد. تُظهر نتائجنا أنّ جودة البيانات والهندسة أهمّ من القوّة الحسابية الخام: بنينا نموذجًا صوتيًا تونسيًا قويًا بموارد محدودة.

النتائج

نقيّم النموذج بالمقاييس الدولية المعتمدة: WER (نسبة خطأ الكلمات) وCER (نسبة خطأ الحروف) للتعرّف على الكلام، وMOS (متوسّط تقييم المستمعين) لتوليده، واختياريًا STOI وPESQ، إلى جانب خرائط الأخطاء الصوتية.

التعرّف على الكلام

النموذج WER في الهدوء WER في الضجيج
Wav2Vec2 الأساسي 35.2% 58.7%
IyedeX، بعد التدريب الدقيق 12.9% 28.4%

في الهدوء، تنخفض نسبة الخطأ من 35.2% إلى 12.9%، أي أخطاء أقلّ بنحو ثلاث مرّات. وفي الضجيج، تنخفض إلى النصف.

توليد الكلام

النسخة متوسّط MOS مجال الثقة 95%
xTTS الأساسي 2.8 / 5 ±0.15
IyedeX xTTS، بعد التدريب الدقيق 4.1 / 5 ±0.12

يمنح المستمعون الصوت المدرَّب 4.1 من 5، مقابل 2.8 للنموذج الأساسي.

الأمان والأخلاقيات

تطبّق IyedeX قواعد صارمة على كلّ صوت في المدوّنة وكلّ صوت تولّده:

  • موافقة صريحة من كلّ متحدّث؛
  • تخزين مشفّر للتسجيلات؛
  • سياسة ضدّ استنساخ الأصوات؛
  • علامة مائية على الأصوات المولَّدة؛
  • الامتثال للتشريعات التونسية والدولية.

حماية البيانات واحترام الأخلاقيات في قلب عملنا. جُمع كلّ صوت في مدوّنتنا بموافقة صريحة من صاحبه.

الخلاصة

نقدّم هنا أول مسار احترافي متكامل لنموذج صوتي تونسي. ورغم محدودية العتاد، فإنّ عملنا على جمع اللهجة، والتنوّع الجغرافي، وتدريب TTS وSTT، والتقييم، والتصميم الأخلاقي يضع أسس منظومة صوتية تونسية موثوقة وطبيعية ووفيّة لثقافتها.

هذا النموذج هو حجر الأساس لـ3amAli، ولواجهة IyedeX Voice البرمجية، وللاندماجات المستقبلية مع الشركات.

الاستشهاد بهذه الورقة

IyedeX Research (2025). تطوير نموذج صوتي تونسي. IyedeX. https://iyedex.tn/ar/research/development-du-model-vocal

2 قراءة

كل الأبحاث