مقدّمة
نموذجنا مصمَّم ليفهم اللهجة التونسية ويتكلّمها، لكنّه قبل كلّ شيء مساعدك الصوتي. يتأقلم مع طريقتك في الكلام، ومع لهجة جهتك، ومع عباراتك الخاصة. ليس من حقّنا أن نقول لك كيف تتكلّم مع مساعدك.
يعرض هذا التقرير طريقة IyedeX في بناء أول نموذج صوتي TTS/STT مخصّص للهجة التونسية، انطلاقًا من مدوّنة أصيلة تضمّ:
- أرشيفات إذاعية وتلفزية تونسية بتراخيص حرّة؛
- تسجيلات عامة متاحة قانونيًا؛
- أصواتنا الداخلية؛
- أصوات متعاونين من الشمال والوسط والجنوب التونسي.
ويُضاف إلى ذلك مسار كامل لتنظيف الصوت وتوصيفه وتحضيره، ثمّ التدريب الدقيق لنموذج xTTS v2 للحصول على نطق تونسي حقيقي. الهدف: توليد طبيعي للكلام وتعرّف متين عليه، مدمجان في 3amAli، مساعد IyedeX.
رؤيتنا هي نموذج صوتي يلتقط أصالة اللهجة التونسية وثراءها بكلّ تنوّعها الجهوي.
المدوّنة
صُمّمت المدوّنة لتعكس التونسية كما تُحكى فعلًا. هذه هي النسخة العامة من إحصائياتها.
| المصدر | النوع | الجهة | المتحدّثون | الساعات | الترخيص | التنظيف | SNR (dB) | ملاحظات |
|---|---|---|---|---|---|---|---|---|
| بثّ أ | إذاعة | الشمال | 12 | 40.0 | CC-BY | 85% | 18.5 | برامج صباحية ونقاشات |
| بثّ ب | صوت تلفزي | الوسط | 8 | 15.0 | CC-BY-SA | 80% | 17.2 | روبورتاجات |
| تسجيلات IyedeX | داخلي | الشمال | 1 | 5.0 | موافقة | 95% | 28.0 | استوديو هاوٍ |
| أصوات الأصدقاء | داخلي | مختلط | 14 | 20.0 | موافقة | 90% | 20.1 | تنوّع بين الشمال والجنوب |
| تسجيلات ميدانية | ميداني | الجنوب | 6 | 12.5 | موافقة | 70% | 12.2 | بيئات صاخبة |
| المجموع | 41 | 87.5 |
أكثر من نصف الساعات مصدرها الإذاعة والتلفزة، وقرابة الثلث أصوات سُجّلت بموافقة أصحابها، والباقي من الميدان، حيث الضجيج حقيقي.
حسب الجهات، يمثّل الشمال 45 ساعة، والوسط 15 ساعة، والجنوب 12.5 ساعة. أمّا الساعات العشرون المتبقية فتجمع متحدّثين من عدّة جهات.
تحضير البيانات
تمرّ كلّ ساعة من الصوت بالمراحل الخمس نفسها قبل استعمالها في التدريب.
- التوحيد. تحويل الصوت إلى أحادي بتردّد 16 أو 24 كيلوهرتز، PCM بـ16 بت، وتوحيد الملفات المصدرية.
- التنظيف والتقطيع. حذف فترات الصمت التي تتجاوز 500 ملّي ثانية، وتقطيع الصوت إلى مقاطع من 1 إلى 12 ثانية، وتصفية الضجيج آليًا.
- التوصيف. نسخ يدوي وشبه آلي، وتوحيد كتابة اللهجة، ووسوم جهوية (الشمال، الوسط، الجنوب).
- الإثراء. تغيير طبقة الصوت بـ±5%، وتمديد الزمن، وإضافة ضجيج مضبوط (أسواق، سيارات، موسيقى).
- التقسيم النهائي. 80% للتدريب، و10% للتحقّق، و10% للاختبار، مع فصل صارم للمتحدّثين بين الأقسام الثلاثة.
البنية
يقوم النموذج على جزأين متكاملين: xTTS v2 المدرَّب بدقّة لتوليد الكلام، وWav2Vec2 المدرَّب بدقّة للتعرّف عليه.
| قبل التدريب الدقيق | بعد التدريب الدقيق | |
|---|---|---|
| النموذج | عام ومتعدّد اللغات | مخصّص للتونسية |
| النطق | تقريبي | أصيل |
| اللهجة | غير تونسية | تونسية طبيعية |
| العبارات المحلية | فهم ضعيف | مفهومة |
توليد الكلام (TTS): xTTS v2 مدرَّب بدقّة
- نموذج متعدّد اللغات مكيَّف مع التونسية؛
- تعلّم الإيقاع والنبرة التونسيين؛
- دعم عدّة متحدّثين؛
- التحكّم في الأسلوب والعاطفة.
التعرّف على الكلام (STT): Wav2Vec2 مدرَّب بدقّة
- Wav2Vec2 كأساس؛
- تدريب دقيق كامل على مدوّنتنا؛
- نسبة خطأ محسَّنة للظروف الحقيقية.
الكثير بالقليل
عمل فريقنا على أجهزة متواضعة، دون معالجات رسومية متطوّرة. لذلك راهنّا على الهندسة بدل القوّة الحسابية.
الابتكار لا يتوقّف على قوّة العتاد. تُظهر نتائجنا أنّ جودة البيانات والهندسة أهمّ من القوّة الحسابية الخام: بنينا نموذجًا صوتيًا تونسيًا قويًا بموارد محدودة.
النتائج
نقيّم النموذج بالمقاييس الدولية المعتمدة: WER (نسبة خطأ الكلمات) وCER (نسبة خطأ الحروف) للتعرّف على الكلام، وMOS (متوسّط تقييم المستمعين) لتوليده، واختياريًا STOI وPESQ، إلى جانب خرائط الأخطاء الصوتية.
التعرّف على الكلام
| النموذج | WER في الهدوء | WER في الضجيج |
|---|---|---|
| Wav2Vec2 الأساسي | 35.2% | 58.7% |
| IyedeX، بعد التدريب الدقيق | 12.9% | 28.4% |
في الهدوء، تنخفض نسبة الخطأ من 35.2% إلى 12.9%، أي أخطاء أقلّ بنحو ثلاث مرّات. وفي الضجيج، تنخفض إلى النصف.
توليد الكلام
| النسخة | متوسّط MOS | مجال الثقة 95% |
|---|---|---|
| xTTS الأساسي | 2.8 / 5 | ±0.15 |
| IyedeX xTTS، بعد التدريب الدقيق | 4.1 / 5 | ±0.12 |
يمنح المستمعون الصوت المدرَّب 4.1 من 5، مقابل 2.8 للنموذج الأساسي.
الأمان والأخلاقيات
تطبّق IyedeX قواعد صارمة على كلّ صوت في المدوّنة وكلّ صوت تولّده:
- موافقة صريحة من كلّ متحدّث؛
- تخزين مشفّر للتسجيلات؛
- سياسة ضدّ استنساخ الأصوات؛
- علامة مائية على الأصوات المولَّدة؛
- الامتثال للتشريعات التونسية والدولية.
حماية البيانات واحترام الأخلاقيات في قلب عملنا. جُمع كلّ صوت في مدوّنتنا بموافقة صريحة من صاحبه.
الخلاصة
نقدّم هنا أول مسار احترافي متكامل لنموذج صوتي تونسي. ورغم محدودية العتاد، فإنّ عملنا على جمع اللهجة، والتنوّع الجغرافي، وتدريب TTS وSTT، والتقييم، والتصميم الأخلاقي يضع أسس منظومة صوتية تونسية موثوقة وطبيعية ووفيّة لثقافتها.
هذا النموذج هو حجر الأساس لـ3amAli، ولواجهة IyedeX Voice البرمجية، وللاندماجات المستقبلية مع الشركات.