Développement d'un modèle vocal tunisien

Comment nous avons construit le premier modèle de synthèse (TTS) et de reconnaissance vocale (STT) dédié au dialecte tunisien : un corpus de 87,5 heures venu du Nord, du Centre et du Sud, un pipeline de préparation en cinq étapes, et un fine-tuning qui divise par près de trois le taux d'erreur.

Introduction

Notre modèle est optimisé pour comprendre et parler le dialecte tunisien, mais c’est avant tout votre assistant vocal. Il s’adapte à votre façon de parler, à votre accent régional et à vos expressions. Ce n’est pas à nous de vous dire comment parler à votre assistant.

Ce rapport présente l’approche d’IyedeX pour construire le premier modèle vocal TTS/STT spécialisé dans le dialecte tunisien, à partir d’un corpus authentique :

  • des archives radio et télévision tunisiennes sous licence libre ;
  • des enregistrements publics disponibles légalement ;
  • nos propres voix internes ;
  • les voix de collaborateurs du Nord, du Centre et du Sud de la Tunisie.

À cela s’ajoutent un pipeline complet de nettoyage, d’annotation et de préparation de l’audio, puis le fine-tuning du modèle xTTS v2 pour obtenir une prononciation réellement tunisienne. L’objectif : une synthèse naturelle et une reconnaissance robuste, intégrées à 3amAli, l’assistant d’IyedeX.

Notre vision est de créer un modèle vocal qui capture l’authenticité et la richesse du dialecte tunisien dans toute sa diversité régionale.

Le corpus

Le corpus a été conçu pour refléter la diversité réelle du dialecte tunisien. Voici la version publique de ses statistiques.

Source Type Région Locuteurs Heures Licence Nettoyage SNR (dB) Notes
Broadcast A Radio Nord 12 40,0 CC-BY 85 % 18,5 Matinales, débats
Broadcast B Audio TV Centre 8 15,0 CC-BY-SA 80 % 17,2 Reportages
Enregistrements IyedeX Personnel Nord 1 5,0 Consentement 95 % 28,0 Studio amateur
Voix d’amis Personnel Mixte 14 20,0 Consentement 90 % 20,1 Variété Nord / Sud
Enregistrements de terrain Terrain Sud 6 12,5 Consentement 70 % 12,2 Environnements bruyants
Total 41 87,5

Plus de la moitié des heures vient de la radio et de la télévision, près d’un tiers de voix enregistrées avec leur consentement, et le reste du terrain, là où le bruit est réel.

pie showData title Origine des heures d'enregistrement "Radio et télévision" : 55 "Voix personnelles" : 29 "Terrain" : 16

Par région, le Nord représente 45 heures, le Centre 15 heures et le Sud 12,5 heures. Les 20 heures restantes mêlent des locuteurs de plusieurs régions.

Préparer les données

Chaque heure d’audio passe par les cinq mêmes étapes avant de servir à l’entraînement.

flowchart LR A[Normalisation] --> B[Nettoyage et découpage] B --> C[Annotation] C --> D[Augmentation] D --> E[Découpage final]
  1. Normalisation. Conversion en mono 16 kHz ou 24 kHz, PCM 16 bits, et uniformisation des fichiers source.
  2. Nettoyage et découpage. Suppression des silences de plus de 500 ms, découpage en segments de 1 à 12 secondes, filtrage automatique du bruit.
  3. Annotation. Transcription manuelle et semi-automatique, orthographe du dialecte uniformisée, balises régionales (Nord, Centre, Sud).
  4. Augmentation. Variation de hauteur de ±5 %, étirement temporel, ajout contrôlé de bruit (marchés, voitures, musique).
  5. Découpage final. 80 % entraînement, 10 % validation, 10 % test, avec une séparation stricte des locuteurs entre les trois.

L’architecture

Le modèle repose sur deux briques complémentaires : xTTS v2, affiné pour la synthèse vocale, et Wav2Vec2, affiné pour la reconnaissance.

Avant le fine-tuning Après le fine-tuning
Modèle Générique, multilingue Spécialisé tunisien
Prononciation Approximative Authentique
Accent Non tunisien Tunisien naturel
Expressions locales Mal comprises Comprises

Synthèse vocale (TTS) : xTTS v2 affiné

  • un modèle multilingue adapté au tunisien ;
  • l’apprentissage de la prosodie tunisienne ;
  • plusieurs locuteurs ;
  • le contrôle du style et de l’émotion.

Reconnaissance vocale (STT) : Wav2Vec2 affiné

  • Wav2Vec2 comme base ;
  • un fine-tuning complet sur notre corpus ;
  • un taux d’erreur optimisé pour les conditions réelles.

Faire beaucoup avec peu

Notre équipe a travaillé sur des machines modestes, sans GPU haut de gamme. Nous avons donc misé sur l’ingénierie plutôt que sur la puissance de calcul.

L’innovation ne dépend pas de la puissance matérielle. Nos résultats montrent que la qualité du jeu de données et de l’ingénierie compte davantage que la puissance brute : nous avons construit un modèle vocal tunisien performant avec des ressources limitées.

Résultats

Nous évaluons le modèle avec les métriques internationales standard : le WER (taux d’erreur sur les mots) et le CER (sur les caractères) pour la reconnaissance, le MOS (note moyenne d’écoute) pour la synthèse, et, de façon optionnelle, STOI et PESQ, complétés par des cartes d’erreurs phonétiques.

Reconnaissance vocale

Modèle WER, environnement calme WER, environnement bruyant
Wav2Vec2 de base 35,2 % 58,7 %
IyedeX, affiné 12,9 % 28,4 %

Dans le calme, le taux d’erreur passe de 35,2 % à 12,9 %, soit près de trois fois moins d’erreurs. Dans le bruit, il est divisé par deux.

Synthèse vocale

Version MOS moyen Intervalle de confiance à 95 %
xTTS de base 2,8 / 5 ±0,15
IyedeX xTTS, affiné 4,1 / 5 ±0,12

Les auditeurs notent la voix affinée 4,1 sur 5, contre 2,8 pour le modèle de base.

Sécurité et éthique

IyedeX applique des règles strictes à chaque voix du corpus et à chaque voix produite :

  • le consentement explicite de chaque locuteur ;
  • le stockage chiffré des enregistrements ;
  • une politique contre le clonage de voix ;
  • un filigrane sur les voix synthétiques ;
  • la conformité aux réglementations tunisiennes et internationales.

La protection des données et le respect de l’éthique sont au cœur de notre démarche. Chaque voix de notre corpus a été collectée avec le consentement explicite de son propriétaire.

Conclusion

Nous présentons ici le premier pipeline professionnel complet pour un modèle vocal tunisien. Malgré des ressources matérielles limitées, notre travail sur la collecte dialectale, la diversité géographique, l’entraînement TTS et STT, l’évaluation et la conception éthique pose les fondations d’un écosystème vocal tunisien fiable, naturel et fidèle à sa culture.

Ce modèle est la pierre angulaire de 3amAli, de l’API IyedeX Voice et des futures intégrations pour les entreprises.

Citer cet article

IyedeX Research (2025). Développement d'un modèle vocal tunisien. IyedeX. https://iyedex.tn/research/development-du-model-vocal

6 lectures

Commentaires 0

Pas de liens ni de code. Un commentaire par personne.

Soyez le premier à commenter.

Toutes les recherches