Introduction
Notre modèle est optimisé pour comprendre et parler le dialecte tunisien, mais c’est avant tout votre assistant vocal. Il s’adapte à votre façon de parler, à votre accent régional et à vos expressions. Ce n’est pas à nous de vous dire comment parler à votre assistant.
Ce rapport présente l’approche d’IyedeX pour construire le premier modèle vocal TTS/STT spécialisé dans le dialecte tunisien, à partir d’un corpus authentique :
- des archives radio et télévision tunisiennes sous licence libre ;
- des enregistrements publics disponibles légalement ;
- nos propres voix internes ;
- les voix de collaborateurs du Nord, du Centre et du Sud de la Tunisie.
À cela s’ajoutent un pipeline complet de nettoyage, d’annotation et de préparation de l’audio, puis le fine-tuning du modèle xTTS v2 pour obtenir une prononciation réellement tunisienne. L’objectif : une synthèse naturelle et une reconnaissance robuste, intégrées à 3amAli, l’assistant d’IyedeX.
Notre vision est de créer un modèle vocal qui capture l’authenticité et la richesse du dialecte tunisien dans toute sa diversité régionale.
Le corpus
Le corpus a été conçu pour refléter la diversité réelle du dialecte tunisien. Voici la version publique de ses statistiques.
| Source | Type | Région | Locuteurs | Heures | Licence | Nettoyage | SNR (dB) | Notes |
|---|---|---|---|---|---|---|---|---|
| Broadcast A | Radio | Nord | 12 | 40,0 | CC-BY | 85 % | 18,5 | Matinales, débats |
| Broadcast B | Audio TV | Centre | 8 | 15,0 | CC-BY-SA | 80 % | 17,2 | Reportages |
| Enregistrements IyedeX | Personnel | Nord | 1 | 5,0 | Consentement | 95 % | 28,0 | Studio amateur |
| Voix d’amis | Personnel | Mixte | 14 | 20,0 | Consentement | 90 % | 20,1 | Variété Nord / Sud |
| Enregistrements de terrain | Terrain | Sud | 6 | 12,5 | Consentement | 70 % | 12,2 | Environnements bruyants |
| Total | 41 | 87,5 |
Plus de la moitié des heures vient de la radio et de la télévision, près d’un tiers de voix enregistrées avec leur consentement, et le reste du terrain, là où le bruit est réel.
Par région, le Nord représente 45 heures, le Centre 15 heures et le Sud 12,5 heures. Les 20 heures restantes mêlent des locuteurs de plusieurs régions.
Préparer les données
Chaque heure d’audio passe par les cinq mêmes étapes avant de servir à l’entraînement.
- Normalisation. Conversion en mono 16 kHz ou 24 kHz, PCM 16 bits, et uniformisation des fichiers source.
- Nettoyage et découpage. Suppression des silences de plus de 500 ms, découpage en segments de 1 à 12 secondes, filtrage automatique du bruit.
- Annotation. Transcription manuelle et semi-automatique, orthographe du dialecte uniformisée, balises régionales (Nord, Centre, Sud).
- Augmentation. Variation de hauteur de ±5 %, étirement temporel, ajout contrôlé de bruit (marchés, voitures, musique).
- Découpage final. 80 % entraînement, 10 % validation, 10 % test, avec une séparation stricte des locuteurs entre les trois.
L’architecture
Le modèle repose sur deux briques complémentaires : xTTS v2, affiné pour la synthèse vocale, et Wav2Vec2, affiné pour la reconnaissance.
| Avant le fine-tuning | Après le fine-tuning | |
|---|---|---|
| Modèle | Générique, multilingue | Spécialisé tunisien |
| Prononciation | Approximative | Authentique |
| Accent | Non tunisien | Tunisien naturel |
| Expressions locales | Mal comprises | Comprises |
Synthèse vocale (TTS) : xTTS v2 affiné
- un modèle multilingue adapté au tunisien ;
- l’apprentissage de la prosodie tunisienne ;
- plusieurs locuteurs ;
- le contrôle du style et de l’émotion.
Reconnaissance vocale (STT) : Wav2Vec2 affiné
- Wav2Vec2 comme base ;
- un fine-tuning complet sur notre corpus ;
- un taux d’erreur optimisé pour les conditions réelles.
Faire beaucoup avec peu
Notre équipe a travaillé sur des machines modestes, sans GPU haut de gamme. Nous avons donc misé sur l’ingénierie plutôt que sur la puissance de calcul.
L’innovation ne dépend pas de la puissance matérielle. Nos résultats montrent que la qualité du jeu de données et de l’ingénierie compte davantage que la puissance brute : nous avons construit un modèle vocal tunisien performant avec des ressources limitées.
Résultats
Nous évaluons le modèle avec les métriques internationales standard : le WER (taux d’erreur sur les mots) et le CER (sur les caractères) pour la reconnaissance, le MOS (note moyenne d’écoute) pour la synthèse, et, de façon optionnelle, STOI et PESQ, complétés par des cartes d’erreurs phonétiques.
Reconnaissance vocale
| Modèle | WER, environnement calme | WER, environnement bruyant |
|---|---|---|
| Wav2Vec2 de base | 35,2 % | 58,7 % |
| IyedeX, affiné | 12,9 % | 28,4 % |
Dans le calme, le taux d’erreur passe de 35,2 % à 12,9 %, soit près de trois fois moins d’erreurs. Dans le bruit, il est divisé par deux.
Synthèse vocale
| Version | MOS moyen | Intervalle de confiance à 95 % |
|---|---|---|
| xTTS de base | 2,8 / 5 | ±0,15 |
| IyedeX xTTS, affiné | 4,1 / 5 | ±0,12 |
Les auditeurs notent la voix affinée 4,1 sur 5, contre 2,8 pour le modèle de base.
Sécurité et éthique
IyedeX applique des règles strictes à chaque voix du corpus et à chaque voix produite :
- le consentement explicite de chaque locuteur ;
- le stockage chiffré des enregistrements ;
- une politique contre le clonage de voix ;
- un filigrane sur les voix synthétiques ;
- la conformité aux réglementations tunisiennes et internationales.
La protection des données et le respect de l’éthique sont au cœur de notre démarche. Chaque voix de notre corpus a été collectée avec le consentement explicite de son propriétaire.
Conclusion
Nous présentons ici le premier pipeline professionnel complet pour un modèle vocal tunisien. Malgré des ressources matérielles limitées, notre travail sur la collecte dialectale, la diversité géographique, l’entraînement TTS et STT, l’évaluation et la conception éthique pose les fondations d’un écosystème vocal tunisien fiable, naturel et fidèle à sa culture.
Ce modèle est la pierre angulaire de 3amAli, de l’API IyedeX Voice et des futures intégrations pour les entreprises.
Commentaires 0
Soyez le premier à commenter.