Introduction
Oui, notre modèle est optimisé pour comprendre et parler le dialecte tunisien, mais c'est avant tout votre assistant vocal. Il s'adapte à votre façon de parler, votre accent régional, et même vos expressions locales. Qui sommes-nous pour vous dire comment parler à votre assistant ?
Ce rapport présente l'approche d'IyedeX pour la création du premier modèle vocal TTS/STT spécialisé dans le dialecte tunisien, basé sur un corpus authentique incluant :
- archives broadcast tunisiennes sous licence libre,
- enregistrements publics disponibles légalement,
- nos propres voix internes,
- les voix de collaborateurs issus du Nord, du Centre et du Sud de la Tunisie,
- un pipeline complet de nettoyage, annotation et préparation audio,
- la fine-tuning du modèle xTTS-v2 pour obtenir une prononciation 100% tunisienne.
Notre objectif est de fournir une synthèse vocale naturelle et une reconnaissance robuste pour le dialecte tunisien, destinée à être intégrée dans 3amAli, l'assistant intelligent d'IyedeX.
"Notre vision est de créer un modèle vocal qui capture l'authenticité et la richesse du dialecte tunisien dans toute sa diversité régionale."
Corpus Tunisien — Description & Statistiques
Le corpus a été conçu pour capturer la diversité réelle du dialecte tunisien. Voici la version publique des statistiques du dataset.
Tableau — Répartition du Corpus
| Source | Type | Région | Locuteurs | Heures | Licence | Qualité Nettoyage | SNR (dB) | Notes |
|---|---|---|---|---|---|---|---|---|
| Broadcast A | Radio | Nord | 12 | 40.0 | CC-BY | 85% | 18.5 | Matinales, débats |
| Broadcast B | TV Audio | Centre | 8 | 15.0 | CC-BY-SA | 80% | 17.2 | Reportages |
| Enregistrements IyedeX | Personnel | Nord | 1 | 5.0 | Consentement | 95% | 28.0 | Studio amateur |
| Voix d'Amis | Personnel | Mixte | 14 | 20.0 | Consentement | 90% | 20.1 | Variété Nord/Sud |
| Field Recordings | Terrain | Sud | 6 | 12.5 | Consentement | 70% | 12.2 | Environnements bruyants |
| Total | 41 | 87.5 | ||||||
Graphique — Répartition des Heures par Région
Graphique — Types de Sources
Pipeline de Préparation des Données
Notre pipeline suit cinq étapes :
Conversion en mono 16 kHz ou 24 kHz, PCM 16 bits, uniformisation des fichiers source.
Suppression des silences > 500 ms, découpage en segments de 1 à 12 secondes, filtrage automatique du bruit.
Transcription manuelle et semi-automatique, uniformisation orthographique du dialecte, balises régionales (Nord / Centre / Sud).
Pitch shift ±5%, time stretch, ajout de bruit contrôlé (marchés, voitures, musique).
Train : 80%, Dev : 10%, Test : 10%, séparation stricte des locuteurs.
Architecture du Modèle Vocal Tunisien
Nous avons opté pour une architecture multi-étapes, basée sur :
- Modèle générique multilingue
- Prononciation approximative
- Accent non tunisien
- Difficulté avec les expressions locales
- Modèle spécialisé tunisien
- Prononciation authentique
- Accent tunisien naturel
- Compréhension des expressions locales
4.1 Synthèse Vocale (TTS) – xTTS v2 fine-tuned
- Modèle multilingue adapté au tunisien
- Apprentissage de la prosodie tunisienne
- Support multi-locuteur
- Capacité de style / émotion
4.2 Reconnaissance Vocale (STT)
- Base : Wav2Vec2
- Fine-tuning complet avec notre corpus
- Optimisation du WER pour conditions réelles
Contraintes Matérielles et Approche Ingénieuse
Bien que notre équipe ait utilisé des machines modestes (sans GPU RTX haut de gamme), nous avons développé une stratégie efficace :
Nos résultats prouvent que la qualité du dataset et l'ingénierie sont plus importantes que la puissance de calcul brute. Nous avons créé un modèle vocal tunisien performant avec des ressources limitées grâce à notre approche innovante.
Évaluation du Modèle
Nous utilisons des métriques internationales standard :
- WER (Word Error Rate) pour STT
- CER (Character Error Rate)
- MOS (Mean Opinion Score) pour TTS
- STOI, PESQ (optionnel)
- Heatmaps d'erreurs phonétiques
Résultats STT (Exemple visuel)
| Modèle | WER – Calme | WER – Bruit |
|---|---|---|
| Wav2Vec2 de base | 35.2% | 58.7% |
| IyedeX Fine-tuned | 12.9% | 28.4% |
Résultats TTS (MOS)
| Version | MOS Moyen | IC 95% |
|---|---|---|
| xTTS Base | 2.8 / 5 | ±0.15 |
| IyedeX xTTS Fine-tuned | 4.1 / 5 | ±0.12 |
Sécurité, Éthique et Protection
IyedeX applique des règles strictes :
- Système de consentement explicite des locuteurs
- Stockage chiffré des enregistrements
- Politique anti-voice cloning
- Watermarking des voix synthétiques
- Conformité avec les réglementations tunisiennes et internationales
"La protection des données et le respect de l'éthique sont au cœur de notre démarche. Chaque voix dans notre corpus a été collectée avec le consentement explicite de son propriétaire."
Conclusion
Nous présentons ici le premier pipeline professionnel pour un modèle vocal tunisien complet. Malgré des ressources matérielles limitées, nos innovations en :
- collecte dialectale,
- diversification géographique,
- entraînement TTS/STT,
- évaluation scientifique,
- design éthique,
nous permettent de poser les fondations d'un écosystème vocal tunisien fiable, naturel et culturellement authentique.
Ce modèle servira de pierre angulaire à 3amAli, à l'API IyedeX Voice et à de futures intégrations B2B.