Développement d'un Modèle Vocal Tunisien

Rapport de recherche sur la création du premier modèle vocal TTS/STT spécialisé dans le dialecte tunisien

Développement du Modèle Vocal Tunisien
1

Introduction

Et c'est un modèle vocal tunisien

Oui, notre modèle est optimisé pour comprendre et parler le dialecte tunisien, mais c'est avant tout votre assistant vocal. Il s'adapte à votre façon de parler, votre accent régional, et même vos expressions locales. Qui sommes-nous pour vous dire comment parler à votre assistant ?

Ce rapport présente l'approche d'IyedeX pour la création du premier modèle vocal TTS/STT spécialisé dans le dialecte tunisien, basé sur un corpus authentique incluant :

  • archives broadcast tunisiennes sous licence libre,
  • enregistrements publics disponibles légalement,
  • nos propres voix internes,
  • les voix de collaborateurs issus du Nord, du Centre et du Sud de la Tunisie,
  • un pipeline complet de nettoyage, annotation et préparation audio,
  • la fine-tuning du modèle xTTS-v2 pour obtenir une prononciation 100% tunisienne.

Notre objectif est de fournir une synthèse vocale naturelle et une reconnaissance robuste pour le dialecte tunisien, destinée à être intégrée dans 3amAli, l'assistant intelligent d'IyedeX.

"Notre vision est de créer un modèle vocal qui capture l'authenticité et la richesse du dialecte tunisien dans toute sa diversité régionale."

2

Corpus Tunisien — Description & Statistiques

Le corpus a été conçu pour capturer la diversité réelle du dialecte tunisien. Voici la version publique des statistiques du dataset.

Tableau — Répartition du Corpus

+
Source Type Région Locuteurs Heures Licence Qualité Nettoyage SNR (dB) Notes
Broadcast A Radio Nord 12 40.0 CC-BY 85% 18.5 Matinales, débats
Broadcast B TV Audio Centre 8 15.0 CC-BY-SA 80% 17.2 Reportages
Enregistrements IyedeX Personnel Nord 1 5.0 Consentement 95% 28.0 Studio amateur
Voix d'Amis Personnel Mixte 14 20.0 Consentement 90% 20.1 Variété Nord/Sud
Field Recordings Terrain Sud 6 12.5 Consentement 70% 12.2 Environnements bruyants
Total 41 87.5

Graphique — Répartition des Heures par Région

+
Répartition des Heures d'Enregistrement par Région
45h
Nord
15h
Centre
12.5h
Sud

Graphique — Types de Sources

+
Répartition des Sources d'Enregistrement
Broadcast (radio/TV): 55%
Personnel (IyedeX + amis): 29%
Terrain: 16%
3

Pipeline de Préparation des Données

Notre pipeline suit cinq étapes :

1
Normalisation
2
Nettoyage
3
Annotation
4
Augmentation
5
Split Final
1
Normalisation

Conversion en mono 16 kHz ou 24 kHz, PCM 16 bits, uniformisation des fichiers source.

2
Nettoyage & Découpage

Suppression des silences > 500 ms, découpage en segments de 1 à 12 secondes, filtrage automatique du bruit.

3
Annotation

Transcription manuelle et semi-automatique, uniformisation orthographique du dialecte, balises régionales (Nord / Centre / Sud).

4
Data Augmentation

Pitch shift ±5%, time stretch, ajout de bruit contrôlé (marchés, voitures, musique).

5
Split Final

Train : 80%, Dev : 10%, Test : 10%, séparation stricte des locuteurs.

4

Architecture du Modèle Vocal Tunisien

Nous avons opté pour une architecture multi-étapes, basée sur :

Synthèse Vocale (TTS)
xTTS v2 fine-tuned
Reconnaissance Vocale (STT)
Wav2Vec2 fine-tuned
Avant Fine-tuning
  • Modèle générique multilingue
  • Prononciation approximative
  • Accent non tunisien
  • Difficulté avec les expressions locales
Après Fine-tuning
  • Modèle spécialisé tunisien
  • Prononciation authentique
  • Accent tunisien naturel
  • Compréhension des expressions locales

4.1 Synthèse Vocale (TTS) – xTTS v2 fine-tuned

  • Modèle multilingue adapté au tunisien
  • Apprentissage de la prosodie tunisienne
  • Support multi-locuteur
  • Capacité de style / émotion

4.2 Reconnaissance Vocale (STT)

  • Base : Wav2Vec2
  • Fine-tuning complet avec notre corpus
  • Optimisation du WER pour conditions réelles
5

Contraintes Matérielles et Approche Ingénieuse

Bien que notre équipe ait utilisé des machines modestes (sans GPU RTX haut de gamme), nous avons développé une stratégie efficace :

L'innovation ne dépend pas de la puissance matérielle

Nos résultats prouvent que la qualité du dataset et l'ingénierie sont plus importantes que la puissance de calcul brute. Nous avons créé un modèle vocal tunisien performant avec des ressources limitées grâce à notre approche innovante.

6

Évaluation du Modèle

Nous utilisons des métriques internationales standard :

  • WER (Word Error Rate) pour STT
  • CER (Character Error Rate)
  • MOS (Mean Opinion Score) pour TTS
  • STOI, PESQ (optionnel)
  • Heatmaps d'erreurs phonétiques

Résultats STT (Exemple visuel)

+
Modèle WER – Calme WER – Bruit
Wav2Vec2 de base 35.2% 58.7%
IyedeX Fine-tuned 12.9% 28.4%
Comparaison du WER (Word Error Rate)
35.2%
Wav2Vec2 (Calme)
12.9%
IyedeX-FT (Calme)
58.7%
Wav2Vec2 (Bruit)
28.4%
IyedeX-FT (Bruit)

Résultats TTS (MOS)

+
Version MOS Moyen IC 95%
xTTS Base 2.8 / 5 ±0.15
IyedeX xTTS Fine-tuned 4.1 / 5 ±0.12
Évolution du MOS (Mean Opinion Score)
xTTS Base
Fine-tuning
IyedeX xTTS
7

Sécurité, Éthique et Protection

IyedeX applique des règles strictes :

  • Système de consentement explicite des locuteurs
  • Stockage chiffré des enregistrements
  • Politique anti-voice cloning
  • Watermarking des voix synthétiques
  • Conformité avec les réglementations tunisiennes et internationales

"La protection des données et le respect de l'éthique sont au cœur de notre démarche. Chaque voix dans notre corpus a été collectée avec le consentement explicite de son propriétaire."

8

Conclusion

Nous présentons ici le premier pipeline professionnel pour un modèle vocal tunisien complet. Malgré des ressources matérielles limitées, nos innovations en :

  • collecte dialectale,
  • diversification géographique,
  • entraînement TTS/STT,
  • évaluation scientifique,
  • design éthique,

nous permettent de poser les fondations d'un écosystème vocal tunisien fiable, naturel et culturellement authentique.

Ce modèle servira de pierre angulaire à 3amAli, à l'API IyedeX Voice et à de futures intégrations B2B.