Scénario n° : 017
Auteur : Riigikogu (Parlement estonien)
Date : 5 juin 2024
Objectifs :
Produire des sous-titres de façon automatisée au moyen de l'IA afin que les séances en salle plénière soient accessibles en direct aux personnes malentendantes en générant efficacement la représentation écrite des allocutions.
Acteurs :
- Parlementaires (allocutions de parlementaires dans la salle plénière)
- Système d'enregistrement et de diffusion vidéo
- Outil de synthèse vocale en temps réel
Conditions préalables :
- Système de synthèse vocale en temps réel bien entraîné et de bonne qualité
- Volonté de confier une partie des tâches réalisées par des humains au système d'IA
Scénario :
- Le système d'enregistrement et de diffusion vidéo produit un flux vidéo et audio destiné aux téléspectateurs.
- Un flux audio est envoyé via un outil de synthèse vocale en temps réel.
- L'outil de synthèse vocale en temps réel produit des sous-titres à partir du flux audio. Il peut détecter les changements de locuteur, essayer de reformer des mots non reconnus (au moyen d'un outil de passage de phonème à graphème), utiliser la reconnaissance de mots composés pour construire des mots composés et insérer des signes de ponctuation.
- L'outil envoie les sous-titres générés afin qu’ils soient insérés sur Youtube Live.
- Dans l'environnement sélectionné, le flux de sous-titres doit être affiché avec le flux principal.
Flux alternatifs :
- Une alternative consiste à créer manuellement des sous-titres en ligne, ce qui est une tâche très laborieuse, en particulier pour les contenus plus longs.
Résultats attendus :
- Réduction des besoins en main-d’œuvre humaine
Problèmes potentiels :
- Ce système commet plus d'erreurs lors de la composition du texte car il a moins de temps pour traiter les signaux audio.
Intégration à d'autres systèmes :
- Il n'existe pas de besoin spécifique en matière d’intégration, mais toute forme d'intégration rendra l'ensemble du système plus automatisé et réduira davantage le besoin de main-d'œuvre humaine.
Indicateurs de réussite :
- Le taux d'erreur de synthèse vocale est inférieur à 40 %.