Scénario n° : 028
Auteur : Sénat d'Italie
Date : 12 juin 2024
Objectif :
Établir une classification automatique de textes parlementaires suivant plusieurs thésaurus (tels que TESEO et Eurovoc), en vue d'améliorer l'organisation, la recherche et l'extraction d'informations.
Acteurs :
- Équipes de gestion des documents et de recherche du Sénat
- Équipe du service du développement web et informatique du Sénat
- Système IA de classification de textes
Conditions préalables :
- Existence d'une base de données de textes parlementaires
- Modèle d'IA basé sur un grand modèle de langage entraîné à la classification de textes
- Accès à des thésaurus tels que TESEO et Eurovoc
- Accessibilité d'Internet aux utilisateurs
Scénario :
- L'utilisateur accède à un texte parlementaire sur le site web du Sénat.
- L'utilisateur lance le processus de classification en cliquant sur un bouton ou en entrant une commande.
- Le modèle d'IA basé sur un grand modèle de langage traite le texte pour le classer suivant les thésaurus sélectionnés (p. ex. TESEO ou Eurovoc).
- Le système suggère des catégories ou des descripteurs appropriés à partir des thésaurus, en indiquant les raisons de ses propositions.
- L'utilisateur approuve ou rejette les descripteurs suggérés.
- Le texte classé est assorti des catégories ayant été approuvées.
- Les utilisateurs peuvent rechercher et filtrer des documents selon ces classifications.
Flux alternatifs :
- Si le modèle d'IA ne peut établir de classification fiable, il invite l'utilisateur à effectuer une vérification et une correction manuelles.
- Pour les textes qui couvrent plusieurs catégories, le système peut proposer une sous-classification détaillée.
Résultats attendus :
- La précision et l'efficacité de la classification des textes parlementaires suivant plusieurs thésaurus sont améliorées.
- L'organisation des documents parlementaires et la facilité de recherche à l'intérieur de ces documents sont améliorées.
- Le temps et les efforts requis pour la classification manuelle sont réduits.
- La cohérence et la fiabilité de l'application des catégories de thésaurus sont accrues.
Problèmes potentiels :
- Garantir que le modèle d'IA basé sur un grand modèle de langage puisse classer avec précision différents types de textes suivant différents thésaurus
- Traiter des documents contenant des termes complexes ou plusieurs catégories pertinentes
- Actualiser en permanence le modèle d'IA basé sur un grand modèle de langage afin qu'il s'adapte aux changements apportés dans les thésaurus et aux nouveaux types de documents
Données requises :
- Textes classés suivant des thésaurus pour l'entraînement et l'amélioration du modèle d'IA basé sur un grand système de langage
- Existence d'une base de données de textes parlementaires
- Accès aux dernières versions des thésaurus (TESEO, Eurovoc, etc.)
Intégration à d'autres systèmes :
- Existence d'une infrastructure du site web du Sénat
- Systèmes et modèles de traitement IA basés sur un grand modèle de langage
- Bases de données de thésaurus (TESEO, Eurovoc, etc.)
Indicateurs de réussite :
- Taux de précision des classifications de texte
- Évaluation de la satisfaction des utilisateurs et commentaires
- Réduction du temps consacré à la classification manuelle de textes
- Augmentation du nombre de textes classés automatiquement
- Cohérence et fiabilité de la classification de différents documents