Skip to main content

Classification de textes suivant plusieurs thésaurus

Italie - Sénat

Scénario n° : 028

Auteur : Sénat d'Italie

Date : 12 juin 2024  
 

Objectif : 

Établir une classification automatique de textes parlementaires suivant plusieurs thésaurus (tels que TESEO et Eurovoc), en vue d'améliorer l'organisation, la recherche et l'extraction d'informations. 

Acteurs : 

  • Équipes de gestion des documents et de recherche du Sénat
  • Équipe du service du développement web et informatique du Sénat
  • Système IA de classification de textes 

Conditions préalables : 

  • Existence d'une base de données de textes parlementaires
  • Modèle d'IA basé sur un grand modèle de langage entraîné à la classification de textes
  • Accès à des thésaurus tels que TESEO et Eurovoc
  • Accessibilité d'Internet aux utilisateurs 

Scénario : 

  1. L'utilisateur accède à un texte parlementaire sur le site web du Sénat.
  2. L'utilisateur lance le processus de classification en cliquant sur un bouton ou en entrant une commande.
  3. Le modèle d'IA basé sur un grand modèle de langage traite le texte pour le classer suivant les thésaurus sélectionnés (p. ex. TESEO ou Eurovoc).
  4. Le système suggère des catégories ou des descripteurs appropriés à partir des thésaurus, en indiquant les raisons de ses propositions.
  5. L'utilisateur approuve ou rejette les descripteurs suggérés.
  6. Le texte classé est assorti des catégories ayant été approuvées.
  7. Les utilisateurs peuvent rechercher et filtrer des documents selon ces classifications. 

Flux alternatifs : 

  • Si le modèle d'IA ne peut établir de classification fiable, il invite l'utilisateur à effectuer une vérification et une correction manuelles.
  • Pour les textes qui couvrent plusieurs catégories, le système peut proposer une sous-classification détaillée. 

Résultats attendus : 

  • La précision et l'efficacité de la classification des textes parlementaires suivant plusieurs thésaurus sont améliorées.
  • L'organisation des documents parlementaires et la facilité de recherche à l'intérieur de ces documents sont améliorées.
  • Le temps et les efforts requis pour la classification manuelle sont réduits.
  • La cohérence et la fiabilité de l'application des catégories de thésaurus sont accrues. 

Problèmes potentiels : 

  • Garantir que le modèle d'IA basé sur un grand modèle de langage puisse classer avec précision différents types de textes suivant différents thésaurus
  • Traiter des documents contenant des termes complexes ou plusieurs catégories pertinentes
  • Actualiser en permanence le modèle d'IA basé sur un grand modèle de langage afin qu'il s'adapte aux changements apportés dans les thésaurus et aux nouveaux types de documents 

Données requises : 

  • Textes classés suivant des thésaurus pour l'entraînement et l'amélioration du modèle d'IA basé sur un grand système de langage
  • Existence d'une base de données de textes parlementaires
  • Accès aux dernières versions des thésaurus (TESEO, Eurovoc, etc.) 

Intégration à d'autres systèmes : 

  • Existence d'une infrastructure du site web du Sénat
  • Systèmes et modèles de traitement IA basés sur un grand modèle de langage
  • Bases de données de thésaurus (TESEO, Eurovoc, etc.) 

Indicateurs de réussite : 

  • Taux de précision des classifications de texte
  • Évaluation de la satisfaction des utilisateurs et commentaires
  • Réduction du temps consacré à la classification manuelle de textes
  • Augmentation du nombre de textes classés automatiquement
  • Cohérence et fiabilité de la classification de différents documents

 

La collection Scénarios d'utilisation de l'IA dans les parlements est publiée par le Centre pour l'innovation au parlement de l'UIP dans le cadre du projet de lignes directrices relatives à la gouvernance de l'IA dirigé par le Pôle de recherche sur les données parlementaires.

Cette collection est publiée sous licence Creative Commons "Attribution – Utilisation non commerciale – Partage dans les mêmes conditions 4.0 International". Le contenu peut être diffusé et réutilisé librement en citant le nom de l'auteur et l'UIP. 

Un scénario d'utilisation décrit le mode de fonctionnement idéal d'un système. Il est conçu pour prévoir, élaborer et évaluer la mise en œuvre.  Un scénario d'utilisation n'est pas une étude de cas, qui se limite à une description de la mise en œuvre concrète d'un projet réel. Nous attirons votre attention sur le fait que le présent scénario est publié tel qu'il nous a été transmis et que ni l'UIP ni l'auteur ne peuvent être tenus responsables de son utilisation.

Pour de plus amples informations sur les travaux de l'UIP dans le domaine de l'intelligence artificielle, veuillez consulter la page https://www.ipu.org/fr/impact/democratie-et-parlements-forts/lintelligence-artificielle ou écrire à l'adresse [email protected].