Skip to main content

Classification de textes d'entrée au moyen des libellés prédéfinis du thésaurus EuroVoc

Parlement européen

Scénario n° : 013

Auteur : Parlement européen

Date : 5 juin 2024 
 

Objectif :

L'équipe de l'Unité Innovation, Intranets et Solutions numériques (INNOVIT) a mis au point cet outil d'indexation automatique basé sur EUBERT pour classer des textes d'entrée au moyen des libellés prédéfinis du thésaurus EuroVoc de l'Union européenne (UE). 

EuroVoc est un important thésaurus hiérarchique pluridisciplinaire et multilingue (24 langues de l'UE) contenant plus de 7000 entrées couvrant les activités des institutions de l'UE. Compte tenu du nombre de documents juridiques produits chaque jour et de l'énorme volume de documents préexistants à classer, les méthodes efficaces de classification automatisées ou semi-automatisées dans ce domaine sont d’une grande utilité. 

Basé sur le réseau neuronal profond BERT, ce modèle a été entraîné avec plus de 3 200 000 documents pour réaliser cette tâche. Il est utilisé dans un environnement de production via le point de terminaison d'inférence HuggingFace. Il prend en charge les 24 langues de l'UE. 

Acteurs :

  • Unité Innovation, Intranets et Solutions numériques (INNOVIT)
  • Direction de l'édition, de l'innovation et de la gestion des données
  • Direction générale de l'innovation et du support technologique (DG ITEC) 

Conditions préalables :

  • Aucune configuration matérielle ou logicielle requise si l'interface utilisateur final est utilisée
  • Critères de codage et de package si le modèle est intégré à une solution existante 

Scénario :

  1. L'utilisateur final entre un document à classer.
  2. Le système traite le document et génère un ensemble de libellés prédéfinis assortis d’indices de confiance correspondants. 

Flux alternatifs :

  • Si le document est rédigé dans une langue non prise en charge par le modèle, le système le signalera comme non pris en charge. 

Résultats attendus :

  • Le système génère une classification précise de documents juridiques et politiques suivant la classification du thésaurus EuroVoc.
  • La classification des documents au sein des institutions de l'UE est plus efficace et plus précise. 

Problèmes potentiels :

  • Garantir la précision du modèle dans les 24 langues
  • Traiter des segments de texte ambigus ou mal structurés
  • Maintenir la performance et la rapidité avec des documents très volumineux 

Données requises :

  • Entrée : documents texte dans l'une des 24 langues de l'UE prises en charge
  • Libellés de classification EuroVoc prédéfinis (le thésaurus EuroVoc a été élaboré par le Parlement européen en collaboration avec l'Office des publications de l'UE et compte plus de 7000 entrées)
  • Données visant à régler et entraîner le modèle (Registre public des documents du Parlement européen)

Intégration à d'autres systèmes :

  • Le modèle est intégré à plusieurs applications développées en interne, telles que Monitor Partners’ Interest, une solution d'agrégation de contenu pour le raclage, la traduction et l'indexation de sites web et de sources d'intérêt. 

Indicateurs de réussite :

  • Micro score F1 (valeur seuil : 0,46)
  • Scores élevés de gain cumulé actualisé normalisé (NDCG)
  • Satisfaction et commentaires des utilisateurs finaux concernant l'exactitude et la pertinence de la classification

 

La collection Scénarios d'utilisation de l'IA dans les parlements est publiée par le Centre pour l'innovation au parlement de l'UIP dans le cadre du projet de lignes directrices relatives à la gouvernance de l'IA dirigé par le Pôle de recherche sur les données parlementaires.

Cette collection est publiée sous licence Creative Commons "Attribution – Utilisation non commerciale – Partage dans les mêmes conditions 4.0 International". Le contenu peut être diffusé et réutilisé librement en citant le nom de l'auteur et l'UIP. 

Un scénario d'utilisation décrit le mode de fonctionnement idéal d'un système. Il est conçu pour prévoir, élaborer et évaluer la mise en œuvre.  Un scénario d'utilisation n'est pas une étude de cas, qui se limite à une description de la mise en œuvre concrète d'un projet réel. Nous attirons votre attention sur le fait que le présent scénario est publié tel qu'il nous a été transmis et que ni l'UIP ni l'auteur ne peuvent être tenus responsables de son utilisation.

Pour de plus amples informations sur les travaux de l'UIP dans le domaine de l'intelligence artificielle, veuillez consulter la page https://www.ipu.org/fr/impact/democratie-et-parlements-forts/lintelligence-artificielle ou écrire à l'adresse [email protected].