Scénario n° : 013
Auteur : Parlement européen
Date : 5 juin 2024
Objectif :
L'équipe de l'Unité Innovation, Intranets et Solutions numériques (INNOVIT) a mis au point cet outil d'indexation automatique basé sur EUBERT pour classer des textes d'entrée au moyen des libellés prédéfinis du thésaurus EuroVoc de l'Union européenne (UE).
EuroVoc est un important thésaurus hiérarchique pluridisciplinaire et multilingue (24 langues de l'UE) contenant plus de 7000 entrées couvrant les activités des institutions de l'UE. Compte tenu du nombre de documents juridiques produits chaque jour et de l'énorme volume de documents préexistants à classer, les méthodes efficaces de classification automatisées ou semi-automatisées dans ce domaine sont d’une grande utilité.
Basé sur le réseau neuronal profond BERT, ce modèle a été entraîné avec plus de 3 200 000 documents pour réaliser cette tâche. Il est utilisé dans un environnement de production via le point de terminaison d'inférence HuggingFace. Il prend en charge les 24 langues de l'UE.
Acteurs :
- Unité Innovation, Intranets et Solutions numériques (INNOVIT)
- Direction de l'édition, de l'innovation et de la gestion des données
- Direction générale de l'innovation et du support technologique (DG ITEC)
Conditions préalables :
- Aucune configuration matérielle ou logicielle requise si l'interface utilisateur final est utilisée
- Critères de codage et de package si le modèle est intégré à une solution existante
Scénario :
- L'utilisateur final entre un document à classer.
- Le système traite le document et génère un ensemble de libellés prédéfinis assortis d’indices de confiance correspondants.
Flux alternatifs :
- Si le document est rédigé dans une langue non prise en charge par le modèle, le système le signalera comme non pris en charge.
Résultats attendus :
- Le système génère une classification précise de documents juridiques et politiques suivant la classification du thésaurus EuroVoc.
- La classification des documents au sein des institutions de l'UE est plus efficace et plus précise.
Problèmes potentiels :
- Garantir la précision du modèle dans les 24 langues
- Traiter des segments de texte ambigus ou mal structurés
- Maintenir la performance et la rapidité avec des documents très volumineux
Données requises :
- Entrée : documents texte dans l'une des 24 langues de l'UE prises en charge
- Libellés de classification EuroVoc prédéfinis (le thésaurus EuroVoc a été élaboré par le Parlement européen en collaboration avec l'Office des publications de l'UE et compte plus de 7000 entrées)
- Données visant à régler et entraîner le modèle (Registre public des documents du Parlement européen)
Intégration à d'autres systèmes :
- Le modèle est intégré à plusieurs applications développées en interne, telles que Monitor Partners’ Interest, une solution d'agrégation de contenu pour le raclage, la traduction et l'indexation de sites web et de sources d'intérêt.
Indicateurs de réussite :
- Micro score F1 (valeur seuil : 0,46)
- Scores élevés de gain cumulé actualisé normalisé (NDCG)
- Satisfaction et commentaires des utilisateurs finaux concernant l'exactitude et la pertinence de la classification