Skip to main content

Normalisation des données relatives aux affaires et documents parlementaires

Finlande

Scénario n° : 046

Auteur : Parlement de Finlande

Date : 2 juillet 2024
 

Objectif :

Normaliser automatiquement les affaires et les documents parlementaires (2001-2014) afin qu'ils respectent la structure logique des données les plus récentes en vue de rendre les matériaux plus faciles à trouver, accessibles, interopérables et réutilisables (FAIR) pour la recherche et les interfaces de programmation d'applications.

Acteurs :

  • Fournisseur de logiciel
  • Propriétaires d'entreprises parlementaires
  • Service informatique du parlement
  • Outils d'IA

Conditions préalables :

  • Base de données des affaires et documents parlementaires, 2001-2014 (SGML) 
  • Base de données des affaires et documents parlementaires, 2015-2024 (XML) 
  • Modèle de données et de schémas pour 2015-2024
  • Service d'apprentissage automatique entraîné sur le modèle de données et de schémas
  • Service de traitement du langage naturel utilisant l'apprentissage automatique pour repérer les idées et les relations dans un texte

Scénario :

  1. Le fournisseur de logiciel collecte les données provenant des bases de données définies, avec l'aide du service informatique. 
  2. Le fournisseur de logiciel filtre les données de mauvaise qualité, incorrectes et indésirables et obtient éventuellement les informations manquantes nécessaires avec le soutien des propriétaires d'entreprise.
  3. Le fournisseur de logiciel stocke les données converties pour traitement ultérieur.
  4. Le fournisseur de logiciel identifie des clés candidates pour la relation et sélectionne la plus appropriée comme clé primaire de la relation en coopération avec les propriétaires d'entreprise.
  5. Le fournisseur de logiciel et le service informatique fournissent des données aux outils d'IA pour la normalisation (entrée), ainsi que du matériel d'apprentissage (sortie attendue) par rapport auquel l'entrée est normalisée.
  6. Après la normalisation par l'IA, le fournisseur de logiciel lance le contrôle de normalisation sur une base relation par relation. Le contrôle de normalisation nécessite l'intervention (aléatoire ou technique) des propriétaires d'entreprise pour vérifier que le résultat est correct.

Flux alternatifs :

  • Le processus de normalisation des données est réalisé entièrement manuellement.

Résultats attendus :

  • Les données au format SGML peuvent être normalisées vers le schéma XML le plus récent.
  • Les affaires et les documents parlementaires pour 2001-2024 utilisent le même modèle de données et de schéma.
  • Des critères de recherche similaires peuvent être appliqués aux affaires parlementaires et aux documents, quelle que soit l'année d'origine des données.

Problèmes potentiels :

  • Graves failles dans la définition des préréglages de l'outil visant à unifier les données
  • Résultats excessivement imprécis du traitement automatique obligeant à réaliser davantage de tâches manuellement
  • Traitement automatique des données imprécis pouvant conduire à réévaluer la normalisation des données, car le volume de tâches à exécuter manuellement est susceptible de dépasser les avantages

Données requises :

  • Données fiables pour l'entraînement à l'analyse de données

Intégration à d'autres systèmes :

  • Service d'apprentissage automatique
  • Service de traitement du langage naturel 
  • Outils de modélisation et d'analyse des données
  • Base de données opérationnelle finale

Indicateurs de réussite :

  • Les données atteignent la troisième forme normale (3NF).
  • Le contenu des données dans la base de données opérationnelle est correct à 98 %.
  • En raison de la normalisation automatique, on ne trouve pas plus de 2 % d'erreurs dans les affaires et les documents parlementaires concernant le volume des données traitées.

 

La collection Scénarios d'utilisation de l'IA dans les parlements est publiée par le Centre pour l'innovation au parlement de l'UIP dans le cadre du projet de lignes directrices relatives à la gouvernance de l'IA dirigé par le Pôle de recherche sur les données parlementaires.

Cette collection est publiée sous licence Creative Commons "Attribution – Utilisation non commerciale – Partage dans les mêmes conditions 4.0 International". Le contenu peut être diffusé et réutilisé librement en citant le nom de l'auteur et l'UIP. 

Un scénario d'utilisation décrit le mode de fonctionnement idéal d'un système. Il est conçu pour prévoir, élaborer et évaluer la mise en œuvre.  Un scénario d'utilisation n'est pas une étude de cas, qui se limite à une description de la mise en œuvre concrète d'un projet réel. Nous attirons votre attention sur le fait que le présent scénario est publié tel qu'il nous a été transmis et que ni l'UIP ni l'auteur ne peuvent être tenus responsables de son utilisation.

Pour de plus amples informations sur les travaux de l'UIP dans le domaine de l'intelligence artificielle, veuillez consulter la page https://www.ipu.org/fr/impact/democratie-et-parlements-forts/lintelligence-artificielle ou écrire à l'adresse [email protected].