Scénario n° : 006
Auteur : Département informatique, Chambre des députés d'Italie
Date : 22 mai 2024
Objectif :
Générer des transcriptions de manuscrits d’archives historiques.
Acteurs :
- Services opérationnels
- Manuscrits d’archives historiques
Conditions préalables :
- Manuscrits d'archives historiques numérisés (p. ex. au format PNG) servant de données d’apprentissage
- Modèle d'apprentissage profond (deep learning) entraîné au moyen des données d’apprentissage
Scénario :
- Les images d'entrée, correspondant à des pages d'archives historiques, sont passées dans le modèle d'apprentissage profond.
- Le modèle identifie les lignes de texte manuscrit.
- Il transcrit chaque ligne et génère le texte correspondant.
- Le texte apparaît à l’écran puis est stocké au format TXT et PDF.
Résultats attendus :
- La transcription de manuscrits d'archives historiques prend moins de temps.
- La numérisation des manuscrits prend moins de temps.
- Les manuscrits sont convertis au format numérique.
Problèmes potentiels :
- Le modèle d'apprentissage profond doit être suffisamment performant pour gérer le bruit dans les pages de manuscrit numérisées (papier endommagé, taches d'encre, etc.).
- Empêcher le surapprentissage afin d'éviter une perte de généralité. Le modèle d'apprentissage profond pourrait devenir trop adapté à la calligraphie de l'auteur du manuscrit.
Données requises :
- Images numérisées (p. ex. au format PNG) de pages de manuscrits d'archives historiques
Intégration à d'autres systèmes :
- Application utilisée pour gérer les archives historiques
Indicateurs de réussite :
- Temps nécessaire pour transcrire une page
- Temps nécessaire pour transcrire l'intégralité d'un manuscrit
- Nombre de caractères mal transcrits
- Nombre de mots mal transcrits
- Nombre de phrases mal transcrites