D'ABBYY XML à Org Mode
Les livres numérisés sont souvent distribués sous forme d'images de pages, de texte OCR brut, de PDF ou de fichiers ABBYY XML. Le texte brut est facile à lire mais perd la structure. Le PDF préserve l'apparence visuelle mais se corrige et se republie difficilement. ABBYY XML peut constituer un meilleur point de départ, car il décrit les pages, les régions, les lignes, les mots, les styles et des informations de confiance.
Pourquoi Org mode
Org mode est un format source intermédiaire pratique : il est en texte brut, versionnable, modifiable manuellement et exportable vers HTML, LaTeX, PDF, EPUB et d'autres formats. Il peut représenter des titres, paragraphes, listes, tableaux, notes, liens, images et métadonnées sans enfermer le travail éditorial dans une application propriétaire.
Le problème de conversion
Un convertisseur doit reconstruire une structure logique à partir de données OCR orientées page. Les tâches typiques comprennent :
- réunir les lignes en paragraphes tout en préservant les véritables sauts ;
- détecter les titres à partir des informations de style et de mise en page ;
- supprimer les en-têtes, pieds de page et numéros de page répétés ;
- conserver les emphases et caractères spéciaux ;
- localiser les images et leur associer les légendes ;
- reconstruire les tableaux à partir des cellules ou des coordonnées ;
- relier les appels de notes à leurs corps ;
- préserver la provenance par page pour permettre une vérification ultérieure.
Confiance et ambiguïté
Une sortie OCR est une donnée probante, pas une vérité. Les mots à faible confiance, les typographies inhabituelles, les césures, les notations mathématiques et les orthographes historiques demandent des traitements différents. Le convertisseur doit éviter de remplacer silencieusement un contenu incertain par une supposition.
Une chaîne de travail utile consigne les avertissements et conserve assez d'informations de localisation pour revenir d'un paragraphe Org à l'image de page ou à la région XML correspondante.
Édition reproductible
L'archive OCR brute doit rester immuable. Le code de conversion produit un premier document Org et un rapport lisible par machine. Les corrections manuelles sont ensuite versionnées séparément, afin que les améliorations du parseur n'effacent pas le travail éditorial.
Pour les ouvrages volumineux, le processus gagne à être découpé explicitement : conversion structurelle, normalisation, vérifications automatisées, comparaison visuelle, révision éditoriale et export final.
Images et tableaux
Les images doivent être extraites comme des ressources indépendantes avec des noms et des liens stables. Les tableaux exigent une prudence particulière : l'alignement visuel dans les données OCR n'encode pas toujours correctement les relations sémantiques entre lignes et colonnes. Lorsque la reconstruction est incertaine, conserver une image du tableau original avec une transcription partielle vaut mieux que fabriquer une fausse précision.
Objectif
Le résultat final doit être lisible, corrigeable et régénérable. La qualité de la conversion ne se mesure pas seulement à l'exactitude des caractères, mais aussi à la manière dont la structure intellectuelle du document et sa provenance survivent à la transformation.