Construire un golden set à partir de changements réglementaires réels.
Ce que 117 candidats extraits de documents EMA nous ont appris sur les doublons, les faux positifs et la différence entre données réelles et données validées.
Un cas provenant d’une source officielle n’est pas automatiquement un bon cas d’évaluation. Il doit encore être compris, dédupliqué, qualifié et relu.
Partir du suivi des modifications
Nous avons choisi des fichiers EMA « Product Information — Tracked Changes ». Leur structure OOXML conserve les insertions et suppressions, ce qui permet d’extraire des paires avant/après sans demander à un modèle d’inventer la vérité attendue.
La collecte initiale couvre cinq médicaments et produit des candidats issus de modifications réellement publiées. Ce choix améliore la pertinence du matériau brut, mais ne supprime pas le besoin de curation.
Trois bugs trouvés avant le benchmark
Une première extraction contenait de nombreux doublons ou cas dont les textes avant et après étaient identiques. Le triage par mots-clés évaluait ensuite tout l’extrait au lieu de la différence réelle, ce qui augmentait artificiellement la priorité de certains cas. Enfin, la détection de section supposait une structure de paragraphes absente de ces exports.
Ces problèmes n’étaient pas des erreurs du modèle évalué. Ils provenaient du dataset et auraient rendu toute métrique trompeuse.
- Dédupliquer sur le couple avant/après, pas seulement sur l’identifiant du fichier.
- Scorer la différence réelle, jamais le contexte adjacent non modifié.
- Adapter la granularité des sections à la structure réellement disponible.
Réel ne veut pas dire gold
Les 117 candidats restants sont réels, mais ils ne constituent pas encore un golden set. Certains changements peuvent être purement éditoriaux, incomplets hors de leur tableau ou ambigus sans contexte réglementaire.
Chaque cas final doit recevoir une décision de conservation, une catégorie, une justification, un annotateur et éventuellement un désaccord documenté.
Versionner aussi le protocole
Un dataset n’est comparable dans le temps que si son schéma, ses règles d’inclusion et ses annotations sont versionnés. Une correction légitime doit créer une nouvelle version plutôt que modifier silencieusement le score historique.
Medyx sépare donc les candidats, les cas curés, les runs et les résultats. Le système de comparaison peut évoluer sans réécrire les attentes humaines.
La première publication utile
La première version publique devrait rester petite : 20 à 50 cas difficiles, bien expliqués, avec leur provenance et leurs limites. Un corpus réduit mais relu est plus utile qu’un grand chiffre impossible à auditer.