Toutes les publications
Building MedyxBuilding Medyx 00116 juillet 202610 min

Construire un golden set à partir de changements réglementaires réels.

Ce que 117 candidats extraits de documents EMA nous ont appris sur les doublons, les faux positifs et la différence entre données réelles et données validées.

Journal de constructionProduit · Evaluate
5médicaments dans la collecte initiale
117candidats conservés après nettoyage
20–50cas à sélectionner pour la première version curée

Un cas provenant d’une source officielle n’est pas automatiquement un bon cas d’évaluation. Il doit encore être compris, dédupliqué, qualifié et relu.

01

Partir du suivi des modifications

Nous avons choisi des fichiers EMA « Product Information — Tracked Changes ». Leur structure OOXML conserve les insertions et suppressions, ce qui permet d’extraire des paires avant/après sans demander à un modèle d’inventer la vérité attendue.

La collecte initiale couvre cinq médicaments et produit des candidats issus de modifications réellement publiées. Ce choix améliore la pertinence du matériau brut, mais ne supprime pas le besoin de curation.

02

Trois bugs trouvés avant le benchmark

Une première extraction contenait de nombreux doublons ou cas dont les textes avant et après étaient identiques. Le triage par mots-clés évaluait ensuite tout l’extrait au lieu de la différence réelle, ce qui augmentait artificiellement la priorité de certains cas. Enfin, la détection de section supposait une structure de paragraphes absente de ces exports.

Ces problèmes n’étaient pas des erreurs du modèle évalué. Ils provenaient du dataset et auraient rendu toute métrique trompeuse.

  • Dédupliquer sur le couple avant/après, pas seulement sur l’identifiant du fichier.
  • Scorer la différence réelle, jamais le contexte adjacent non modifié.
  • Adapter la granularité des sections à la structure réellement disponible.
03

Réel ne veut pas dire gold

Les 117 candidats restants sont réels, mais ils ne constituent pas encore un golden set. Certains changements peuvent être purement éditoriaux, incomplets hors de leur tableau ou ambigus sans contexte réglementaire.

Chaque cas final doit recevoir une décision de conservation, une catégorie, une justification, un annotateur et éventuellement un désaccord documenté.

04

Versionner aussi le protocole

Un dataset n’est comparable dans le temps que si son schéma, ses règles d’inclusion et ses annotations sont versionnés. Une correction légitime doit créer une nouvelle version plutôt que modifier silencieusement le score historique.

Medyx sépare donc les candidats, les cas curés, les runs et les résultats. Le système de comparaison peut évoluer sans réécrire les attentes humaines.

05

La première publication utile

La première version publique devrait rester petite : 20 à 50 cas difficiles, bien expliqués, avec leur provenance et leurs limites. Un corpus réduit mais relu est plus utile qu’un grand chiffre impossible à auditer.

Sources et lectures officielles01
EMA — Artificial intelligence in the medicinal product lifecyclePrincipes de gestion du risque, contexte d’usage, données, performance et cycle de vie.
02
FDA — Guiding Principles of Good AI Practice in Drug DevelopmentDix principes communs FDA–EMA publiés pour le développement des médicaments.
Continuer la lecture

Trois notes reliées à ce sujet.

01Medyx Evidence Notes
Evidence Note 001 · Evaluate

Un score de similarité de 1,0 peut masquer un changement médical important.

16 juillet 2026 · 9 min
02Building Medyx
Building Medyx 002 · Models

Souveraineté médicale : faut-il vraiment tout entraîner soi-même ?

16 juillet 2026 · 8 min
03Building Medyx
Building Medyx 003 · Les quatre produits

Du PDF réglementaire à la décision vérifiable.

16 juillet 2026 · 9 min