Le corpus est public et vérifiable. Les passages avant/après, les liens sources et les empreintes des exports sont téléchargeables.
Le corpus existe.
Le benchmark reste à construire.
Medyx publie aujourd’hui un pool vérifiable de 117 changements documentaires EMA. Il peut servir de socle à un benchmark, mais il ne devient pas une validation tant que les tâches, les annotations humaines et les comparaisons ne sont pas figées.
Trois phrases pour ne pas surinterpréter les chiffres.
117/117 n’est pas une performance générale. La détection est mesurée sur le pool qui a servi à constituer l’index, pas sur un jeu de test indépendant.
Aucun score clinique n’est publié. Avec 0 cas annoté, précision, accord expert et criticité ne sont pas encore mesurables.
Décrire le pipeline, sans transformer une vérification technique en preuve clinique.
Le résultat actuel confirme que la comparaison mécanique retrouve les candidats extraits des documents suivis. Il documente un mécanisme de détection sur un périmètre précis. Il ne mesure ni l’utilité du changement, ni sa gravité, ni la qualité d’une réponse médicale produite à partir de ce passage.
- Unité
- Une paire de passages avant/après
- Périmètre
- 4 documents EMA contributeurs
- Détection mécanique
- 117 cas retrouvés
- Non mesuré
- Précision, sévérité, accord expert, impact clinique
Cinq gates entre un corpus public et un benchmark défendable.
- 01Figer le corpus
Versionner les cas, leurs sources, les règles d’inclusion, les exclusions et les empreintes de fichiers.
Socle public disponible - 02Définir les tâches
Séparer détection, appariement avant/après, classification, criticité et fidélité des réponses citées.
Spécification à publier - 03Faire annoter
Mobiliser au moins deux relecteurs qualifiés, conserver les désaccords et mesurer leur accord.
0 cas annoté à ce jour - 04Comparer des baselines
Évaluer les mêmes entrées avec des règles simples et des modèles identifiés, dans un environnement reproductible.
Runs indépendants à réaliser - 05Publier les erreurs
Rapporter précision, rappel, faux positifs, omissions et sévérité, sans réduire le résultat à une moyenne unique.
Résultats non disponibles
Télécharger les mêmes artefacts que ceux utilisés par l’Evidence Index.
Les exports permettent la revue et la préparation du futur protocole. Ils ne constituent pas encore un benchmark annoté ni un jeu de validation clinique.
Équipe de recherche Medyx (2026). Medyx Evidence Index — Édition 2026.07 (version 2026.07.1). Medyx. https://www.medyx.fr/research/evidence-index
Un benchmark utile commence par une tâche, des relecteurs et un critère de sortie.
Un pilote Medyx peut cadrer ce périmètre sur des sources autorisées, avec des responsables identifiés et une mesure convenue avant l’évaluation.