Benchmarks · état public 2026.07

Le corpus existe.
Le benchmark reste à construire.

Medyx publie aujourd’hui un pool vérifiable de 117 changements documentaires EMA. Il peut servir de socle à un benchmark, mais il ne devient pas une validation tant que les tâches, les annotations humaines et les comparaisons ne sont pas figées.

Lecture correcte

Trois phrases pour ne pas surinterpréter les chiffres.

Le corpus est public et vérifiable. Les passages avant/après, les liens sources et les empreintes des exports sont téléchargeables.

117/117 n’est pas une performance générale. La détection est mesurée sur le pool qui a servi à constituer l’index, pas sur un jeu de test indépendant.

Aucun score clinique n’est publié. Avec 0 cas annoté, précision, accord expert et criticité ne sont pas encore mesurables.

117changements candidatspaires avant/après issues de documents EMA
116paires textuelles uniquesaprès contrôle global des doublons
4documents sourcescorpus encore étroit et concentré
9signaux prioritairestri lexical, pas jugement clinique
0annotations expertesgate bloquante avant validation
Mesures publiables aujourd’hui

Décrire le pipeline, sans transformer une vérification technique en preuve clinique.

Le résultat actuel confirme que la comparaison mécanique retrouve les candidats extraits des documents suivis. Il documente un mécanisme de détection sur un périmètre précis. Il ne mesure ni l’utilité du changement, ni sa gravité, ni la qualité d’une réponse médicale produite à partir de ce passage.

Unité
Une paire de passages avant/après
Périmètre
4 documents EMA contributeurs
Détection mécanique
117 cas retrouvés
Non mesuré
Précision, sévérité, accord expert, impact clinique
Protocole de passage

Cinq gates entre un corpus public et un benchmark défendable.

  1. 01
    Figer le corpus

    Versionner les cas, leurs sources, les règles d’inclusion, les exclusions et les empreintes de fichiers.

    Socle public disponible
  2. 02
    Définir les tâches

    Séparer détection, appariement avant/après, classification, criticité et fidélité des réponses citées.

    Spécification à publier
  3. 03
    Faire annoter

    Mobiliser au moins deux relecteurs qualifiés, conserver les désaccords et mesurer leur accord.

    0 cas annoté à ce jour
  4. 04
    Comparer des baselines

    Évaluer les mêmes entrées avec des règles simples et des modèles identifiés, dans un environnement reproductible.

    Runs indépendants à réaliser
  5. 05
    Publier les erreurs

    Rapporter précision, rappel, faux positifs, omissions et sévérité, sans réduire le résultat à une moyenne unique.

    Résultats non disponibles
Corpus candidat

Télécharger les mêmes artefacts que ceux utilisés par l’Evidence Index.

Les exports permettent la revue et la préparation du futur protocole. Ils ne constituent pas encore un benchmark annoté ni un jeu de validation clinique.

Équipe de recherche Medyx (2026). Medyx Evidence Index — Édition 2026.07 (version 2026.07.1). Medyx. https://www.medyx.fr/research/evidence-index
Contribuer au protocole

Un benchmark utile commence par une tâche, des relecteurs et un critère de sortie.

Un pilote Medyx peut cadrer ce périmètre sur des sources autorisées, avec des responsables identifiés et une mesure convenue avant l’évaluation.

Demander un piloteOuvrir Explorer