Étude · septembre 2026
Une garantie à 90 % tient-elle pour les patients malades ?
Un classifieur conforme rend un ensemble de diagnostics possibles au lieu d'une étiquette, avec une garantie sur la fréquence à laquelle cet ensemble contient la bonne réponse. Cette garantie est une moyenne sur tout le monde. J'ai mesuré ce qu'elle donne aux patients en train de faire un infarctus, et ce qu'elle devient dans deux hôpitaux sur lesquels elle n'a pas été calibrée.
3 jeux de données publics · 45 923 tracés · 200 tirages de calibration
État : publié, v1.0.0 · Chaque figure est tracée à partir d'un fichier de résultats versionné
En clair
Un algorithme qui lit des électrocardiogrammes rend d'ordinaire une réponse. Un algorithme conforme rend l'ensemble des réponses qu'il ne peut pas écarter, calibré pour que cet ensemble contienne le bon diagnostic dans 90 cas sur 100, et c'est tout ce que la méthode garantit. L'ensemble ne porte le plus souvent qu'une étiquette, ce qui tranche le cas. Quand il en porte deux, ou aucune, c'est un spécialiste qui lit le tracé.
Les trois quarts de cette population ne font pas d'infarctus, et bien les couvrir suffit à atteindre les 90 %. Mesurée à l'intérieur des seuls cas d'infarctus, sur des patients écartés du réglage mais du même site, la même calibration n'en couvre que 73,2 % — donc plus d'un patient en infarctus sur quatre reçoit un ensemble d'où l'infarctus est absent. Ce seuil part ensuite, inchangé, vers un hôpital du Shandong et vers une cohorte de coronarographie à Chongqing.
Au site où le seuil a été réglé, PTB-XL en Allemagne, sur 2 198 tracés :
Régler un seuil par étiquette porte la couverture à 90,0 % sur ce site.
Le même seuil, transporté tel quel dans deux hôpitaux chinois :
À Chongqing, la même correction par classe n'atteint que 84,0 %, sous les 90 % demandés.
Ce qui a été mesuré
Le classifieur atteint 0,932 d'AUROC sur l'étiquette infarctus, face à une valeur de référence publiée de 0,930. Les deux quantités diffèrent — cette valeur est une moyenne sur cinq classes diagnostiques et ne rapporte pas l'infarctus seul — donc leur accord est un contrôle de vraisemblance sur un modèle de référence ordinaire et non une reproduction. Le modèle a ensuite été gelé, donc les écarts de couverture ne viennent que du placement du seuil.



Limites
L'étude porte sur un jeu de données source, un diagnostic et deux sites cibles — et les deux ont bougé en sens inverse, si bien que la direction et l'ampleur de l'effet sur un troisième site restent inconnues. À Chongqing l'étiquette positive vient d'un diagnostic d'infarctus aigu posé à la sortie et non du tracé, et l'appareillage, la population et les années d'enregistrement diffèrent tous en même temps, de sorte que l'étude mesure l'écart obtenu sans pouvoir l'attribuer.
La couverture est une moyenne sur les cas d'une étiquette et ne dit rien d'un tracé donné. Un clinicien qui lit un résultat positif cherche la probabilité qu'un cas signalé comme infarctus en soit vraiment un, ce qui est une autre quantité. Le travail n'a jamais été éprouvé en usage clinique, et ce n'est pas un dispositif médical.
Où vérifier les chiffres
Le dépôt contient le rapport et ses références, et des tests qui échouent quand un chiffre publié ne correspond plus à sa source.