Étude · septembre 2026

Une garantie à 90 % tient-elle pour les patients malades ?

Un classifieur conforme rend un ensemble de diagnostics possibles au lieu d'une étiquette, avec une garantie sur la fréquence à laquelle cet ensemble contient la bonne réponse. Cette garantie est une moyenne sur tout le monde. J'ai mesuré ce qu'elle donne aux patients en train de faire un infarctus, et ce qu'elle devient dans deux hôpitaux sur lesquels elle n'a pas été calibrée.

3 jeux de données publics · 45 923 tracés · 200 tirages de calibration
État : publié, v1.0.0 · Chaque figure est tracée à partir d'un fichier de résultats versionné

En clair

Un algorithme qui lit des électrocardiogrammes rend d'ordinaire une réponse. Un algorithme conforme rend l'ensemble des réponses qu'il ne peut pas écarter, calibré pour que cet ensemble contienne le bon diagnostic dans 90 cas sur 100, et c'est tout ce que la méthode garantit. L'ensemble ne porte le plus souvent qu'une étiquette, ce qui tranche le cas. Quand il en porte deux, ou aucune, c'est un spécialiste qui lit le tracé.

Les trois quarts de cette population ne font pas d'infarctus, et bien les couvrir suffit à atteindre les 90 %. Mesurée à l'intérieur des seuls cas d'infarctus, sur des patients écartés du réglage mais du même site, la même calibration n'en couvre que 73,2 % — donc plus d'un patient en infarctus sur quatre reçoit un ensemble d'où l'infarctus est absent. Ce seuil part ensuite, inchangé, vers un hôpital du Shandong et vers une cohorte de coronarographie à Chongqing.

Au site où le seuil a été réglé, PTB-XL en Allemagne, sur 2 198 tracés :

73,2 %
des cas d'infarctus
89,9 %
de tous les cas, ce que la garantie contraint

Régler un seuil par étiquette porte la couverture à 90,0 % sur ce site.

Le même seuil, transporté tel quel dans deux hôpitaux chinois :

93,6 %
Shandong, au-dessus de la cible
25 770 tracés
72,5 %
Chongqing, 17,5 points sous la cible
17 955 tracés

À Chongqing, la même correction par classe n'atteint que 84,0 %, sous les 90 % demandés.

Ce qui a été mesuré

Le classifieur atteint 0,932 d'AUROC sur l'étiquette infarctus, face à une valeur de référence publiée de 0,930. Les deux quantités diffèrent — cette valeur est une moyenne sur cinq classes diagnostiques et ne rapporte pas l'infarctus seul — donc leur accord est un contrôle de vraisemblance sur un modèle de référence ordinaire et non une reproduction. Le modèle a ensuite été gelé, donc les écarts de couverture ne viennent que du placement du seuil.

Distributions des scores des cas avec et sans infarctus, avec les frontières de la calibration groupée et de la calibration par étiquette tracées dessus.
Figure 1. Placement des seuils sur le score du modèle pour l'infarctus, PTB-XL pli 10. Gris : 1 648 cas sans infarctus. Corail : 550 cas d'infarctus. Les pointillés marquent les frontières de décision réglées ; les bandes légendées donnent les régions de décision qui en résultent.
Barres empilées donnant, pour chaque étiquette et chacun des trois schémas, la part des cas étiquetés correctement, différés ou étiquetés à tort.
Figure 2. Décomposition des issues par étiquette au site source, moyennée sur 200 tirages de calibration au niveau du patient. Le pli 10 contient 550 cas d'infarctus et 1 648 sans, dont chaque tirage évalue environ la moitié, la note de la figure donnant les moyennes par tirage. Les deux schémas conformes visent une couverture de 90 % et le seuil unique une sensibilité de 90 %. Cela place le seuil unique et la calibration par classe à un taux d'infarctus manqués comparable par construction ; la calibration groupée n'est ajustée sur aucun des deux et ressort à 27 %. Chaque part est rapportée à tous les cas portant cette étiquette, et un cas différé ne compte ni comme juste ni comme faux.
Une grille de barres de couverture, une ligne par site et une colonne par schéma de calibration, le niveau demandé tracé en pointillés dans chaque panneau.
Figure 3. Couverture par site (lignes : PTB-XL 2 198 tracés, Shandong 25 770, Chongqing 17 955) et par schéma de calibration (colonnes : sans correction, par classe, pondérée par le décalage d'étiquettes). Dans chaque panneau, l'axe horizontal est la confiance demandée. Gris : tous les cas. Bleu : cas sans infarctus. Rouge : cas d'infarctus. Pointillés : couverture demandée. Les barres sont des moyennes sur 200 tirages de calibration de PTB-XL, et les moustaches valent un écart-type sur ces tirages, ce qui est la dispersion de la calibration et non l'erreur d'échantillonnage du site.

Limites

L'étude porte sur un jeu de données source, un diagnostic et deux sites cibles — et les deux ont bougé en sens inverse, si bien que la direction et l'ampleur de l'effet sur un troisième site restent inconnues. À Chongqing l'étiquette positive vient d'un diagnostic d'infarctus aigu posé à la sortie et non du tracé, et l'appareillage, la population et les années d'enregistrement diffèrent tous en même temps, de sorte que l'étude mesure l'écart obtenu sans pouvoir l'attribuer.

La couverture est une moyenne sur les cas d'une étiquette et ne dit rien d'un tracé donné. Un clinicien qui lit un résultat positif cherche la probabilité qu'un cas signalé comme infarctus en soit vraiment un, ce qui est une autre quantité. Le travail n'a jamais été éprouvé en usage clinique, et ce n'est pas un dispositif médical.

Où vérifier les chiffres

Le dépôt contient le rapport et ses références, et des tests qui échouent quand un chiffre publié ne correspond plus à sa source.