AUROC et VPP : pourquoi le chiffre publié ne tient pas au déploiement
La prévalence et le seuil, plus que l'architecture, décident si un modèle aide
juillet 2026 · 6 min
Presque tous les articles d'IA-ECG s'ouvrent sur une AUROC entre 0,85 et 0,95. C'est le chiffre qui fait publier le modèle, qui le fait financer et qui le met sur la diapositive du congrès. Il ne dit presque rien de ce que le modèle apportera à un patient dans votre service.
J'ai passé des années à valider des algorithmes ECG dans des hôpitaux américains et européens, par la voie FDA comme par le marquage CE, et j'ai vu le même scénario se répéter. Un modèle à l'AUROC excellente arrive dans un vrai parcours de soins ; la plupart des patients qu'il signale n'ont rien, et les équipes finissent par ignorer ses alertes. Le modèle ne s'est pas dégradé : la maladie est simplement plus rare là où il tourne que ne le laisse croire l'AUROC publiée. Le calcul tient en quelques lignes.
Même modèle, deux services, deux verdicts
L'AUROC mesure une seule chose : devant un patient malade et un patient sain, à quelle fréquence le modèle classe le malade plus haut. C'est une propriété du modèle sur un jeu de test, et elle ne bouge pas quand la prévalence change.
La valeur prédictive positive, elle, bouge. La VPP répond à la question que pose le clinicien — le modèle a signalé ce patient, quelle est la probabilité qu'il ait vraiment la maladie ? — et la réponse dépend presque entièrement de la prévalence là où on déploie.
Prenons l'IA-ECG de l'hyperkaliémie. Dans une validation de la Mayo Clinic, sur un modèle de la même famille que celui commercialisé ensuite par Anumana, où j'ai travaillé, il atteignait une AUROC de 0,88 avec 80 % de sensibilité et 80 % de spécificité. Aux urgences, où environ 1 % des patients avaient une hyperkaliémie sévère, sa VPP était de 3 %. Chez les patients de réanimation — prévalence d'environ 3 % — le même modèle montait à 14 % (Harmon et al., CJASN 2024). Même modèle, même AUROC de 0,88 : seule la prévalence a changé, et on passe d'environ 32 fausses alertes par vrai cas à 6.
L'écart découle du seul théorème de Bayes, à modèle inchangé.
Une spécificité élevée ne suffit pas
La réponse habituelle consiste à pousser la spécificité. On se dit qu'un modèle qui a raison sur 98 % des patients sains ne peut pas crouler sous les faux positifs.
La Cleveland Clinic a déployé un dépistage de la cardiomyopathie hypertrophique par IA-ECG sur 103 492 ECG de pratique courante, avec une spécificité supérieure à 98 %. Il a signalé 1 265 patients, et 691 d'entre eux, soit 54,6 %, n'avaient pas de CMH (Desai et al., JACC: Clinical Electrophysiology 2025). Les faux positifs relevaient souvent d'autres causes d'HVG : cardiopathie hypertensive, rétrécissement aortique.
Ces 54,6 % valent 1 − VPP : la part des patients signalés qui n'avaient pas de CMH. Le taux de faux positifs, lui, reste sous 2 % à plus de 98 % de spécificité. Quand la maladie est rare, 2 % d'une large population indemne suffisent à produire plus de fausses alertes que de vrais cas, même avec une spécificité excellente.
On retrouve le même écart dans toute la littérature
L'exemple n'a pas été choisi pour les besoins de la démonstration. Une revue de 2025 parue dans EMBO Molecular Medicine met côte à côte le dépistage de la dysfonction VG (FEVG altérée) par IA-ECG dans plusieurs contextes. Le modèle d'un même groupe y donne une VPP d'environ 5 à 7 % en consultation externe et d'environ 34 % chez les patients hospitalisés : ce sont les études de Liu et de Tsai, toutes deux recensées dans cette revue (Lin et al.). Ailleurs dans la littérature, la VPP monte jusqu'à environ 83 % dans des populations de dépistage sélectionnées sur le risque. Les valeurs les plus hautes mélangent modèles et cohortes ; elles donnent un ordre de grandeur et ne remplacent pas une comparaison contrôlée. La discrimination, elle, a à peine bougé — les AUROC restent entre 0,92 et 1,0 — quand la VPP varie de plus d'un facteur dix.
Trois pathologies, le même constat :
| Modèle et contexte | Discrimination publiée | VPP sur le terrain |
|---|---|---|
| IA-ECG hyperkaliémie, urgences (prévalence ~1 %, Harmon 2024) | AUROC 0,88 | 3 % |
| Même modèle, réanimation (prévalence ~3 %) | AUROC 0,88 | 14 % |
| Dépistage de la CMH, tout-venant (Desai 2025) | spécificité > 98 % (AUROC non publiée) | ~45 % |
| FEVG altérée, consultation externe (Liu, via la revue de Lin 2025) | AUROC 0,92–1,0 | ~5–7 % |
| Modèle du même groupe, hospitalisation (Tsai, via la revue de Lin 2025) | AUROC 0,92–1,0 | ~34 % |
Une VPP basse n'est pas forcément inutile
Un bon cardiologue opposera ici un contre-argument, et il aura raison : une VPP basse ne condamne pas un modèle. Tout dépend de ce que coûte un faux positif et de ce que coûte un cas manqué. L'hyperkaliémie se confirme par un ionogramme et tue quand on la manque ; un dépistage à 3 % de VPP qui la repère tôt peut donc rester utile. C'est la logique de la cinétique de troponine : un dosage de plus coûte peu, un infarctus manqué coûte cher. Les 45 % de VPP de Desai, pour une maladie aussi rare, placent la probabilité post-test très au-dessus de la probabilité pré-test ; pour un dépistage, c'est un bon résultat.
C'est la VPP qui décide si un déploiement aide les équipes ou les submerge ; l'AUROC ne la montre pas, et il faut la connaître avant la mise en service.
Pour qui achète, construit ou évalue un modèle
J'ai rédigé des rapports de validation destinés à la FDA et aux organismes notifiés. J'exigerais quatre choses.
- La VPP et la VPN à la prévalence réelle du site et au seuil de décision qui sera vraiment utilisé. La VPP bouge avec les deux, et un industriel peut déplacer le seuil sans que la prévalence change.
- Une VPP recalculée, et non celle annoncée par l'industriel : une VPP mesurée dans une cohorte de CHU — 30 % de prévalence — ne se transpose pas telle quelle. Elle se recalcule à la prévalence locale à partir de la sensibilité et de la spécificité publiées, exactement comme le fait la courbe plus haut.
- Un chiffre qui parle aux équipes : les fausses alertes par vrai cas détecté. Une VPP de 3 % ne s'entend plus de la même façon quand on dit « environ 32 bilans inutiles pour chaque vrai cas ».
- Le coût de l'erreur. Chaque faux positif déclenche un examen de plus, un adressage, l'inquiétude d'un patient, et rend le clinicien un peu plus prêt à ignorer l'alerte suivante. C'est ce coût, mis en regard de celui d'un cas manqué, qui décide.
L'IA-ECG fonctionne. Mais la question « est-ce que ça marche ? » n'a pas de réponse tant qu'on n'a pas nommé la population, le seuil et le coût de l'erreur. Demandez la VPP à votre prévalence avant l'AUROC : c'est elle qui fixera le nombre d'alertes que votre service devra traiter.
Liens d'intérêts : j'ai travaillé chez Anumana, qui commercialise les travaux d'IA-ECG de la Mayo Clinic (dont l'étude sur l'hyperkaliémie citée plus haut), et auparavant chez Idoven. Cet article critique des produits proches de mon ancien travail.
Sources : Harmon DM et al., « Validation of Noninvasive Detection of Hyperkalemia by AI-Enhanced ECG in High Acuity Settings », CJASN 2024;19(8):952–958. · Desai MY et al., « Real-World AI-Based ECG Analysis to Diagnose Hypertrophic Cardiomyopathy », JACC: Clinical Electrophysiology 2025;11(6):1324–1333. · Lin CS et al., « Artificial Intelligence–Enabled Electrocardiography from Scientific Research to Clinical Application », EMBO Molecular Medicine 2025 (revue).