July 30, 2026
DeepECG-Tok
Rohan Banerjee, Juliette Beaulieu, Nicolas Dostie, Blandine Mondésert, Ram Ahuja, Alexis Nolin-Lapalme MD-PhD, Gilbert Jabbour, Shreya Shree Srikanth, Guillaume Marquis-Gravel, Olivier Tastet, Achille Sowa, Julia Cadrin-Tourigny MD-PhD, Jacques Delfrate MSc, Robert Avram MD-MSc
Un modèle unifié ECG-langage à 12 dérivations pour l’interprétation et la prédiction de critères cliniques

L’interprétation automatisée de l’ECG reposait traditionnellement sur des modèles spécialisés : un modèle pour classer le rythme, un autre pour détecter la dysfonction ventriculaire gauche, un autre pour prédire le risque de fibrillation auriculaire et un autre pour générer un compte rendu. DeepECG-Tok remplace cette approche fragmentée par un système unique guidé par des instructions, capable de répondre directement à différentes questions cliniques à partir du même ECG à 12 dérivations.

L’idée centrale consiste à traiter l’ECG comme un langage que le modèle peut apprendre. DeepECG-Tok transforme les signaux cardiaques continus en jetons discrets et compacts, aligne ces jetons avec le texte clinique, puis les utilise pour conditionner un grand modèle de langage médical. Le modèle obtenu peut générer des interprétations en texte libre, produire des comptes rendus structurés, reconnaître des anomalies diagnostiques et estimer des critères cliniques importants.

Des signaux cardiaques aux jetons de langage

DeepECG-Tok repose sur un entraînement en trois étapes :

  1. Tokenisation de l’ECG : un modèle de quantification vectorielle résiduelle appelé QINCo compresse un ECG à 12 dérivations en jetons discrets qui préservent la morphologie, tandis qu’un décodeur reconstruit le signal original.
  2. Alignement ECG-texte : un Q-Former apprend à aligner les jetons ECG gelés avec les comptes rendus cliniques appariés.
  3. Ajustement par instructions : la représentation ECG alignée conditionne MedGemma 4B-IT, ce qui permet au modèle de répondre à des requêtes cliniques en langage naturel.

Le tokenizeur a été entraîné sur 1,91 million d’ECG provenant de l’Institut de cardiologie de Montréal, de MIMIC-IV et de CODE-15. Ses représentations gelées ont obtenu une AUROC macro-moyennée de 0,96 (IC à 95 % : 0,95–0,96) pour 77 affections diagnostiques, surpassant les modèles DeepECG supervisé et auto-supervisé. Sans nouvel entraînement, la représentation s’est transférée aux cohortes CLSA et Harvard-Emory, avec des AUROC macro-moyennées de 0,88 (IC à 95 % : 0,87–0,91) et 0,90 (IC à 95 % : 0,89–0,91), respectivement.

Cadre d’entraînement en trois étapes et évaluation de DeepECG-Tok
Figure 1. Cadre d’entraînement de DeepECG-Tok, évaluation clinique et étude de lecteurs cardiologues.

Un seul modèle pour de nombreuses questions cliniques

Le modèle ajusté par instructions a été entraîné sur plus de 7,27 millions de paires question-réponse dérivées de plus d’un million d’ECG. Les requêtes couvraient l’interprétation en texte libre, les comptes rendus JSON structurés, la classification normale ou anormale, les troubles du rythme et de la conduction, l’ischémie et l’infarctus, l’hypertrophie des cavités, les mesures d’intervalles et les critères cliniques.

Contrairement aux classificateurs ECG conventionnels, DeepECG-Tok peut répondre à des questions telles que :

Cette conception unifiée élimine la nécessité d’entraîner et de maintenir une tête de prédiction distincte pour chaque tâche.

Questions cliniques et réponses représentatives

L’évaluation supplémentaire montre comment un même modèle peut passer de questions diagnostiques ciblées à des sorties structurées et à une interprétation ouverte. Puisqu’il s’agit de résultats directs du modèle, les questions, les réponses de référence et les réponses du modèle ci-dessous sont reproduites dans leur version originale anglaise du Tableau supplémentaire 20, avec seulement des ajustements mineurs d’espacement et de capitalisation pour faciliter la lecture. Elles comprennent à la fois des réponses solides et une erreur afin d’illustrer les capacités actuelles du modèle et ses limites.

Clinical questionReference answerDeepECG-Tok answer
Can you assess for chamber abnormalities?Left atrial enlargement; Left ventricular hypertrophyLeft atrial enlargement; Left ventricular hypertrophy
Can you identify the cardiac rhythm?Yes - Atrial tachycardia (>= 100 BPM); Ventricular rhythm (HR: 129.0 bpm); Irregularly irregular rhythm; Atrial fibrillation; Premature ventricular complexYes - Atrial tachycardia (>= 100 BPM); Irregularly irregular rhythm (HR: 129.0 bpm); Atrial fibrillation; Premature ventricular complex
Are there any fascicular blocks?Yes - Left anterior fascicular block; Right bundle branch block; Left axis deviationYes - Left anterior fascicular block; Right bundle branch block; Left axis deviation
Can you identify any signs of myocardial injury?Yes - ST depression (lateral leads - I, aVL, V5-V6); ST depression (inferior leads - II, III, aVF); ST depression (anterior leads - V3-V4); ST depression in inferior - II, III, aVF; ST depression in anterior - V3-V4; ST depression in lateral - I, aVL, V5-V6; T-wave inversion in inferior - II, III, aVF; T-wave inversion in lateral - I, aVL, V5-V6; T-wave inversion in anterior - V3-V4; T-wave inversion in septal - V1-V2Yes - ST depression (lateral leads - I, aVL, V5-V6); ST depression (inferior leads - II, III, aVF); ST depression (anterior leads - V3-V4); ST depression in inferior - II, III, aVF; ST depression in anterior - V3-V4; ST depression in septal - V1-V2; T-wave inversion in lateral - I, aVL, V5-V6
Are the T waves normal in morphology?No - T-wave inversions present in inferior - II, III, aVF; lateral - I, aVL, V5-V6; anterior - V3-V4; septal - V1-V2No - T-wave inversions present in inferior - II, III, aVF; lateral - I, aVL, V5-V6; anterior - V3-V4; septal - V1-V2
Is urgent action needed for this ECG?Yes - there are pathological findings; Pathological findings: Previous anterior (V3-V4) myocardial infarction; Previous lateral (V5, V6, I, aVL) myocardial infarction; T-wave inversion (anterior - V3-V4); T-wave inversion (lateral - I, aVL, V5-V6)Yes - there are pathological findings; Pathological findings: Previous anterior (V3-V4) myocardial infarction; T-wave inversion (lateral - I, aVL, V5-V6)
Output JSON ONLY with keys: RHYTHM, CONDUCTION, CHAMBER_ENLARGEMENT, INFARCT_ISCHEMIA, PERICARDITIS, heart_rate_bpm, ecg_classification. Values must be lists of present findings (omit missing categories).{"RHYTHM":["Bradycardia","Sinusal","Regular","Premature ventricular complex"],"CONDUCTION":["Left anterior fascicular block","1st degree AV block"],"CHAMBER_ENLARGEMENT":["Left ventricular hypertrophy"],"INFARCT_ISCHEMIA":["Q wave_septal- V1-V2","Q wave_anterior_V3-V4","ST depression_lateral_I_avL_V5-V6"],"heart_rate_bpm":56,"ecg_classification":"pathological"}{"RHYTHM":["Bradycardia","Sinusal","Regular"],"CONDUCTION":["Left anterior fascicular block","1st degree AV block"],"CHAMBER_ENLARGEMENT":["Left ventricular hypertrophy"],"INFARCT_ISCHEMIA":["Q wave_septal- V1-V2","ST depression_lateral_I_avL_V5-V6"],"heart_rate_bpm":57,"ecg_classification":"pathological"}
Is there atrial enlargement?Yes - Left atrial enlargementNo - no atrial enlargement

Ces exemples sont illustratifs et ne constituent pas un échantillon de performance. Ils montrent que DeepECG-Tok peut reproduire des interprétations complexes comportant plusieurs anomalies et des sorties JSON contraintes, tout en commettant aussi des erreurs cliniquement significatives qui nécessitent une supervision experte.

Validation externe dans quatre cohortes

DeepECG-Tok a été évalué sans nouvel entraînement dans quatre cohortes externes indépendantes regroupant 20 755 ECG de 16 767 patients. Ces cohortes ont permis d’évaluer l’interprétation conventionnelle et les critères cliniques associés dans différents établissements, populations et systèmes d’acquisition.

Le transfert diagnostique est demeuré solide, avec des AUROC macro-moyennées du tokenizeur gelé de 0,88 (IC à 95 % : 0,87–0,91) dans CLSA et de 0,90 (IC à 95 % : 0,89–0,91) dans Harvard-Emory. Pour la fraction d’éjection ventriculaire gauche (FEVG), le modèle a permis à la fois une détection par seuil et une estimation continue. Toutes les valeurs ci-dessous sont accompagnées de leur intervalle de confiance à 95 % :

CohorteAUROC pour FEVG ≤ 40 %AUROC pour FEVG < 50 %EAM de la FEVGr de PearsonCCI
Institut de cardiologie de Montréal0,80 (0,77–0,82)0,77 (0,75–0,79)8,41 points de pourcentage (8,11–8,73)0,56 (0,52–0,59)0,68 (0,64–0,71)
MIMIC-LVEF0,76 (0,75–0,78)0,73 (0,72–0,74)10,21 points de pourcentage (9,98–10,44)0,46 (0,43–0,48)0,60 (0,58–0,63)
EchoNext0,74 (0,72–0,75)0,71 (0,69–0,73)10,22 points de pourcentage (9,97–10,47)0,41 (0,38–0,44)0,51 (0,47–0,54)

Les estimations continues de la FEVG étaient les plus précises dans la cohorte interne et sont demeurées informatives dans les deux ensembles de données externes. L’EAM plus élevée ainsi que la diminution de la corrélation et de l’accord montrent toutefois un écart mesurable de généralisation. La prédiction des cardiopathies structurelles s’est également transférée de l’Institut de cardiologie de Montréal à EchoNext avec des scores d’évaluation comparables.

Au-delà de la FEVG : risque de FA, occlusion coronarienne et cardiopathie structurelle

Les capacités de DeepECG-Tok dépassent largement l’évaluation de la fonction ventriculaire. À partir de la même représentation ECG et sans tête de prédiction propre à chaque tâche, le modèle a évalué le risque futur de fibrillation auriculaire, la présence d’une cardiopathie structurelle, l’occlusion coronarienne aiguë et l’artère coronaire responsable probable.

Critère cliniqueRésultat de l’évaluationInterprétation clinique
Fibrillation auriculaire incidente à cinq ansAUROC 0,61 (IC à 95 % : 0,59–0,63) ; score du LLM juge 0,63 (IC à 95 % : 0,62–0,65)Prédiction de la FA future chez des patients initialement en rythme sinusal. L’évaluation de l’ICM comprenait 1 160 événements parmi 3 121 ECG étiquetés.
Cardiopathie structurelleScore du LLM juge de 0,67 (IC à 95 % : 0,65–0,69) à l’ICM et de 0,68 (IC à 95 % : 0,67–0,70) dans EchoNextLa performance s’est transférée à EchoNext sans dégradation significative de la réponse générée.
Occlusion coronarienne aiguëAUROC 0,85 (IC à 95 % : 0,82–0,88) ; sensibilité 0,63 (IC à 95 % : 0,58–0,68) ; spécificité 0,93 (IC à 95 % : 0,91–0,95)Détection d’occlusions coronariennes aiguës liées à l’angiographie dans la cohorte de l’ICM : 225 des 357 cas positifs et 615 des 664 cas négatifs ont été correctement reconnus.
Artère coronaire responsableScore du LLM juge 0,58 (IC à 95 % : 0,55–0,61)Réponse à des questions de localisation de l’artère probablement responsable à partir de l’ECG initial.

Ces critères couvrent des horizons cliniques très différents : triage immédiat d’une occlusion coronarienne aiguë, détection d’une cardiopathie structurelle existante et prédiction à plus long terme d’une fibrillation auriculaire incidente. Le risque de FA, l’occlusion coronarienne aiguë et la localisation de l’artère responsable ont été développés et évalués à partir de données liées de l’ICM ; une validation prospective multicentrique demeure donc nécessaire.

Dans l’ensemble de l’évaluation guidée par instructions, le score composite fondé sur l’ontologie était de 0,71 en interne (IC à 95 % : 0,68–0,73), de 0,53 dans CLSA (IC à 95 % : 0,53–0,54) et de 0,50 dans Harvard-Emory (IC à 95 % : 0,49–0,50). Les questions portant sur des critères cliniques se sont transférées plus régulièrement que la génération ouverte ou strictement structurée de comptes rendus, ce qui souligne à la fois la capacité de généralisation du modèle et l’effet persistant des différences institutionnelles de rédaction.

Validation externe et généralisation de DeepECG-Tok entre cohortes
Figure 2. Validation externe et généralisation de DeepECG-Tok entre cohortes.

Un cadre d’évaluation réutilisable pour les modèles ECG-langage

Les comptes rendus ECG en texte libre ne peuvent pas être évalués de manière fiable par le seul chevauchement des mots. Des formulations cliniquement équivalentes, par exemple « fibrillation auriculaire avec réponse ventriculaire rapide » et « FA avec RVR », peuvent obtenir de faibles scores BLEU, ROUGE ou METEOR alors qu’elles expriment le même diagnostic. L’étude introduit donc un cadre LLM-as-a-judge librement accessible, fondé sur une ontologie et conçu comme standard d’évaluation réutilisable pour les modèles ECG-langage.

Le cadre dirige chaque réponse du modèle vers l’une de deux voies complémentaires :

  1. Évaluation déterministe des sorties structurées : les champs JSON, les étiquettes binaires et les mesures numériques sont comparés champ par champ. Les tolérances cliniques comprennent une fréquence cardiaque à 5 battements par minute près, des intervalles PR et QT à 20 millisecondes près et une FEVG à 5 points de pourcentage près.
  2. Évaluation sémantique des comptes rendus en texte libre : un LLM déterministe utilisé à température zéro compare le compte rendu généré à l’interprétation de référence. Il s’appuie sur une ontologie ECG comprenant 847 correspondances de termes validées dans 12 catégories diagnostiques afin de résoudre les synonymes et les concepts apparentés.

Pour chaque réponse, le juge répartit le contenu clinique en anomalies reconnues, omises ou hallucinées. Le score correspond au nombre d’anomalies reconnues divisé par le nombre total d’anomalies reconnues, omises et hallucinées, puis est agrégé dans 19 catégories d’évaluation. Il est ainsi sensible aux omissions comme aux ajouts non étayés, tout en évitant les fausses pénalités produites par la comparaison littérale des mots.

Deux cardiologues certifiés ont réévalué indépendamment un échantillon aléatoire de 500 paires question-réponse au moyen de la même grille, anomalie par anomalie. L’accord pondéré global entre le cadre automatisé et les cardiologues a atteint un kappa de Cohen de 0,81 (IC à 95 % : 0,78–0,85), ce qui appuie son utilisation pour une évaluation à grande échelle. Le cadre est disponible à github.com/HeartWise-AI/ECG_LLM_Judge. La publication prévue sur PhysioNet fournira 25 000 ECG avec des images standardisées, les signaux bruts et des paires question-réponse validées cliniquement pour permettre une évaluation reproductible.

Comme l’évaluateur est indépendant de l’architecture de DeepECG-Tok, d’autres équipes peuvent le réutiliser pour comparer des modèles ECG-langage, tester de nouvelles stratégies de requête et mesurer la généralisation entre établissements à partir de critères cliniquement pertinents plutôt que de la seule similarité lexicale.

Comptes rendus évalués par des cardiologues

Une étude de lecteurs distincte et en aveugle a comparé les comptes rendus de DeepECG-Tok aux comptes rendus cliniques de référence. Lors de l’évaluation d’un seul compte rendu, celui du modèle a été jugé meilleur dans 32 % des comparaisons (IC à 95 % : 26–38 %), équivalent dans 35 % (IC à 95 % : 29–42 %) et inférieur dans 33 % (IC à 95 % : 27–39 %). Lors du choix forcé, les lecteurs ont préféré le modèle dans 31 % des cas (IC à 95 % : 26–36 %), jugé les comptes rendus équivalents dans 42 % (IC à 95 % : 36–48 %) et préféré la référence dans 28 % (IC à 95 % : 23–33 %). Parmi les cas départagés, le modèle a été préféré dans 53 % des cas (IC à 95 % : 45–60 %), sans différence significative entre le modèle et les comptes rendus de référence.

Comptes rendus représentatifs de DeepECG-Tok et évaluations des cardiologues
Figure 3. Comptes rendus représentatifs du modèle et de référence avec évaluations en aveugle des cardiologues.

Vers une intelligence ECG généraliste

DeepECG-Tok montre qu’un vocabulaire discret de l’ECG peut servir à bien plus que la classification. Une représentation partagée peut relier les signaux cardiaques à l’interprétation en langage naturel, au raisonnement structuré et à la prédiction de critères cliniques, constituant ainsi une base pour des systèmes ECG que les cliniciens peuvent interroger directement.

L’étude demeure rétrospective. Une validation prospective multicentrique est nécessaire avant tout déploiement clinique, en particulier pour les critères dérivés de la cohorte de l’Institut de cardiologie de Montréal. Le modèle doit aussi disposer en amont d’un contrôle de qualité du signal et d’un mécanisme calibré d’abstention : lorsqu’un ECG est absent ou corrompu, une requête structurée peut tout de même produire une réponse plausible, mais non étayée. Ces mesures de protection représentent des étapes importantes vers une utilisation clinique sécuritaire.

Ressources d’évaluation ouvertes

L’ensemble anonymisé d’ECG utilisé pour l’analyse LLM-as-a-judge devrait être publié sur PhysioNet après la publication évaluée par les pairs, sous réserve de l’accréditation et de la signature d’une entente d’utilisation des données.

Ce travail a été financé par le Fonds de recherche du Québec (subvention FRQ 5232) et par des bourses de carrière des FRQS.