Une étude évalue un grand modèle de langage pour les notes de transfert de médecine d'urgence, constatant une utilité et une sécurité élevées comparables à celles des médecins
Étude: Développement et évaluation de notes de transfert de médecine d'urgence générées par un grand modèle de langage. Crédit d'image : Kamon_wongnon/Shutterstock.com
Dans une étude récente publiée dans Réseau JAMA ouvertles chercheurs ont développé et évalué l'exactitude, la sécurité et l'utilité des notes de transfert de médecine d'urgence (EM) générées par un grand modèle de langage (LLM) pour réduire le fardeau de la documentation médicale sans compromettre la sécurité des patients.
Sommaire
Le rôle crucial des transferts dans les soins de santé
Les transferts sont des points de communication critiques dans le domaine des soins de santé et une source connue d’erreurs médicales. En conséquence, de nombreuses organisations, telles que la Commission mixte et le Conseil d'accréditation pour l'enseignement médical supérieur (ACGME), ont plaidé en faveur de processus standardisés pour améliorer la sécurité.
Les transferts entre l'EM et le patient hospitalisé (IP) sont associés à des défis uniques, notamment la complexité médicale, les contraintes de temps et l'incertitude diagnostique ; cependant, ils restent mal standardisés et mis en œuvre de manière incohérente. Les outils basés sur les dossiers de santé électroniques (DSE) ont tenté de surmonter ces limitations ; cependant, ils restent sous-explorés dans les situations d’urgence.
Les LLM sont apparus comme des solutions potentielles pour rationaliser la documentation clinique. Néanmoins, les préoccupations concernant les incohérences factuelles nécessitent des recherches plus approfondies pour garantir la sécurité et la fiabilité des flux de travail critiques.
À propos de l'étude
La présente étude a été menée dans un hôpital universitaire urbain de soins quaternaires de 840 lits à New York. Les données DSE de 1 600 rencontres de patients EM ayant conduit à des hospitalisations aiguës entre avril et septembre 2023 ont été analysées. Seules les rencontres après avril 2023 ont été incluses en raison de la mise en œuvre d’un système de transfert EM vers IP mis à jour.
Les données rétrospectives ont été utilisées sous réserve de consentement éclairé afin de garantir un risque minimal pour les patients. Les notes de transfert ont été générées à l'aide d'une combinaison d'un LLM affiné et d'heuristiques basées sur des règles, tout en respectant les directives de reporting standardisées.
Le modèle de note de transfert ressemblait beaucoup à la structure manuelle actuelle en intégrant des éléments basés sur des règles tels que les tests de laboratoire et les signes vitaux et des composants générés par LLM tels que l'historique de la maladie actuelle et les diagnostics différentiels. Les experts en informatique et les médecins EM ont conservé les données pour affiner le LLM afin d'améliorer leur qualité tout en excluant les attributs basés sur la race pour éviter les biais.
Deux LLM, Représentations d'encodeurs bidirectionnels robustement optimisées à partir de l'approche Transformers (RoBERTa) et Large Language Model Meta AI (Llama-2), ont été utilisés respectivement pour la sélection de contenu saillant et le résumé abstrait. Le traitement des données impliquait une hiérarchisation heuristique et une modélisation de la saillance pour répondre aux limites potentielles des modèles.
Les chercheurs ont évalué des mesures automatisées telles que l'étude orientée rappel pour l'évaluation de Gisting (ROUGE) et les représentations d'encodeurs bidirectionnels à partir du score Transformers (BERTScore), ainsi qu'un nouveau cadre axé sur la sécurité des patients. Un examen clinique de 50 notes de transfert a évalué leur exhaustivité, leur lisibilité et leur sécurité afin de garantir leur validation rigoureuse.
Résultats de l'étude
Parmi les 1 600 cas de patients inclus dans l’analyse, l’âge moyen était de 59,8 ans avec un écart type de 18,9 ans, et 52 % des patients étaient des femmes. Les mesures d'évaluation automatisées ont révélé que les résumés générés par le LLM surpassaient ceux rédigés par les médecins à plusieurs égards.
Les scores ROUGE-2 étaient significativement plus élevés pour les résumés générés par LLM que pour les résumés des médecins, soit 0,322 et 0,088, respectivement. De même, les scores de précision du BERT étaient plus élevés, à 0,859, contre 0,796 pour les résumés des médecins. En revanche, l’approche de segmentation des sources pour l’évaluation des incohérences à grande échelle (SCALE) a généré un score de 0,691 contre 0,456. Ces résultats indiquent que les résumés générés par LLM démontraient de plus grandes similitudes lexicales, une plus grande fidélité aux notes sources et fournissaient un contenu plus détaillé que leurs homologues rédigés par des humains.
Dans les évaluations cliniques, la qualité des résumés générés par LLM était comparable à celle des résumés rédigés par des médecins, mais légèrement inférieure dans plusieurs dimensions. Sur une échelle de Likert allant de un à cinq, les résumés générés par LLM ont obtenu des résultats inférieurs en termes d'utilité, d'exhaustivité, de conservation, de lisibilité, d'exactitude et de sécurité des patients. Malgré ces différences, les résumés automatisés étaient généralement considérés comme acceptables pour une utilisation clinique, aucun des problèmes identifiés n’étant jugé comme mettant la vie en danger pour la sécurité des patients.
En évaluant les pires scénarios, les cliniciens ont identifié des risques potentiels de sécurité de niveau deux, qui comprenaient un caractère incomplet et une logique défectueuse à 8,7 % et 7,3 %, respectivement, pour les résumés générés par LLM par rapport aux résumés rédigés par des médecins, qui n'étaient pas associés à ces risques. Les hallucinations étaient rares dans les résumés générés par LLM, avec cinq cas identifiés recevant tous des scores de sécurité compris entre quatre et cinq, suggérant ainsi des risques de sécurité légers à négligeables. Dans l'ensemble, les notes générées par LLM présentaient un taux d'inexactitude plus élevé (9,6 %) que les notes écrites par les médecins (2 %), bien que ces inexactitudes impliquaient rarement des implications significatives en matière de sécurité.
La fiabilité inter-évaluateurs a été calculée à l'aide de coefficients de corrélation intraclasse (ICC). Les ICC ont montré un bon accord entre les trois évaluateurs experts pour l'exhaustivité, la conservation, l'exactitude et l'utilité à 0,79, 0,70, 0,76 et 0,74, respectivement. La lisibilité a atteint une fiabilité passable avec un ICC de 0,59.
Conclusions
L'étude actuelle a généré avec succès des notes de transfert EM vers IP en utilisant une approche LLM raffinée et basée sur des règles au sein d'un modèle développé par l'utilisateur.
Les évaluations automatisées traditionnelles étaient associées à des performances LLM supérieures. Cependant, des évaluations cliniques manuelles ont révélé que, même si la plupart des notes générées par le LLM atteignaient des scores de qualité prometteurs compris entre quatre et cinq, elles étaient généralement inférieures aux notes écrites par les médecins. Les erreurs identifiées, notamment les erreurs incomplètes et logiques, posaient parfois des risques modérés pour la sécurité, avec moins de 10 % pouvant causer des problèmes importants par rapport aux notes du médecin.

















