Une nouvelle revue systématique révèle que seulement 5 % des évaluations des soins de santé pour les grands modèles de langage utilisent des données réelles sur les patients, avec des lacunes significatives dans l'évaluation des biais, de l'équité et d'un large éventail de tâches, soulignant la nécessité de méthodes d'évaluation plus complètes.
Étude: Test et évaluation des applications de soins de santé des grands modèles de langage. Crédit d’image : GARÇON ANTHONY/Shutterstock.com
Dans une étude récente publiée dans JAMAdes chercheurs des États-Unis ont mené une revue systématique pour évaluer divers aspects des grands modèles linguistiques (LLM) existants utilisés pour les applications de soins de santé, tels que les tâches de soins de santé et les types de données évaluées, afin d'identifier les domaines les plus utiles des soins de santé pour le application des LLM.
Sommaire
Arrière-plan
L’utilisation de l’intelligence artificielle (IA) dans les soins de santé a progressé rapidement, notamment avec le développement des LLM. Contrairement à l’IA prédictive, utilisée pour prévoir les résultats des processus, l’IA générative utilisant les LLM peut créer un large éventail de nouveaux contenus, tels que des images, des sons et du texte.
Sur la base des entrées des utilisateurs, les LLM peuvent générer des réponses textuelles structurées et largement cohérentes, ce qui les rend utiles dans le domaine de la santé. Dans certains systèmes de santé aux États-Unis, les LLM sont déjà utilisés pour la prise de notes et sont explorés dans le domaine médical pour améliorer l'efficacité et les soins aux patients.
Cependant, l'intérêt soudain pour les LLM a également entraîné des tests non structurés des LLM dans divers domaines, et les performances des LLM en milieu clinique ont été mitigées. Alors que certaines études ont montré que les réponses des LLM étaient largement superficielles et souvent inexactes, d'autres ont trouvé des taux d'exactitude comparables à ceux des cliniciens humains.
Cette incohérence met en évidence la nécessité d’une évaluation systématique de la performance des LLM dans le milieu des soins de santé.
À propos de l'étude
Pour cette revue systématique complète, les chercheurs ont recherché des prépublications et des études évaluées par des pairs sur les évaluations LLM dans le domaine des soins de santé publiées entre janvier 2022 et février 2024. Cette fenêtre de deux ans a été sélectionnée pour inclure les articles publiés après le lancement du chatbot IA ChatGPT en novembre. 2022.
Trois évaluateurs indépendants ont examiné les études, qui ont été incluses dans la revue si elles se concentraient sur les évaluations LLM dans le domaine des soins de santé. Les études sur la recherche biologique fondamentale ou les tâches multimodales ont été exclues.
Les études ont ensuite été classées en fonction du type de données évalué, des tâches de soins de santé, des tâches de traitement du langage naturel (PNL) et de compréhension du langage naturel, des spécialités médicales et des dimensions d'évaluation. Le cadre de catégorisation a été développé à partir d'une liste existante de tâches de soins de santé, de modèles d'évaluation établis et des contributions des professionnels de la santé.
Le cadre de catégorisation a examiné si les données réelles des patients avaient été évaluées et a examiné 19 tâches de soins de santé, y compris les fonctions de soins et administratives. De plus, six tâches de PNL, dont le résumé et la réponse aux questions, ont été incluses dans la catégorisation.
En outre, sept dimensions de l'évaluation ont été identifiées, notamment des aspects tels que la factualité, l'exactitude et la toxicité. Les études ont également été regroupées par spécialité médicale en 22 catégories. Les chercheurs ont ensuite utilisé des statistiques descriptives pour résumer les résultats et calculer les pourcentages et les fréquences pour chaque catégorie.
Résultats
L'analyse a révélé que l'évaluation des LLM dans le domaine des soins de santé est hétérogène et qu'il existe des lacunes significatives dans la couverture des tâches et l'utilisation des données. Parmi les 519 études incluses dans la revue, seulement 5 % utilisaient des données réelles sur des patients, et la plupart des études s'appuyaient sur des extraits de données générés par des experts ou sur des questions d'examen médical.
La plupart des études se sont concentrées sur les LLM pour les tâches de connaissances médicales, notamment par le biais d'évaluations telles que l'examen de licence médicale des États-Unis.
Les tâches de soins aux patients, telles que diagnostiquer les patients et formuler des recommandations de traitement, étaient également relativement courantes parmi les tâches LLM. Cependant, les tâches administratives, y compris la prise de notes cliniques et l'attribution de codes de facturation, ont rarement été explorées parmi les tâches du LLM.
Parmi les tâches de la PNL, la plupart des études se sont concentrées sur la réponse aux questions, qui comprenait des enquêtes génériques. Environ 25 % des fonctions utilisaient des LLM pour la classification de textes et l'extraction d'informations, mais des tâches telles que le dialogue conversationnel et la synthèse n'étaient pas bien explorées dans le cadre des évaluations LLM.
La dimension d'évaluation la plus fréquemment examinée dans le cadre des LLM était l'exactitude (95,4 %), suivie de l'exhaustivité (47 %). Très peu d'études ont utilisé les LLM pour des considérations éthiques liées aux biais, à la toxicité et à l'équité.
Alors que plus de 20 % des études n’étaient spécifiques à aucune spécialité médicale, la médecine interne, l’ophtalmologie et la chirurgie étaient les plus représentées dans les études d’évaluation LLM. Les études de génétique médicale et de médecine nucléaire étaient les moins explorées dans les évaluations LLM.
Conclusions
Dans l’ensemble, l’examen a souligné la nécessité de méthodes d’évaluation standardisées et d’un cadre consensuel pour évaluer les applications LLM dans le domaine des soins de santé.
Les chercheurs ont déclaré que l'utilisation de données réelles sur les patients dans les évaluations LLM devrait être encouragée, et que l'utilisation des LLM pour les tâches administratives et l'extension de l'application des LLM à d'autres domaines de spécialités médicales seraient très bénéfiques.
