Dans une étude récente publiée dans la revue PLOS Santé numériqueles chercheurs ont évalué et comparé les connaissances cliniques et les capacités de raisonnement diagnostique des grands modèles de langage (LLM) avec celles d'experts humains dans le domaine de l'ophtalmologie.
Étude : Les grands modèles de langage approchent les connaissances cliniques et le raisonnement de niveau expert en ophtalmologie : une étude transversale face-à-face. Crédit d'image : ozrimoz/Shutterstock
Arrière-plan
Les transformateurs génératifs pré-entraînés (GPT), GPT-3.5 et GPT-4, sont des modèles de langage avancés formés sur de vastes ensembles de données basés sur Internet. Ils alimentent ChatGPT, une intelligence artificielle (IA) conversationnelle remarquable pour le succès de ses applications médicales. Malgré les difficultés des modèles précédents lors des tests médicaux spécialisés, le GPT-4 présente des progrès significatifs. Des inquiétudes persistent concernant la « contamination » des données et la pertinence clinique des résultats des tests. Des recherches supplémentaires sont nécessaires pour valider l'applicabilité clinique et la sécurité des modèles linguistiques dans des contextes médicaux réels et pour remédier aux limites existantes de leurs connaissances spécialisées et de leurs capacités de raisonnement.
À propos de l'étude
Les questions de l'examen de la partie 2 du Fellowship of the Royal College of Ophthalmologists (FRCOphth) ont été extraites d'un manuel spécialisé qui n'est pas largement disponible en ligne, minimisant ainsi la probabilité que ces questions apparaissent dans les données de formation des LLM. Au total, 360 questions à choix multiples réparties sur six chapitres ont été extraites, et un ensemble de 90 questions a été isolé pour un examen blanc utilisé pour comparer les performances des LLM et des médecins. Deux chercheurs ont aligné ces questions sur les catégories spécifiées par le Royal College of Ophthalmologists et ont classé chaque question selon les niveaux de taxonomie des processus cognitifs de Bloom. Les questions comportant des éléments non textuels qui ne convenaient pas à la saisie LLM ont été exclues.
Les questions d'examen ont été saisies dans les versions de ChatGPT (GPT-3.5 et GPT-4) pour recueillir les réponses, en répétant le processus jusqu'à trois fois par question si nécessaire. Une fois que d’autres modèles comme Bard et HuggingChat sont devenus disponibles, des tests similaires ont été menés. Les réponses correctes, telles que définies dans le manuel, ont été notées à des fins de comparaison.
Cinq ophtalmologistes experts, trois stagiaires en ophtalmologie et deux jeunes médecins généralistes ont réalisé indépendamment l'examen blanc pour évaluer l'applicabilité pratique des modèles. Leurs réponses ont ensuite été comparées aux réponses des LLM. Après l'examen, ces ophtalmologistes ont évalué les réponses des LLM à l'aide d'une échelle de Likert pour évaluer l'exactitude et la pertinence, sans savoir quel modèle fournissait quelle réponse.
La conception statistique de cette étude était suffisamment robuste pour détecter des différences de performances significatives entre les LLM et les médecins humains, dans le but de tester l'hypothèse nulle selon laquelle les deux fonctionneraient de manière similaire. Divers tests statistiques, notamment des tests du Chi carré et des tests T appariés, ont été appliqués pour comparer les performances et évaluer la cohérence et la fiabilité des réponses LLM par rapport aux réponses humaines.
Résultats de l'étude
Sur 360 questions contenues dans le manuel de l'examen FRCOphth Part 2, 347 ont été sélectionnées pour être utilisées, dont 87 du chapitre sur l'examen blanc. Les exclusions concernaient principalement des questions comportant des images ou des tableaux, qui ne convenaient pas à la saisie dans les interfaces LLM.
Les comparaisons de performances ont révélé que GPT-4 a largement surpassé GPT-3.5, avec un taux de réponses correctes de 61,7 % contre 48,41 %. Cette avancée dans les capacités de GPT-4 était cohérente dans différents types de questions et de sujets, comme l'a souligné le Royal College of Ophthalmologists. Des résultats détaillés et des analyses statistiques ont en outre confirmé les performances robustes de GPT-4, ce qui en fait un outil compétitif même parmi les autres LLM et les médecins humains, en particulier les jeunes médecins et les stagiaires.
Caractéristiques des examens et données granulaires sur les performances. La répartition des sujets et des types de questions est présentée aux côtés des scores obtenus par les LLM (GPT-3.5, GPT-4, LLaMA et PaLM 2), les ophtalmologistes experts (E1-E5), les stagiaires en ophtalmologie (T1-T3) et les jeunes médecins non spécialisés (J1- J2). Les scores médians ne totalisent pas nécessairement le score médian global, car les scores fractionnaires sont impossibles.
Dans l'examen simulé de 87 questions spécifiquement adapté, GPT-4 a non seulement été en tête parmi les LLM, mais a également obtenu des résultats comparables à ceux des ophtalmologistes experts et nettement meilleurs que ceux des médecins débutants et stagiaires. Les performances des différents groupes de participants ont montré que même si les ophtalmologistes experts maintenaient la plus grande précision, les stagiaires approchaient de ces niveaux, dépassant de loin les jeunes médecins non spécialisés en ophtalmologie.
Les tests statistiques ont également souligné que l'accord entre les réponses fournies par les différents LLM et les participants humains était généralement faible à modéré, indiquant une variabilité dans le raisonnement et l'application des connaissances entre les groupes. Cela était particulièrement évident lorsqu’on comparait les différences de connaissances entre les modèles et les médecins humains.
Un examen détaillé des questions simulées par rapport aux normes d'examen réelles a indiqué que la configuration simulée reflétait étroitement l'examen écrit FRCOphth, partie 2, en termes de difficulté et de structure, comme convenu par les ophtalmologistes impliqués. Cet alignement garantissait que l'évaluation des LLM et des réponses humaines était fondée sur un contexte réaliste et cliniquement pertinent.
De plus, les retours qualitatifs des ophtalmologistes ont confirmé une forte préférence pour le GPT-4 par rapport au GPT-3.5, en corrélation avec les données quantitatives de performance. Les notes plus élevées d’exactitude et de pertinence du GPT-4 ont souligné son utilité potentielle en milieu clinique, en particulier en ophtalmologie.
Enfin, une analyse des cas où tous les LLM n'ont pas réussi à fournir la bonne réponse n'a révélé aucune tendance cohérente liée à la complexité ou au sujet des questions.
