Aller au contenu
Actualités médicales

ChatGPT-4 surpasse GPT-3.5 et Google Bard lors de l’examen oral de neurochirurgie

Study: Performance of ChatGPT, GPT-4, and Google Bard on a Neurosurgery Oral Boards Preparation Question Bank. Image Credit: Login / Shutterstock

Dans une récente étude publiée sur medRxiv* serveur de prépublication, des chercheurs aux États-Unis ont évalué les performances de trois grands modèles de langage (LLM), ChatGPT (ou GPT-3.5), GPT-4 et Google Bard, sur des questions d’ordre supérieur, représentant spécifiquement l’American Board of Examen oral du comité de chirurgie neurologique (ABNS). De plus, ils ont interprété les différences de performance et de précision après avoir fait varier les caractéristiques des questions.

Étude : Performances de ChatGPT, GPT-4 et Google Bard sur une banque de questions de préparation des conseils oraux de neurochirurgie. Crédit d’image : connexion/Shutterstock

*Avis important: medRxiv publie des rapports scientifiques préliminaires qui ne sont pas évalués par des pairs et, par conséquent, ne doivent pas être considérés comme concluants, guider la pratique clinique/les comportements liés à la santé, ou traités comme des informations établies.

Arrière-plan

Les trois LLM évalués dans cette étude ont montré leur capacité à réussir les examens du conseil médical avec des questions à choix multiples. Cependant, aucune étude antérieure n’a testé ou comparé les performances de plusieurs LLM sur des questions principalement d’ordre supérieur d’un domaine de sous-spécialité médicale à enjeu élevé, par exemple la neurochirurgie.

Une étude antérieure a montré que ChatGPT avait réussi un module de 500 questions imitant les examens écrits du jury de neurochirurgie avec un score de 73,4 %. Son modèle mis à jour, GPT-4, est devenu disponible pour un usage public le 14 mars 2023 et a également obtenu des notes de passage dans plus de 25 examens standardisés. Des études ont montré que GPT-4 a montré des améliorations de performances > 20 % lors de l’examen de licence médicale aux États-Unis (USMLE).

Un autre chatbot basé sur l’intelligence artificielle (IA), Google Bard, disposait de capacités d’exploration Web en temps réel et pouvait donc offrir des informations plus pertinentes sur le plan contextuel tout en générant des réponses pour des examens standardisés dans les domaines de la médecine, des affaires et du droit. L’examen oral du comité de neurochirurgie de l’ABNS, considéré comme une évaluation plus rigoureuse que son homologue écrit, est passé par les médecins deux à trois ans après l’obtention du diplôme de résidence. Il comporte trois sessions de 45 minutes chacune, et son taux de réussite n’a pas dépassé les 90 % depuis 2018.

À propos de l’étude

Dans la présente étude, les chercheurs ont évalué les performances de GPT-3.5, GPT-4 et Google Bard sur un module de 149 questions imitant l’examen oral de neurochirurgie.

L’examen des indications de l’examen d’auto-évaluation en neurochirurgie (SANS) a couvert des questions intrigantes sur des sujets relativement difficiles, tels que les indications neurochirurgicales et la prise de décision interventionnelle. L’équipe a évalué les questions dans un format de question à choix multiples avec la meilleure réponse. Étant donné que les trois LLM n’ont actuellement pas d’entrée multimodale, ils ont suivi les réponses avec des «hallucinations» pour les questions avec des données d’imagerie médicale, des scénarios où un LLM affirme des faits inexacts qu’il croit à tort corrects. Au total, 51 questions intégraient l’imagerie dans la tige de la question.

De plus, l’équipe a utilisé la régression linéaire pour interroger les corrélations entre les performances sur différentes catégories de questions. Ils ont évalué les variations de performance à l’aide du chi carré, Exact de Fisheret des tests de régression logistique avec une seule variable, où p<0,05 était considéré comme statistiquement significatif.

Résultats de l’étude

Sur une banque de 149 questions composées principalement de questions à choix multiples de diagnostic et de gestion d’ordre supérieur conçues pour les examens oraux de neurochirurgie, GPT-4 a obtenu un score de 82,6 % et a surpassé le score de ChatGPT de 62,4 %. De plus, GPT-4 a démontré une performance nettement meilleure que ChatGPT dans la sous-spécialité Spine (90,5 % contre 64,3 %).

Google Bard a généré des réponses correctes pour 44,2 % (66/149) des questions. Alors qu’il a généré des réponses incorrectes à 45 % (67/149) des questions, il a refusé de répondre à 10,7 % (16/149) des questions. GPT-3.5 et GPT-4 n’ont jamais refusé de répondre à une question textuelle, tandis que Bard a même refusé de répondre à 14 questions basées sur des tests. En fait, GPT-4 a surpassé Google Bard dans toutes les catégories et a démontré des performances améliorées dans les catégories de questions pour lesquelles ChatGPT a montré une précision moindre. Fait intéressant, alors que GPT-4 a obtenu de meilleurs résultats sur les questions liées à l’imagerie que ChatGPT (68,6 % contre 47,1 %), ses performances étaient comparables à Google Bard (68,6 % contre 66,7 %).

Cependant, notamment, GPT-4 a montré des taux réduits d’hallucinations et la capacité de naviguer dans des concepts difficiles comme déclarer la futilité médicale. Cependant, il a rencontré des difficultés dans d’autres scénarios, tels que la prise en compte des caractéristiques au niveau du patient, par exemple la fragilité.

conclusion

Il est urgent de développer une plus grande confiance dans les systèmes LLM, par conséquent, une validation rigoureuse de leurs performances sur des scénarios de plus en plus élevés et ouverts devrait se poursuivre. Cela garantirait l’intégration sûre et efficace de ces LLM dans les processus décisionnels cliniques.

Les méthodes pour quantifier et comprendre les hallucinations restent vitales, et finalement, seuls ces LLM seraient incorporés dans la pratique clinique qui minimiseraient et reconnaîtraient les hallucinations. En outre, les résultats de l’étude soulignent le besoin urgent pour les neurochirurgiens de rester informés sur les LLM émergents et leurs niveaux de performance variables pour des applications cliniques potentielles.

Les modèles d’examens à choix multiples pourraient devenir obsolètes dans l’enseignement médical, tandis que les évaluations verbales gagneront en importance. Avec les progrès dans le domaine de l’IA, les stagiaires en neurochirurgie pourraient utiliser et dépendre des LLM pour la préparation du conseil. Par exemple, les réponses générées par les LLM pourraient fournir de nouvelles informations cliniques. Ils pourraient également servir d’aide à la conversation pour répéter divers scénarios cliniques sur des sujets difficiles pour les conseils.

*Avis important: medRxiv publie des rapports scientifiques préliminaires qui ne sont pas évalués par des pairs et, par conséquent, ne doivent pas être considérés comme concluants, guider la pratique clinique/les comportements liés à la santé, ou traités comme des informations établies.

Ma Clinique

Ma Clinique

L'équipe Ma Clinique : professionnels de la santé et spécialistes en médecine générale. Notre objectif est de vous fournir les informations dont vous avez besoin pour prendre des décisions éclairées sur vos soins de santé.