Une comparaison directe de cinq principaux LLM a testé ce qui se passe lorsque les questions sur le cancer du sein passent des connaissances théoriques aux cas cliniques et aux préoccupations quotidiennes que les patientes apportent à leurs équipes de soins.
Une étude comparative de grands modèles de langage pour répondre aux questions liées au cancer du sein. Crédit d’image : Lightspring/Shutterstock
Dans une étude récente publiée sous forme d’« article dans la presse » dans la revue Rapports scientifiquesles chercheurs ont mené une comparaison transversale pour évaluer les performances des grands modèles de langage modernes (LLM) en fournissant un soutien aux informations sur la santé concernant le cancer du sein.
L’étude a testé ChatGPT-5.2, ChatGPT-4o, Gemini 3.0, DeepSeek et ERNIE Bot à l’aide de 90 questions à choix multiples, 10 cas cliniques anonymisés et des réponses à 20 préoccupations courantes des patients.
Les investigations de l’étude ont révélé que même si les cinq modèles présentaient une grande précision sur les questions standardisées de connaissances sur le cancer du sein, allant de 82,22 % à 94,44 %, ils différaient par la complexité linguistique et les mesures de qualité évaluées par des experts.
Les experts humains ont attribué à ChatGPT-5.2 et DeepSeek les scores d’exhaustivité les plus élevés, tandis que Gemini 3.0 a reçu le score de lisibilité le plus élevé évalué par les experts. DeepSeek a également produit le score de difficulté en lecture le plus bas lors de l’évaluation automatisée de la langue chinoise.
L’étude a conclu qu’aucun modèle unique ne pouvait être considéré comme le « meilleur » pour répondre aux questions sur le cancer du sein et a recommandé d’évaluer les LLM sur plusieurs mesures, les études futures intégrant des évaluations basées sur les patients et des paramètres cliniques réels.
Sommaire
Arrière-plan
Les estimations mondiales pour 2020 indiquent qu’environ 685 000 femmes sont mortes du cancer du sein, ce qui représente environ 16 % des décès par cancer chez les femmes dans le monde et met en évidence le fardeau mondial de cette maladie pour la santé publique.
Bien que les progrès dans le diagnostic et le traitement du cancer du sein aient amélioré la survie, les changements physiques postopératoires et les effets secondaires de la chimiothérapie et de la radiothérapie peuvent contribuer à la détresse psychologique, qui peut inclure la fatigue, l’anxiété et la dépression.
Les patientes atteintes d’un cancer du sein recherchent de plus en plus d’informations de santé supplémentaires sur leur état de santé, leur traitement, leur rétablissement et leurs problèmes psychologiques, des informations crédibles et compréhensibles les aidant à jouer un rôle plus actif dans les soins quotidiens et les décisions cliniques.
Bien que les grands modèles linguistiques conversationnels modernes puissent générer un contenu personnalisé sur la santé, leur exactitude, leur exhaustivité, leur utilité, leur sécurité, leur lisibilité et leur complexité linguistique restent des domaines d’étude actifs dans le contexte du support informationnel sur le cancer du sein.
À propos de l’étude
La présente étude visait à fournir une référence pour évaluer l’utilisation du LLM dans les informations sur la santé du cancer du sein en comparant systématiquement les cinq modèles sélectionnés. Ces modèles ont été évalués via leurs interfaces Web officielles en utilisant les paramètres par défaut entre le 15 décembre 2025 et le 15 janvier 2026. Toutes les invites ont été saisies en chinois simplifié.
L’étude a évalué les performances du LLM dans trois tâches principales. Premièrement, les connaissances standardisées ont été évaluées à l’aide de 90 questions à choix multiples tirées de manuels et de directives cliniques.
Ensuite, une analyse de cas clinique a été menée dans laquelle les LLM ont reçu 10 cas de patients anonymisés dans cinq domaines cliniques (diagnostic, traitement, soins postopératoires, soutien psychosocial, évaluation du pronostic et rééducation).
Enfin, l’étude a évalué les réponses du LLM aux préoccupations des patients, en évaluant 20 questions cliniques courantes répétées au cours de trois séances pour mesurer la cohérence et la stabilité des résultats. La difficulté de lecture en langue chinoise du texte généré par LLM a été quantifiée objectivement à l’aide de la plate-forme de notation de texte de l’Université de Ludong (LDU-TGP).
Trois spécialistes du cancer du sein (« experts humains ») ont évalué aveuglément et indépendamment les réponses LLM en termes d’exhaustivité, d’exactitude, de lisibilité, d’utilité et de sécurité à l’aide d’une échelle de Likert à 5 points. Les analyses statistiques ont comparé la précision du modèle et les évaluations des experts. L’accord entre les trois évaluateurs experts était globalement faible, de sorte que les notes individuelles ont été conservées séparément dans l’analyse plutôt que moyennées.
Résultats de l’étude
Les évaluations standardisées des connaissances de l’étude ont révélé que tous les modèles fonctionnaient avec un haut degré de précision médicale. DeepSeek a obtenu la précision numérique la plus élevée (94,44 % ; 85 sur 90 corrects), suivi de ChatGPT-5.2 et ERNIE Bot à 88,89 % (80 sur 90 corrects), Gemini 3.0 à 87,78 % (79 sur 90 corrects) et ChatGPT-4o à 82,22 % (74 sur 90 corrects).
Bien que les modèles diffèrent globalement en termes de performance des connaissances standardisées, les comparaisons ajustées par paires n’ont pas révélé de différence statistiquement significative entre les deux modèles. Les résultats n’ont donc pas permis d’établir que les modèles étaient équivalents.
Les évaluations LDU-TGP ont démontré que les LLM variaient considérablement en fonction de la complexité de lecture de leurs réponses. ChatGPT-5.2 s’est avéré produire la prose la plus complexe (moyenne = 21,22 ; plus élevé est pire) tandis que DeepSeek a généré le texte d’analyse de cas en chinois le moins difficile linguistiquement et le plus cohérent selon cette mesure automatisée (moyenne = 13,15).
Les scores évalués par des experts différaient selon le modèle dans les cinq dimensions : exhaustivité, exactitude, lisibilité, utilité et sécurité. Il a été constaté que ChatGPT-5.2 obtenait le score d’exhaustivité le plus élevé (moyenne = 4,350 sur 5,0), tandis que Gemini 3.0 (moyenne = 4,108) et DeepSeek (moyenne = 4,075) étaient respectivement en tête dans les dimensions de lisibilité et de sécurité.
ERNIE Bot a reçu les scores moyens estimés les plus bas pour les cinq dimensions évaluées par des experts, y compris l’exhaustivité (moyenne = 3,583 sur 5,0).
Conclusions
L’étude indique que les cinq LLM hébergés sur le Web testés ont eu des résultats similaires dans l’ensemble sur les connaissances standardisées sur le cancer du sein, mais différaient par la complexité linguistique et la qualité des réponses évaluées par des experts.
Par exemple, alors que ChatGPT-5.2 et DeepSeek ont reçu des scores d’exhaustivité plus élevés selon les experts, Gemini 3.0 a reçu le score de lisibilité le plus élevé selon les experts. L’étude n’a pas testé la compréhension des patients ni la sécurité et l’efficacité de ces modèles dans la prise de décision clinique directe entre les patients et le monde. Les 10 cas cliniques provenaient également d’un seul hôpital, ce qui peut limiter la généralisabilité des résultats. Les auteurs ont appelé à des évaluations et des tests basés sur les patients dans des contextes cliniques réels avant que les résultats ne soient appliqués à la pratique.

















