Ma Clinique
  • À la une
  • Actualités
    • Médecines douces
    • Enfants
    • Chirurgie esthétique
  • Chirurgiens esthétiquesNew
  • Contactez-nous
Pas de résultat
View All Result
Ma Clinique : L'information médicale par des professionnels de la santé
Pas de résultat
View All Result

Accueil » Actualités médicales » Un test d’IA sur le cancer du sein révèle qu’aucun chatbot n’excelle dans toutes les mesures

Un test d’IA sur le cancer du sein révèle qu’aucun chatbot n’excelle dans toutes les mesures

par Ma Clinique
11 septembre 2026
dans Actualités médicales
Temps de lecture : 4 min
A comparative study of large language models in responding to breast cancer–related questions. Image Credit: Lightspring / Shutterstock

Une comparaison directe de cinq principaux LLM a testé ce qui se passe lorsque les questions sur le cancer du sein passent des connaissances théoriques aux cas cliniques et aux préoccupations quotidiennes que les patientes apportent à leurs équipes de soins.

Une étude comparative de grands modèles de langage pour répondre aux questions liées au cancer du sein. Crédit d’image : Lightspring/Shutterstock

Dans une étude récente publiée sous forme d’« article dans la presse » dans la revue Rapports scientifiquesles chercheurs ont mené une comparaison transversale pour évaluer les performances des grands modèles de langage modernes (LLM) en fournissant un soutien aux informations sur la santé concernant le cancer du sein.

L’étude a testé ChatGPT-5.2, ChatGPT-4o, Gemini 3.0, DeepSeek et ERNIE Bot à l’aide de 90 questions à choix multiples, 10 cas cliniques anonymisés et des réponses à 20 préoccupations courantes des patients.

Les investigations de l’étude ont révélé que même si les cinq modèles présentaient une grande précision sur les questions standardisées de connaissances sur le cancer du sein, allant de 82,22 % à 94,44 %, ils différaient par la complexité linguistique et les mesures de qualité évaluées par des experts.

Les experts humains ont attribué à ChatGPT-5.2 et DeepSeek les scores d’exhaustivité les plus élevés, tandis que Gemini 3.0 a reçu le score de lisibilité le plus élevé évalué par les experts. DeepSeek a également produit le score de difficulté en lecture le plus bas lors de l’évaluation automatisée de la langue chinoise.

L’étude a conclu qu’aucun modèle unique ne pouvait être considéré comme le « meilleur » pour répondre aux questions sur le cancer du sein et a recommandé d’évaluer les LLM sur plusieurs mesures, les études futures intégrant des évaluations basées sur les patients et des paramètres cliniques réels.

Sommaire

  • Arrière-plan
  • À propos de l’étude
  • Résultats de l’étude
  • Conclusions

Arrière-plan

Les estimations mondiales pour 2020 indiquent qu’environ 685 000 femmes sont mortes du cancer du sein, ce qui représente environ 16 % des décès par cancer chez les femmes dans le monde et met en évidence le fardeau mondial de cette maladie pour la santé publique.

Bien que les progrès dans le diagnostic et le traitement du cancer du sein aient amélioré la survie, les changements physiques postopératoires et les effets secondaires de la chimiothérapie et de la radiothérapie peuvent contribuer à la détresse psychologique, qui peut inclure la fatigue, l’anxiété et la dépression.

Les patientes atteintes d’un cancer du sein recherchent de plus en plus d’informations de santé supplémentaires sur leur état de santé, leur traitement, leur rétablissement et leurs problèmes psychologiques, des informations crédibles et compréhensibles les aidant à jouer un rôle plus actif dans les soins quotidiens et les décisions cliniques.

Bien que les grands modèles linguistiques conversationnels modernes puissent générer un contenu personnalisé sur la santé, leur exactitude, leur exhaustivité, leur utilité, leur sécurité, leur lisibilité et leur complexité linguistique restent des domaines d’étude actifs dans le contexte du support informationnel sur le cancer du sein.

À propos de l’étude

La présente étude visait à fournir une référence pour évaluer l’utilisation du LLM dans les informations sur la santé du cancer du sein en comparant systématiquement les cinq modèles sélectionnés. Ces modèles ont été évalués via leurs interfaces Web officielles en utilisant les paramètres par défaut entre le 15 décembre 2025 et le 15 janvier 2026. Toutes les invites ont été saisies en chinois simplifié.

L’étude a évalué les performances du LLM dans trois tâches principales. Premièrement, les connaissances standardisées ont été évaluées à l’aide de 90 questions à choix multiples tirées de manuels et de directives cliniques.

Ensuite, une analyse de cas clinique a été menée dans laquelle les LLM ont reçu 10 cas de patients anonymisés dans cinq domaines cliniques (diagnostic, traitement, soins postopératoires, soutien psychosocial, évaluation du pronostic et rééducation).

Enfin, l’étude a évalué les réponses du LLM aux préoccupations des patients, en évaluant 20 questions cliniques courantes répétées au cours de trois séances pour mesurer la cohérence et la stabilité des résultats. La difficulté de lecture en langue chinoise du texte généré par LLM a été quantifiée objectivement à l’aide de la plate-forme de notation de texte de l’Université de Ludong (LDU-TGP).

Trois spécialistes du cancer du sein (« experts humains ») ont évalué aveuglément et indépendamment les réponses LLM en termes d’exhaustivité, d’exactitude, de lisibilité, d’utilité et de sécurité à l’aide d’une échelle de Likert à 5 points. Les analyses statistiques ont comparé la précision du modèle et les évaluations des experts. L’accord entre les trois évaluateurs experts était globalement faible, de sorte que les notes individuelles ont été conservées séparément dans l’analyse plutôt que moyennées.

Résultats de l’étude

Les évaluations standardisées des connaissances de l’étude ont révélé que tous les modèles fonctionnaient avec un haut degré de précision médicale. DeepSeek a obtenu la précision numérique la plus élevée (94,44 % ; 85 sur 90 corrects), suivi de ChatGPT-5.2 et ERNIE Bot à 88,89 % (80 sur 90 corrects), Gemini 3.0 à 87,78 % (79 sur 90 corrects) et ChatGPT-4o à 82,22 % (74 sur 90 corrects).

Bien que les modèles diffèrent globalement en termes de performance des connaissances standardisées, les comparaisons ajustées par paires n’ont pas révélé de différence statistiquement significative entre les deux modèles. Les résultats n’ont donc pas permis d’établir que les modèles étaient équivalents.

Les évaluations LDU-TGP ont démontré que les LLM variaient considérablement en fonction de la complexité de lecture de leurs réponses. ChatGPT-5.2 s’est avéré produire la prose la plus complexe (moyenne = 21,22 ; plus élevé est pire) tandis que DeepSeek a généré le texte d’analyse de cas en chinois le moins difficile linguistiquement et le plus cohérent selon cette mesure automatisée (moyenne = 13,15).

Les scores évalués par des experts différaient selon le modèle dans les cinq dimensions : exhaustivité, exactitude, lisibilité, utilité et sécurité. Il a été constaté que ChatGPT-5.2 obtenait le score d’exhaustivité le plus élevé (moyenne = 4,350 sur 5,0), tandis que Gemini 3.0 (moyenne = 4,108) et DeepSeek (moyenne = 4,075) étaient respectivement en tête dans les dimensions de lisibilité et de sécurité.

ERNIE Bot a reçu les scores moyens estimés les plus bas pour les cinq dimensions évaluées par des experts, y compris l’exhaustivité (moyenne = 3,583 sur 5,0).

Conclusions

L’étude indique que les cinq LLM hébergés sur le Web testés ont eu des résultats similaires dans l’ensemble sur les connaissances standardisées sur le cancer du sein, mais différaient par la complexité linguistique et la qualité des réponses évaluées par des experts.

Par exemple, alors que ChatGPT-5.2 et DeepSeek ont ​​reçu des scores d’exhaustivité plus élevés selon les experts, Gemini 3.0 a reçu le score de lisibilité le plus élevé selon les experts. L’étude n’a pas testé la compréhension des patients ni la sécurité et l’efficacité de ces modèles dans la prise de décision clinique directe entre les patients et le monde. Les 10 cas cliniques provenaient également d’un seul hôpital, ce qui peut limiter la généralisabilité des résultats. Les auteurs ont appelé à des évaluations et des tests basés sur les patients dans des contextes cliniques réels avant que les résultats ne soient appliqués à la pratique.

Précédent

Cinq minutes d’arôme de café étaient liées à des changements d’humeur et d’activité cérébrale

Ma Clinique

Ma Clinique

L'équipe Ma Clinique : professionnels de la santé et spécialistes en médecine générale. Notre objectif est de vous fournir les informations dont vous avez besoin pour prendre des décisions éclairées sur vos soins de santé.

Articles populaires

Perte d'autonomie chez un senior : ce que change la téléassistance au quotidien

Perte d’autonomie chez un senior : ce que change la téléassistance au quotidien

7 septembre 2026
Oméga 3 : bénéfices prouvés, dosages et comment bien choisir son complément

Oméga 3 : bénéfices prouvés, dosages et comment bien choisir son complément

17 août 2026
Rééducation : quel sol choisir pour limiter l’impact des chutes ?

Rééducation : quel sol choisir pour limiter l’impact des chutes ?

1 août 2026
Le métier d'infirmier : un pilier essentiel du système de santé

Le métier d’infirmier : un pilier essentiel du système de santé

28 juillet 2026
Santé de la vessie : mieux comprendre les fuites urinaires pour vivre plus sereinement

Santé de la vessie : mieux comprendre les fuites urinaires pour vivre plus sereinement

27 juillet 2026

Articles recommandés

Occlusion intestinale et stase stercorale

22 septembre 2022

Personnes malvoyantes : des solutions innovantes pour votre quotidien

23 septembre 2022
La thérapie MBCT contre l’anxiété

La thérapie MBCT contre l’anxiété

3 février 2022
Chirurgie esthétique : le lifting cervico-facial et ses risques

Les chiffres de la chirurgie esthétique en 2015

29 décembre 2015
FUE, DHI, FUT... différentes méthodes de greffe de cheveux pour hommes et femmes

FUE, DHI, FUT… différentes méthodes de greffe de cheveux pour hommes et femmes

17 mars 2023
Épilation laser et détatouage comment le laser esthétique s’impose dans notre quotidien

Épilation laser et détatouage : comment le laser esthétique s’impose dans notre quotidien

9 décembre 2025
Comment obtenir le remboursement d'une chambre individuelle à l'hôpital ?

Comment obtenir le remboursement d’une chambre individuelle à l’hôpital ?

20 décembre 2023
Recourir à un infirmier à domicile : une prestation intéressante

Recourir à un infirmier à domicile : une prestation intéressante

24 novembre 2022
Comment se faire vomir ?

Comment se faire vomir ? Techniques et astuces

25 mai 2022
Clinique ou hôpital pour chirurgie esthétique : quelles différences ?

Clinique ou hôpital pour chirurgie esthétique : quelles différences ?

11 juin 2022
Les conditions du métier d'infirmier en 2024

Les conditions du métier d’infirmier en 2024

7 septembre 2024
La complémentaire santé : son importance et ses différents cas d'utilisation

La complémentaire santé : son importance et ses différents cas d’utilisation

5 juillet 2023

Qui sommes-nous ?

Ma Clinique

Ma Clinique : L'information médicale par des professionnels de la santé.

Ma Clinique est géré par des professionnels de la santé qui ont à cœur de fournir des informations médicales précises et actualisées. Nous sommes une équipe de médecins et d'autres professionnels de la santé, et avons des années d'expérience dans le domaine de la médecine.

Nous trouver

Ma Clinique
11 rue Jules Ferry
01500 Ambérieu-en-Bugey
France

[email protected]

  • Mentions légales
  • Contactez-nous

© 2026 Copyright - Ma Clinique - [email protected]

Pas de résultat
View All Result
  • À la une
  • Actualités
    • Médecines douces
    • Enfants
    • Chirurgie esthétique
  • Chirurgiens esthétiques
  • Contactez-nous

© 2026 Copyright - Ma Clinique - [email protected]

Ce site utilise les cookies. En continuant votre navigation sur ce site, vous acceptez l'utilisation des cookies afin d'assurer le bon déroulement de votre visite et de réaliser des statistiques d'audience. Visitez nos mentions légales .