Dans une nouvelle étude, le système de diagnostic de Microsoft propulsé par l'IA a surpassé les médecins expérimentés pour résoudre les cas médicaux les plus difficiles plus rapidement, moins cher et plus précisément.
Étude: diagnostic séquentiel avec des modèles de langage. Crédit d'image: Metamorworks / shutterstock.com

* Avis important: arxiv Publie des rapports scientifiques préliminaires qui ne sont pas évalués par les pairs et, par conséquent, ne doivent pas être considérés comme concluants, guider la pratique clinique / comportement lié à la santé, ou traités comme des informations établies.
Une étude récente sur le Arxiv Le serveur préalable a comparé la précision de diagnostic et les dépenses de ressources des systèmes d'IA avec ceux des cliniciens concernant les cas complexes. L'équipe Microsoft AI a démontré l'utilisation efficace de l'intelligence artificielle (IA) en médecine pour relever les défis diagnostiques que les médecins luttent pour déchiffrer.
Sommaire
Diagnostic séquentiel et modèles de langue
Souvent, les médecins diagnostiquent les patients pour une maladie grâce à un processus de raisonnement clinique qui implique un questionnement et des tests itératifs étape par étape. Même avec des informations initiales limitées, les cliniciens ont affiner le diagnostic possible en interrogeant le patient et en confirmant par le biais de tests biochimiques, d'imagerie, de biopsie et d'autres procédures de diagnostic.
La résolution d'un cas complexe nécessite un large ensemble de compétences, notamment la détermination des questions ou des tests suivants les plus critiques, en restant conscient des coûts de test pour éviter accroître la charge des patients et reconnaître les preuves pour établir un diagnostic confiant.
Plusieurs études ont démontré l'efficacité améliorée des modèles de langage (LMS) dans la performance des examens de licence médicale et des vignettes diagnostiques hautement structurées. Cependant, la performance de la plupart des LMS a été évaluée dans des conditions artificielles, qui diffèrent considérablement des contextes cliniques du monde réel.
La plupart des modèles LMS pour les évaluations diagnostiques sont basés sur un quiz à choix multiple, et le diagnostic est fait à partir d'un ensemble de réponses prédéfinies. Un cycle de diagnostic séquentiel réduit augmente le risque de surestimer la compétence du modèle de référence statique. De plus, ces modèles de diagnostic présentent le risque de commande de test aveugle et de fermeture de diagnostic prématurée. Par conséquent, il existe un besoin urgent d'un système d'IA basé sur un cycle de diagnostic séquentiel pour améliorer la précision du diagnostic et réduire les coûts des tests.
À propos de l'étude
Pour surmonter les inconvénients ci-dessus des modèles LMS pour le diagnostic clinique, les scientifiques ont développé la référence de diagnostic séquentiel (SDBench) comme cadre interactif pour évaluer les agents de diagnostic (humain ou AI) grâce à des rencontres cliniques séquentielles réalistes.
Pour évaluer la précision diagnostique, la présente étude a utilisé des cas hebdomadaires publiés dans le New England Journal of Medicine (NEJM), le premier journal médical mondial. Cette revue publie généralement des dossiers de cas de patients du Massachusetts General Hospital dans un format narratif détaillé. Ces cas sont parmi les plus difficiles et les plus exigeants diagnostiquement en médecine clinique, nécessitant souvent plusieurs spécialistes et tests de diagnostic pour confirmer un diagnostic.
SDBENCH RECAST 304 cas de la Conférence de la Clinicopathological (CPC) 2017-2025 dans les rencontres diagnostiques par étapes. Les données médicales ont duré des présentations cliniques à des diagnostics finaux, allant des conditions courantes (par exemple, pneumonie) à des troubles rares (par exemple, hypoglycémie néonatale). À l'aide de la plate-forme interactive, les agents de diagnostic décident quelles questions poser, quels tests commander et quand confirmer un diagnostic.
Information Gatekeeper est un modèle de langue qui révèle sélectivement les détails cliniques à partir d'un fichier de cas complet uniquement lorsqu'il est explicitement interrogé. Il peut également fournir des informations compatives supplémentaires pour les tests non décrits dans le récit original du CPC. Après avoir posé le diagnostic final sur la base des informations obtenues auprès du portier, la précision de l'évaluation clinique a été testée contre le diagnostic réel. De plus, le coût cumulatif de tous les tests de diagnostic demandés effectués dans le diagnostic du monde réel a été estimé. En évaluant la précision et le coût du diagnostic, SDBench indique à quel point nous sommes proches des soins de haute qualité à un coût durable.
Résultats de l'étude
La présente étude a analysé les performances de tous les agents diagnostiques sur le SDBench. Les agents de l'IA ont été évalués sur les 304 cas NEJM, tandis que les médecins ont été évalués sur un sous-ensemble détenu de 56 cas de test. Cette étude a observé que les agents de l'IA fonctionnaient mieux sur ce sous-ensemble que les médecins.
Les médecins exerçant aux États-Unis et au Royaume-Uni avec une médiane de 12 ans d'expérience clinique ont atteint une précision de diagnostic de 20% à un coût moyen de 2 963 $ par cas sur SDBench, mettant en évidence la difficulté inhérente de la référence. Les médecins ont passé en moyenne 11,8 minutes par cas, demandant 6,6 questions et 7,2 tests. GPT -4O a surpassé les médecins en termes de précision diagnostique et de coût. Des modèles standard disponibles dans le commerce offraient une précision et un coût de diagnostic variés.
La présente étude a également introduit l'orchestrateur de diagnostic MAI (MAI-DXO), une plate-forme co-conçue avec des médecins, qui présentaient une efficacité diagnostique plus élevée que les médecins humains et les modèles de langage commercial. Par rapport aux LM commerciaux, MAI-DXO a démontré une précision diagnostique plus élevée et une réduction significative des coûts médicaux de plus de la moitié. Par exemple, le modèle O3 standard a atteint une précision de diagnostic de 78,6% pour 7 850 $, tandis que Mai-Dxo a atteint une précision de 79,9% à seulement 2 397 $, ou 85,5% à 7 184 $.
Mai-dxo a accompli cela en simulant un panel virtuel d '«agents de docteur» avec différents rôles dans la génération d'hypothèses, les sélections de tests, la conscience du coût et la vérification des erreurs. Contrairement à l'incitation à l'IA de base, cette orchestration structurée a permis au système de raisonner itérativement et efficacement.
Mai-dxo est une approche agnostique du modèle qui a démontré des gains de précision sur divers modèles de langues, pas seulement le modèle de fondation O3.
Conclusions et perspectives futures
Les résultats de la présente étude démontrent une précision diagnostique et une rentabilité plus élevées des systèmes d'IA lorsqu'ils sont guidés pour penser de manière itérative et judicieusement. SDBench et Mai-Dxo ont fourni une base empiriquement fondée sur la base de diagnostic assisté par l'IA sous des contraintes réalistes.
À l'avenir, Mai-Dxo doit être validé dans les environnements cliniques, où la prévalence et la présentation des maladies se produisent aussi souvent que quotidiennement, plutôt que comme une occasion rare. De plus, des repères médicaux interactifs à grande échelle impliquant plus de 304 cas sont nécessaires. L'incorporation de modalités visuelles et d'autres modalités sensorielles, telles que l'imagerie, pourrait également améliorer la précision diagnostique sans compromettre la rentabilité.
Cependant, les auteurs notent des limitations importantes. Les cas de CPC NEJM sont sélectionnés pour leur difficulté et ne reflètent pas les présentations cliniques quotidiennes. L'étude n'a pas inclus de patients en bonne santé ni mesure les taux de faux positifs. De plus, les estimations des coûts de diagnostic sont basées sur les prix américains et peuvent varier à l'échelle mondiale.
Les modèles ont également été testés sur un ensemble de tests détenues de cas récents (2024-2025) pour évaluer la généralisation et éviter le sur-ajustement, car bon nombre de ces cas ont été publiés après le seuil de formation pour la plupart des modèles.
Le document soulève également une question plus large: devrions-nous comparer les systèmes d'IA aux médecins individuels ou aux équipes médicales complètes? Étant donné que Mai-Dxo imite la collaboration multi-spécialistes, la comparaison peut refléter quelque chose de plus proche des soins en équipe que la pratique individuelle.
Néanmoins, la recherche suggère que des systèmes d'IA structurés comme MAI-DXO peuvent un jour soutenir ou augmenter les cliniciens, en particulier dans les milieux où l'accès spécialisé est limité ou coûteux.
Téléchargez votre copie PDF maintenant!

* Avis important: arxiv Publie des rapports scientifiques préliminaires qui ne sont pas évalués par les pairs et, par conséquent, ne doivent pas être considérés comme concluants, guider la pratique clinique / comportement lié à la santé, ou traités comme des informations établies.

















