Une IA médicale alimentée par Gemini a combiné la vue, l’ouïe et le raisonnement clinique pour égaler ou surpasser les médecins sur des mesures clés lors de consultations vidéo simulées, tout en révélant où la connexion humaine et la perception subtile comptent encore.
AMIE guide un patient acteur à travers un examen physique (test de dérive pronatrice) lors d’un appel vidéo. Figure 1 de l’article « Vers une IA médicale de niveau expert pour les consultations vidéo en temps réel », améliorée grâce à l’IA générative.

*Avis important : arXiv publie des rapports scientifiques préliminaires qui ne sont pas évalués par des pairs et, par conséquent, ne doivent pas être considérés comme concluants, guider la pratique clinique/le comportement lié à la santé, ni être traités comme des informations établies.
Une étude récente publiée sur arXiv serveur de préimpression* utilisé AMIEun système multi-agents basé sur Gemini qui intègre la perception audiovisuelle en temps réel, le dialogue à faible latence et le raisonnement clinique, pour démontrer ce que les chercheurs ont décrit comme étant de niveau expert. IA performances lors de consultations vidéo cliniques simulées en temps réel.
Sommaire
Défis et opportunités dans l’IA clinique audiovisuelle
Les consultations vidéo sont la modalité dominante pour les soins cliniques à distance, permettant aux cliniciens d’observer des signaux non verbaux, d’effectuer des examens physiques limités et d’établir des relations. En revanche, la plupart des démonstrations d’IA médicale se sont concentrées sur la messagerie instantanée (JE SUIS), qui excellent dans le raisonnement structuré mais ne parvient pas à capturer la complexité des interactions en direct avec les patients.
Les premières études ont montré qu’il était possible d’étendre l’IA médicale aux modalités audiovisuelles, ouvrant la voie à des soins à distance plus naturalistes et plus efficaces. Néanmoins, des défis importants persistent, notamment la nécessité d’une perception précise et en temps réel des signaux audiovisuels, l’adaptabilité à diverses présentations de patients, une gestion transparente et à faible latence du dialogue et l’intégration d’un raisonnement clinique sophistiqué. Atteindre des performances de niveau clinicien dans ces domaines reste un objectif ouvert et critique pour les agents cliniques d’IA de nouvelle génération.
Développement et évaluation d’AMIE pour une utilisation clinique
Les chercheurs de Google ont développé AMIE, un système multi-agents pour des consultations cliniques vidéo en temps réel, intégrant trois agents spécialisés : l’agent Talker (pour des réponses rapides et fluides des patients), l’agent Planner (pour gérer les objectifs cliniques) et l’agent Perception (pour interpréter les données audiovisuelles). Construits sur Gemini 3 Flash et 3.1 Pro, ces agents fonctionnent de manière asynchrone pour générer un dialogue cliniquement approprié et à faible latence.
Le développement a été guidé par un cadre d’évaluation automatisé comprenant des tests ciblés à un seul tour et des conversations simulées à plusieurs tours pour évaluer les performances cliniques et conversationnelles de bout en bout. La taxonomie d’évaluation couvre un large éventail d’indices audiovisuels cliniques et de manœuvres physiques pertinents pour la télésanté, en distinguant les indices par leur faisabilité virtuelle et leur action par les patients acteurs. Les évaluations utilisent des rubriques spécifiques à un scénario et un grand modèle de langage (LLM) des évaluateurs automatiques.
Pour l’évaluation clinique, un examen clinique objectif structuré randomisé à plusieurs bras (OSCE) a comparé AMIE (dans les configurations vidéo et texte) avec 10 NOUS médecins de soins primaires certifiés par le conseil (PCP) à travers 100 scénarios de patients simulés. Les consultations ont été réalisées auprès de 15 patients acteurs professionnels standardisés et notées à l’aide de rubriques générales et spécifiques à un cas par un panel de 20 évaluateurs cliniques du PCP.
Les critères d’évaluation comprenaient l’exactitude du diagnostic, le raisonnement clinique, la prise en charge, la communication et l’acuité perceptuelle. Des données qualitatives supplémentaires provenant des patients acteurs et des évaluateurs ont permis d’évaluer davantage l’expérience utilisateur.
AMIE correspond ou dépasse les PCP dans les paramètres vidéo simulés en temps réel
L’AMIE a surpassé ou égalé les PCP dans les consultations vidéo simulées en temps réel. Les évaluateurs cliniques ont évalué AMIE Video comme égal ou supérieur aux PCP dans les cinq domaines cliniques spécifiques à chaque cas et lui ont attribué un score global plus élevé : 83 % contre 68 %.
Les acteurs patients ont préféré AMIE Video pour évaluer et expliquer les conditions, bien qu’il n’y ait pas de différences significatives en termes d’empathie ou de réponse aux préoccupations. AMIE Video a atteint une précision diagnostique plus élevée, avec son diagnostic différentiel de premier rang correspondant au diagnostic de référence prédéfini dans 91 % des scénarios, contre 77 % pour les PCP. Cette différence s’est réduite et n’était pas statistiquement significative lorsque les trois principaux diagnostics différentiels étaient pris en compte (98 % contre 90 %).
AMIE excellait également en raisonnement clinique, avec un score de 90 % contre 76 %, et en planification de traitement, avec 79 % contre 67 %. Les scores d’anamnèse étaient également plus élevés pour l’AMIE, et son utilisation de la vidéo en direct et des conseils pour les examens physiques assistés par le patient était nettement plus forte que celle des PCP. L’AMIE était particulièrement performante dans l’exploitation de la vidéo pour l’observation en direct et le guidage des examens. Les scores de communication ont favorisé l’AMIE, bien que les patients acteurs aient montré une préférence non significative pour les PCP dans l’établissement de relations et de partenariats.

Exemple d’interaction AMIE présentant les activités des agents Talker, Perception et Planner.
En comparant les interfaces de chat vidéo et textuel, les patients acteurs ont noté la version vidéo de manière significativement plus élevée en termes d’efficacité de la communication, de facilité d’utilisation et de compréhension des problèmes. La vidéo a offert les plus grandes améliorations en matière de perception et de compétences d’examen. Les performances de diagnostic et de gestion étaient similaires dans les deux modalités, tandis que les évaluations individuelles patient-acteur du comportement de l’agent étaient également largement similaires, bien qu’elles favorisaient généralement la vidéo.
Les informations qualitatives ont indiqué que les consultations vidéo permettaient une démonstration directe des symptômes et des expressions cohérentes d’empathie, et qu’AMIE était décrite comme minutieuse et sans hâte. Les PCP, cependant, ont été privilégiés pour le flux naturel des conversations. Certaines limitations d’AMIE Video ont été notées, notamment des repères visuels manqués occasionnels et des défis techniques.
Les évaluations automatisées ont montré que l’utilisation d’agents spécialisés, notamment Perception et Planner, a grandement amélioré les performances d’AMIE. Le système complet a globalement surpassé la version Talker uniquement dans les scénarios cliniques à un tour et à plusieurs tours, excellant dans les évaluations visuelles et le raisonnement clinique. Cependant, dans les simulations automatisées à plusieurs tours, les résultats de l’examen visuel étaient transmis par des instructions verbales plutôt que par une vidéo continue en direct.
Même si l’AMIE a fourni d’excellents résultats dans la plupart des domaines physiques, il a encore du mal à réaliser des tâches de perception subtiles, telles que la détection du nystagmus, des tremblements ou l’interprétation de l’humeur. Surtout, la conception de l’agent asynchrone a permis des performances d’évaluation automatisées plus élevées tout en réduisant la latence moyenne des tours de 21,4 à 2,6 secondes par rapport à l’architecture séquentielle précédente.
Après chaque rencontre en direct, l’AMIE et les médecins ont également rempli des questionnaires post-rencontre structurés couvrant les diagnostics différentiels et la prise en charge. Pour cette étape moins contrainte de latence, l’AMIE a utilisé plusieurs versions préliminaires et synthèses pour améliorer la qualité de ses recommandations.
Prochaines étapes pour l’IA vidéo clinique
L’approche asynchrone et multi-agents d’AMIE démontre un fort potentiel pour faire progresser les consultations vidéo cliniques assistées par l’IA. Cependant, des limites subsistent, notamment des défis liés à la précision anatomique fine, aux nuances affectives et à la détection de mouvements à haute fréquence, ainsi que le recours à des patients simulés plutôt qu’à des rencontres cliniques réelles. Le système repose également sur un tour de rôle discret, empêchant le dialogue naturel qui se chevauche et les interjections déclenchées visuellement possibles lors des consultations humaines.
La comparaison différait également des consultations vidéo classiques car les PCP devaient garder leurs caméras éteintes pour correspondre à l’absence d’avatar visuel d’AMIE, ce qui, selon les auteurs, pourrait avoir affecté les évaluations du rapport et de l’empathie. L’insu complet n’était pas possible car les styles de communication et les voix différaient entre l’AMIE et les médecins.
À l’avenir, les chercheurs devraient se concentrer sur la résolution de ces limitations et effectuer une validation approfondie dans le cadre de flux de travail cliniques réels afin de garantir à la fois la sécurité et l’efficacité. À mesure que la technologie évolue, l’AMIE et les systèmes similaires peuvent élargir l’accès à des soins de haute qualité et améliorer les capacités de télémédecine.

*Avis important : arXiv publie des rapports scientifiques préliminaires qui ne sont pas évalués par des pairs et, par conséquent, ne doivent pas être considérés comme concluants, guider la pratique clinique/le comportement lié à la santé, ni être traités comme des informations établies.

















