Récemment, l'équipe de recherche dirigée par le professeur Li Hai à l'Institut de la technologie de la santé et de la technologie médicale, les Instituts des sciences physiques de l'Académie chinoise des sciences, a développé un nouveau cadre d'apprentissage en profondeur qui améliore considérablement la précision et l'interprétabilité de la détection des troubles neurologiques à travers la parole.
« Un léger changement dans la façon dont nous parlons pourrait être plus qu'un simple glissement de la langue – il pourrait être un signe d'avertissement du cerveau», a déclaré le professeur Li Hai, qui a dirigé l'équipe, »Notre nouveau modèle peut détecter les premiers symptômes de maladies neurologiques comme les enregistrements vocaux de Parkinson, Huntington et Wilson.«
L'étude a récemment été publiée dans Neurocomputing.
La dysarthrie est un symptôme précoce courant de divers troubles neurologiques. Étant donné que ces anomalies de la parole reflètent souvent des processus neurodégénératifs sous-jacents, les signaux vocaux sont devenus des biomarqueurs non invasifs prometteurs pour un dépistage précoce et une surveillance continue de ces conditions. L'analyse de la parole automatisée offre une efficacité élevée, un faible coût et une non-invasion. Cependant, les méthodes traditionnelles actuelles souffrent souvent d'une relevée excessive sur les caractéristiques fabriquées à la main, de la capacité limitée pour modéliser les interactions temporelles variables et une mauvaise interprétabilité.
Pour relever ces défis, l'équipe a proposé un transformateur interactif interactif (CTCAIT) interactif et à axe transversal pour l'analyse multivariée des séries chronologiques. Ce cadre utilise d'abord un modèle audio à grande échelle pour extraire des caractéristiques temporelles de haute dimension de la parole, les représentant comme des intérêts multidimensionnels le long du temps et des axes de caractéristiques. Il exploite ensuite le réseau de temps de création pour capturer des modèles à échelle multi-échelles et à plusieurs niveaux dans la série chronologique. En intégrant les mécanismes d'attention multi-channeaux et canals inter-canaux, CTCAIT capture efficacement les signatures de la parole pathologiques intégrées à différentes dimensions.
La méthode a obtenu une précision de détection de 92,06% sur un ensemble de données chinois mandarin et 87,73% sur un ensemble de données anglaises externes, démontrant une forte généralisabilité trans-linguistique.
En outre, l'équipe a effectué des analyses d'interprétabilité des processus de prise de décision internes du modèle et a systématiquement comparé l'efficacité de différentes tâches de parole, offrant des informations précieuses pour son déploiement clinique potentiel.
Ces efforts fournissent des conseils importants pour les applications cliniques potentielles de la méthode dans le diagnostic précoce et la surveillance des troubles neurologiques.

















