Dans une étude récente publiée dans Rapports scientifiquesun groupe de chercheurs a amélioré l’exactitude des prévisions de mortalité dans les services d’urgence (SU) en employant des techniques avancées de synthèse de données et des modèles d’apprentissage automatique.
L’objectif principal était d’améliorer le score F1 tout en conservant un score élevé de zone sous la courbe (AUC), en utilisant un ensemble de données de l’urgence de l’hôpital Yonsei Severance.
Sommaire
Arrière-plan
Chaque année, les services d’urgence des États-Unis accueillent 130 millions de visites, ce qui entraîne des contraintes de ressources et un surpeuplement, une situation aggravée par la pandémie du coronavirus 2 du syndrome respiratoire aigu sévère (SRAS-CoV-2).
Les systèmes de triage actuels sont subjectifs et sujets aux erreurs. L’apprentissage automatique (ML) peut améliorer la précision de la prévision des résultats pour les patients, mais les premiers modèles présentaient des limites. Des recherches supplémentaires sont essentielles pour optimiser les algorithmes d’apprentissage automatique et de synthèse de données pour les prévisions de mortalité dans les services d’urgence, en traitant des déséquilibres des ensembles de données et de l’efficacité des fonctionnalités.
À propos de l’étude
La présente étude a utilisé les données de 7 325 personnes qui ont visité le service d’urgence de l’hôpital Yonsei Severance à Séoul, en Corée du Sud, entre janvier et juin 2020. En tant que clinique de dépistage désignée de la maladie à coronavirus 2019 (COVID-19), l’hôpital a été chargé de gérer les cas graves. Les données ont été collectées par le personnel médical autorisé via le système électronique de l’hôpital.
Vingt et une caractéristiques ont été utilisées pour l’analyse. Six fonctionnalités (nébuliseur, radiographie pulmonaire, O2 appliquer, analyse de sang, fluides et médicaments) indiquait si les patients avaient reçu des traitements spécifiques après l’évaluation initiale.
L’hypertension artérielle (HiBP), le diabète sucré (DM), les allergies, la tuberculose pulmonaire (Pul. Tbc), l’hépatite et d’autres médicaments étaient basés sur les antécédents médicaux du patient.
L’ensemble final de sept paramètres, y compris l’état mental et les signes vitaux, a été acquis lors de l’évaluation initiale. Par exemple, le test sanguin indiquait une formule sanguine complète, tandis que l’HiBP révélait la présence d’une pression artérielle élevée.
L’ensemble de données initial comptait 7 325 patients, mais 1 543 enregistrements comportaient des fonctionnalités manquantes, ce qui a conduit à un ensemble de données affiné de 5 782 enregistrements. Pour la formation et l’évaluation du système d’apprentissage automatique, les données ont été divisées en ensembles de formation et de test.
Compte tenu du déséquilibre inhérent de l’ensemble de données, des techniques de synthèse de données telles que la technique de suréchantillonnage de minorité synthétique (SMOTE) et le réseau contradictoire génératif tabulaire conditionnel (CTGAN) ont été utilisées pour générer des données synthétiques sur les patients décédés.
Pour la prédiction, quatre algorithmes de prédiction d’apprentissage automatique ont été utilisés, allant de l’apprentissage automatique traditionnel à l’apprentissage basé sur le réseau neuronal profond (DNN). Malgré la sous-performance générale de DNN pour les ensembles de données tabulaires, TabNet a été utilisé pour ses récentes performances supérieures.
Le cadre des modèles de prédiction comprenait le prétraitement, la division des données, l’augmentation via des algorithmes de synthèse de données et la formation de plusieurs modèles de classification. Une approche d’ensemble a finalement été adoptée pour fusionner les prédictions des modèles.
La présente étude a mis l’accent sur le score F1 comme principale mesure d’évaluation par rapport aux scores de précision conventionnels en raison de sa pertinence dans des ensembles de données médicales déséquilibrées.
Résultats de l’étude
L’objectif central de l’étude était d’identifier la combinaison la plus efficace de modèles de classification d’apprentissage automatique (ML) et de techniques de synthèse de données pour prédire avec précision les taux de mortalité des patients aux urgences. Compte tenu de la nature déséquilibrée de l’ensemble de données, le score F1 a été choisi comme principal critère de performance.
Les cinq meilleurs modèles affichaient des mesures de performances remarquables, telles que le score F1, l’AUC, l’exactitude, la précision et le rappel. Notamment, le modèle phare, qui utilisait la copule gaussienne pour la synthèse de données combinée au classificateur CatBoost, s’est démarqué par ses prouesses prédictives.
Ce modèle présentait une AUC de 0,9731, un score F1 de 0,7059 et un taux de précision impressionnant de 0,9914. De plus, sa précision était de 0,8000 tandis que son rappel était de 0,6316. La valeur de rappel louable est particulièrement importante car elle implique que le modèle peut identifier avec compétence la classe positive, représentant les patients les plus urgents ayant un besoin urgent d’intervention médicale.
Lors de l’évaluation du large éventail de résultats, il est évident que différentes combinaisons d’algorithmes ML et de méthodes de synthèse de données ont donné des résultats louables dans la prévision de la mortalité des patients aux urgences. Les modèles de premier plan ont systématiquement obtenu des scores élevés sur diverses mesures de performances.
Ces résultats soulignent l’immense promesse que les modèles ML représentent pour améliorer les prédictions concernant les résultats pour les patients dans les contextes de soins d’urgence. De tels progrès peuvent permettre aux professionnels de la santé de prendre des décisions éclairées, conduisant finalement à des interventions médicales opportunes et adaptées.
Cela augmente non seulement l’efficacité des procédures médicales, mais pourrait potentiellement sauver des vies, soulignant ainsi l’impact profond de l’intégration de modèles prédictifs avancés dans le domaine des soins de santé.
Conclusions
Pour résumer, la présente étude a introduit vingt et une caractéristiques distinctes qui ont surpassé les références antérieures en matière de prévision de la mortalité dans les services d’urgence. Malgré les difficultés liées aux ensembles de données déséquilibrés, le modèle a obtenu un score F1 particulièrement élevé, indiquant des capacités prédictives fiables.
Comparés aux systèmes de triage conventionnels et aux recherches antérieures, les modèles de cette étude, en particulier ceux utilisant les données synthétiques de la méthode de la copule gaussienne, ont montré des performances supérieures.
La variance des scores de triage traditionnels a mis en évidence la nécessité de systèmes de soins de santé cohérents et intelligents. L’algorithme de synthèse de données de l’étude a amélioré efficacement les prédictions des modèles, soulignant son importance dans la formation des modèles d’apprentissage automatique.
