Des chercheurs de l’Université de New York ont formé un modèle d’IA pour apprendre les modèles chimiques associés à la stabilité des molécules de type médicament et prédire avec précision où leurs atomes d’hydrogène devraient être positionnés.
Leurs recherches, publiées dans la revue Science chimiquerépond à un défi de longue date en matière de conception moléculaire et de découverte de médicaments : comment déterminer rapidement et de manière fiable la forme stable de molécules partageant une formule moléculaire mais se transformant facilement en différentes formes.
De nombreuses molécules de type médicament peuvent exister sous deux formes ou plus étroitement liées, appelées tautomères. Un atome d’hydrogène se déplace d’un site à un autre, accompagné d’un changement dans le modèle de liaison.
Bien que cela puisse sembler un petit changement, différents tautomères de la même molécule peuvent modifier la façon dont une molécule interagit avec une cible protéique. L’affectation correcte des tautomères est par conséquent importante pour la modélisation moléculaire et la découverte de médicaments basée sur la structure.
Yingkai Zhang, professeur de chimie à NYU et auteur principal de l’étude
Pourtant, déterminer le bon tautomère reste un défi, comme trouver une aiguille dans une botte de foin en mouvement. Cela est dû en partie à la rareté des données expérimentales caractérisant les structures tautomères. Par exemple, dans la Protein Data Bank, un référentiel mondial de structures 3D de grandes molécules biologiques largement utilisé dans la recherche biologique, l’emplacement des atomes d’hydrogène qui distinguent un tautomère d’un autre n’est généralement pas disponible. La banque de données sur les protéines contient des structures moléculaires qui sont en grande partie déterminées à l’aide de méthodes expérimentales telles que la cristallographie aux rayons X, mais la résolution des structures macromoléculaires aux rayons X est généralement insuffisante pour localiser de manière fiable la position des atomes d’hydrogène. En conséquence, les scientifiques doivent souvent déduire les positions de l’hydrogène – et donc l’état tautomère d’une molécule.
D’autres méthodes échouent également. L’utilisation de la mécanique quantique pour évaluer les tautomères est souvent trop exigeante en termes de calcul et coûteuse pour examiner des bibliothèques complètes, tandis que l’apprentissage automatique est limité par les ensembles de données relativement petits de tautomères caractérisés expérimentalement en solution, qui ne contiennent généralement que quelques centaines de molécules.
En revanche, de nombreuses structures cristallines à rayons X à petites molécules à haute résolution dans la base de données structurelle de Cambridge, le plus grand référentiel de structures cristallines expérimentales au monde, montrent la position des atomes d’hydrogène.
« Nous avons réalisé que les positions de l’hydrogène résolues expérimentalement dans les structures cristallines de petites molécules à haute résolution fournissent une source largement inexploitée d’informations expérimentales sur la stabilité des tautomères », a déclaré Zhang, qui fait également partie du NYU Simons Center for Computational Physical Chemistry.
Xiaolin Pan, postdoctorant dans le laboratoire de Zhang et premier auteur de l’étude, a systématiquement exploité la base de données structurelles de Cambridge pour construire un ensemble de données contenant plus de 1,1 million d’états tautomères, des ordres de grandeur plus grands que les ensembles de données expérimentales existantes. Il a ensuite formé un réseau neuronal graphique – un type d’intelligence artificielle qui utilise l’apprentissage profond pour trouver des modèles entre des points de données connectés – afin de prédire des tautomères stables directement à partir de formes moléculaires 2D, sans nécessiter de structures 3D ou de calculs de mécanique quantique.
Lorsque les chercheurs ont appliqué leur modèle à 5 075 ligands PDBbind – complexes biomoléculaires trouvés dans la banque de données sur les protéines – avec plusieurs états tautomères possibles, ils ont identifié 126 cas – environ 2,5 pour cent – dans lesquels le tautomère du ligand attribué était probablement incorrect. Dans chacun de ces cas, le modèle a réattribué un tautomère stable alternatif, qui présentait des modèles de liaisons hydrogène améliorés.
« La réaffectation de ces tautomères a généralement produit des interactions chimiquement plus raisonnables. Cela ne signifie pas que les structures protéiques elles-mêmes déterminées expérimentalement sont incorrectes; nos résultats suggèrent plutôt que la représentation chimique précédemment attribuée peut justifier une révision », a noté Zhang.
Par exemple, dans l’une des molécules de la Protein Data Bank, le modèle d’IA a prédit un tautomère avec un atome d’hydrogène positionné différemment que dans la mission initiale. À la suite de ce changement, le ligand forme des liaisons hydrogène supplémentaires avec les résidus protéiques voisins, illustrant comment un changement apparemment minime peut modifier les interactions de la molécule avec son environnement protéique.
L’utilisation de ce modèle pour identifier plus précisément un tautomère en vue de la découverte de médicaments pourrait non seulement aider à déterminer comment il s’intègre dans un site de liaison protéique, mais pourrait également améliorer les simulations informatiques ultérieures. Lors de l’évaluation des médicaments candidats, les simulations de dynamique moléculaire suivent une molécule et sa protéine cible pour voir comment elles interagissent et se déplacent dans le temps.
« Ces calculs nécessitent que les positions hydrogène et les liaisons chimiques de la molécule soient correctement attribuées, et l’utilisation du mauvais tautomère pourrait modifier les interactions et la dynamique prédites », a déclaré Zhang.
Les chercheurs ont publié leur méthode sous la forme d’un outil open source, Tautomer-Predictor, capable d’analyser rapidement de très grandes bibliothèques moléculaires. Lors d’un test, il a traité environ 4,6 millions de composés en 3,2 heures sur un seul nœud compatible GPU.
Parmi les autres auteurs de l’étude figurent Chao Han et Fengyang Han du département de chimie de NYU. Cette recherche est publiée dans Science chimiquela revue phare de la Royal Society of Chemistry, à comité de lecture, et sa lecture est gratuite.
Ce travail a été soutenu par les National Institutes of Health (R35-GM127040). Le contenu relève de la seule responsabilité des auteurs et ne représente pas nécessairement les opinions officielles des National Institutes of Health.
