Quan un fàrmac es dissenya per encaixar amb una proteïna concreta, un dels detalls que més costa determinar és on exactament se situen els seus àtoms d'hidrogen: la mateixa molècula pot adoptar diverses formes —anomenades tautòmers— segons on es col·loquin aquests àtoms, i cada forma es lliga d'una manera diferent a la proteïna. Calcular quina és la forma més estable normalment exigeix mètodes de química quàntica que triguen minuts o hores per cada molècula, un ritme incompatible amb el cribratge de milions de compostos candidats a fàrmac.
Un equip liderat per Yingkai Zhang a la Universitat de Nova York, amb Xiaolin Pan com a primer autor, ha entrenat una xarxa neuronal de grafs amb més d'1,1 milions de configuracions de tautòmers extretes de la base de dades estructural de Cambridge. El model prediu directament, a partir només de l'estructura bidimensional d'una molècula i sense necessitat de conèixer-ne la forma en tres dimensions ni de fer cap càlcul quàntic, quina és la configuració d'hidrogens més estable. Amb aquest mètode, els investigadors van revisar 4,6 milions de compostos en només 3,2 hores en un sol node de càlcul amb GPU.
En aplicar el model a una base de 5.075 molècules ja lligades a proteïnes conegudes, el sistema va assenyalar que 126 —un 2,5% del total— tenien probablement mal assignada la posició dels seus hidrògens a les bases de dades públiques, i que la configuració alternativa que proposava encaixava millor amb els enllaços d'hidrogen reals amb la proteïna del voltant. Zhang ho resumeix així: «assignar correctament el tautòmer és determinant per al modelatge molecular i per al disseny de fàrmacs basat en l'estructura». L'equip ha publicat el mètode en obert amb el nom de Tautomer-Predictor.
El treball, publicat a la revista Chemical Science, no substitueix els mètodes quàntics quan es necessita la màxima precisió per a un sol compost, sinó que ofereix una manera ràpida de fer una primera tria entre milions de candidats abans de passar als càlculs més costosos. Els mateixos autors adverteixen que el model s'ha entrenat amb dades de la base de Cambridge, majoritàriament de molècules petites orgàniques, i que la seva fiabilitat pot variar en famílies químiques poc representades en aquell conjunt de dades.
