Исследователи Московского физико-технического института (МФТИ) выяснили, что алгоритмы искусственного интеллекта, используемые для моделирования будущих лекарств, могут давать систематические ошибки. Ученые проверили четыре популярных инструмента и обнаружили, что их предсказания не всегда согласуются с реальной химией. Результаты работы помогут разработчикам препаратов точнее оценивать риски при использовании нейросетей и укажут направления для совершенствования таких систем.

Современные методы ИИ, включая AlphaFold 3, произвели революцию в структурной биологии, научившись предсказывать пространственное строение белков. Их развитие позволило моделировать комплексы белков с малыми молекулами (лигандами), что открыло широкие перспективы для создания новых лекарств. Однако точность таких предсказаний, особенно для молекул, способных менять свой заряд в зависимости от кислотности среды, до сих пор систематически не проверялась.

Заведующий лабораторией структурного анализа и инжиниринга мембранных систем МФТИ Иван Гущин пояснил: «Чтобы создать новое лекарство, учёным нужно понять, как молекула будущего препарата свяжется с белком в организме. Современные нейросети обещают решать эту задачу быстро — буквально за несколько часов или даже минут. Но есть одно „но“: ИИ не учитывает важную деталь — электрический заряд молекул. Дело в том, что многие вещества в живых организмах могут менять свой заряд в зависимости от среды: быть то нейтральными, то заряженными положительно или отрицательно. От этого зависит, будет ли лекарство действовать на нужную мишень. Тесты показали, что даже для простейших молекул, которые хорошо изучены, нейросети дают несогласованные результаты».

В ходе работы ученые протестировали четыре инструмента: AlphaFold 3, Boltz-2, Chai-1 и Protenix-v1. В качестве тестовых объектов выбрали простейшие соединения, способные существовать как в нейтральной, так и в заряженной форме, — метиламин и уксусную кислоту. Эти молекулы повсеместно встречаются в белках и, следовательно, должны быть хорошо «знакомы» нейросетям. Однако вычислительные эксперименты показали, что результаты предсказаний в большинстве случаев сильнее зависели от формата описания молекулы на входе — стандарт химических компонентов CCD или строковая запись SMILES, — чем от ее заряда.

Особое беспокойство у авторов вызвала геометрия предсказанных структур. Длины химических связей в молекулах оказались систематически короче реально возможных, вплоть до абсурдных значений. Например, одна из программ «сжимала» связь до 0,0075 нанометра, хотя даже по самым скромным оценкам она должна быть минимум в десять раз длиннее. Это указывает на то, что нейросеть не до конца понимает элементарную химию и может генерировать молекулы с физически невозможной геометрией, то есть предсказывать их поведение в организме с ошибками.

Иван Гущин добавил: «Ни один из четырех популярных методов явно не выделился по качеству предсказаний. Полученные результаты следует интерпретировать с осторожностью. Важно думать в сторону улучшения таких алгоритмов. И здесь критически важны два фактора: во-первых, ИИ-модели должны выдавать одинаковый результат независимо от формата входных данных, во-вторых, при обучении нейросетей нужно учитывать, что молекулы могут менять свой заряд».

Работа выполнена при поддержке Министерства науки и высшего образования Российской Федерации (соглашение 075-03-2026-305, проект FSMG-2025-0003). Все сгенерированные модели и данные находятся в открытом доступе в репозитории Zenodo.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *