Подписаться
Оглавление
Биомолекула

AlphaFold 3: как диффузионные модели пришли в предсказание структуры белков

AlphaFold 3: как диффузионные модели пришли в предсказание структуры белков

  • 19
  • 0,0
  • 0
  • 0
Добавить в избранное print
Обзор

В AlphaFold 3 структура комплекса белка с лигандом буквально рождается из цифрового шума.

Что удивительно, такой подход может генерировать точные предсказания. Как он это делает и где все-таки промахивается — читайте в нашей статье!

Рисунок в оригинальном разрешении.

Предсказание пространственной структуры белка — задача, сформулированная еще Кристианом Анфинсеном, — на протяжении десятилетий решалась лишь косвенно. Ситуация радикально изменилась с появлением AlphaFold 1/2. Его успех был настолько значительным, что уже ознаменовался Нобелевской премией (в 2024 г.) и породил ощущение, что проблема в целом «закрыта».

Однако история этим не закончилась: современная версия — AlphaFold 3 — объединяет эволюционный подход, унаследованный от предыдущих поколений, и диффузионные модели, пришедшие из генерации изображений. Такое сочетание позволяет выйти за пределы белковых структур и предсказывать целые «молекулярные сцены» с участием малых молекул или нуклеиновых кислот. Станет ли AlphaFold3 панацеей — или структуры белок-лигандных комплексов требуют новых подходов?

Георгий Куракин, постоянный автор «Биомолекулы», пытается разобраться в этом вопросе с помощью Алексея Орлова, руководителя Лаборатории вычислительной биомедицины и молекулярной диагностики Центрального университета.

Искусственный интеллект в биологии

Центральный университет

Спецпроект о том, как ИИ меняет современную молекулярную биологию: какие исследовательские задачи он позволяет решать принципиально иначе, какие новые подходы формирует и какие научные результаты уже удалось получить благодаря его применению.


Партнер спецпроекта в 2026 году — Центральный университет (ЦУ), инновационный российский вуз, внедряющий STEM-подход (Science, Technology, Engineering and Mathematics) в высшее образование. В ЦУ наука ориентирована на путь от фундаментальных исследований к продукту — ученые создают прототипы, вычислительные методы и практические подходы. Запущены девять лабораторий и программа трансляционных исследований, где научные группы получают грант до 5 миллионов, менторскую поддержку и взаимодействие с индустрией.

Исходно спецпроект стартовал с научно-исследовательским Институтом искусственного интеллекта AIRI, объединяющим ученых и инженеров данных. Институт активно развивает партнерства между академическим сообществом, промышленностью и образовательными организациями.

Не так давно я (Г. К.) дискутировал в соцсетях с коллегой о своей работе 2020 года [1]. Моя статья, опубликованная в журнале «Молекулярная биология», была посвящена предсказанию структуры комплексов лейкотриеновых рецепторов с естественными агонистами — собственно лейкотриеном B4 и 12(S)-гидроксиэйкозатетраеновой кислотой. Для этого я использовал моделирование рецепторов по гомологии и специализированный сервис для гибкого докинга G-белок-сопряженных рецепторов.

Такой необычный подход удивил моего коллегу. «А зачем это все, если AlphaFold уже все свернул?» — задал он вопрос. И с ходу я, признаться, не смог на него ответить. А чтобы ответить развернуто — пусть и спустя долгое время после самой дискуссии — придется написать целую статью.

Сегодня мы разберем, как устроена архитектура AlphaFold 3; как и зачем модель совмещает большие данные об эволюции с элементами случайности; и к каким ограничениям приводит такой подход. Рассматривая AlphaFold 3 как продукт не только биоинформатики, но и общей эволюции нейросетевых архитектур, мы попробуем ответить на главный вопрос: действительно ли мы теперь можем «свернуть» все? Или же перед нами лишь начало новой, более сложной эпохи моделирования биомолекул?

Долгий путь к структуре

В 1961 году американский биохимик Кристиан Анфинсен публикует свою знаменитую статью [2], где показывает, что денатурированная рибонуклеаза способна самопроизвольно восстанавливать структуру в растворе, как только удаляется денатурирующий фактор. Написанное в этом труде сегодня называется догмой Анфинсена (рис. 1), ставшей для биофизики чем-то вроде центральной догмы молекулярной биологии:

вся информация о нативной вторичной и третичной структурах содержится в самой аминокислотной последовательности.

 Фермент рибонуклеаза А

Рисунок 1А. Фермент рибонуклеаза А подарил нам догму Анфинсена — «Первичная структура белка полностью определяет третичную структуру». Этот принцип был открыт в относительно простом по современным меркам опыте: раствор белка, нагревание и агрессивные реагенты (приводившие к денатурации = потере структуры), а также ферментативная активность рибонуклеазы. Но именно этот опыт подарил теоретическую основу даже сложнейшим «белковым» нейросетям нашего времени. Кстати, как и «догма Крика», догма Анфинсена не то чтобы совсем не знала исключений — это же вам биология, а не физика: «Одна последовательность — одна структура: был ли Анфинсен неправ?» [3]. Ну а первую страницу «той самой статьи» вы увидите далее в крутилке — вращайте барабан!

 Первая страница «той самой» статьи Анфинсена в PNAS

Рисунок 1Б. Первая страница «той самой» статьи Анфинсена в PNAS, где догма сформулирована в оригинальном виде: «Информация о корректном спаривании цистеиновых остатков в дисульфидных связях, и, предположительно, о вторичной и третичной структуре, содержится в самой аминокислотной последовательности».

Уже в XXI веке технологии секвенирования нового поколения [4] — NGS — обеспечили взрывной рост количества нуклеотидных и аминокислотных последовательностей в базах. А вот аналога NGS для определения структур белков [5] у нас пока нет — кристаллы белков выращивать дорого и трудно, возможности ЯМР ограничены небольшими растворимыми белками, а приборы для криоэлектронной микроскопии крайне сложны и дороги. И догма Анфинсена приобрела насущное звучание: если вся информация о трехмерной структуре белка уже есть в самой последовательности аминокислот, то может, ее можно просчитать компьютерными методами?

Увы, все не так радужно — физика фолдинга белка до сих пор остается для нас неприступной стеной [6]: общие закономерности до сих пор не описаны и не формализованы, а низкоуровневых молекулярно-механических явлений в этом процессе слишком много, чтобы их можно было посчитать «в лоб» классическими методами молекулярной динамики .

Подробнее о вычислительных ограничениях МД можно прочитать в статье «Молекулярная динамика биомолекул. Часть III. От перфокарт до ИИ» [7] из одноименного спецпроекта.

До недавнего времени приходилось довольствоваться приближенными методами вроде моделирования по гомологии [8] — буквально «натягивания» последовательности изучаемого белка на его близкого эволюционного «родственника» с известной структурой. Такие подходы еще оставались мейнстримом даже в 2020 году — когда вышла моя статья по лейкотриеновым рецепторам [1]: просто потому, что ничего сильно лучше не было. Вплоть до бума искусственного интеллекта: «История развития искусственного интеллекта и его пришествия в биологию» [9].

Предпосылки для этого бума формировались долго. Почти всю вторую половину XX века исследователи развивали биологически-мотивированные модели, которые, по сути, копировали известные архитектуры нейронных сетей человеческого мозга. А радикально новые подходы появляются лишь начиная с 2005–2006 года, когда группа под руководством Джеффри Хинтона и Джошуа Бенджи начала обучать глубокие нейронные сети. Первым ярким «выходом» ИИ стала победа нейросети AlphaGo над Ли Седолем — чемпионом мира 9-го дана по игре го — в 2016 году. А уже в 2019 году компания DeepMind, выпустившая эту нейросеть, применяет свои наработки в структурной биологии, выпустив нейросеть AlphaFold для предсказания трехмерной структуры белка — об этой первой инкарнации мы в свое время писали: «AlphaFold: нейросеть для предсказания структуры белков от британских ученых» [10].

AlphaFold и его потомок — AlphaFold 2 [11], вышедший в 2021 году — буквально перевернули структурную биологию. Более того, лежащие в их основе подходы позволили поставить на поток обратную задачу: создавать новые белковые последовательности, которые имели бы заданную третичную структуру (и, соответственно, спроектированную функцию). Такой подход называется белковым дизайном, и о прорывах в нем мы также недавно выпустили статью [12] (и напишем еще).

Но даже столь мощные модели, как AlphaFold и AlphaFold 2, работали лишь с «чистыми» белками. Их возможностей явно не хватало, когда требовалось смоделировать структуру белка в комплексе с малой молекулой или нуклеиновой кислотой. Одна из причин — индуцированное соответствие (induced fit): у белка «в чистом виде» связывающий «карман» по форме часто не соответствует лиганду: он может быть «схлопнут» или, наборот, слишком широко «распахнут». Карман необходимой формы и объема образуется непосредственно при взаимодействии с лигандом, когда белок его как бы обхватывает, меняя трехмерную структуру (рис. 2). Иначе говоря, структура белка в комплексе с лигандом сильно отличается от структуры без него, и «свободная» конформация мало применима для докинга малой молекулы или нуклеиновой кислоты: в традиционных «жестких» и «полугибких» подходах, когда белок почти неподвижен, лиганду встать просто некуда.

 Индуцированное соответствие в комплексах белок–лиганд

Рисунок 2. Индуцированное соответствие в комплексах белок–лиганд. В свободном состоянии (слева) связывающий карман белка «захлопнут» и не соответствует по форме лиганду. Только при связывании малой молекулы он «раздвигается», подстраиваясь под его форму (справа). Чтобы хотя бы приблизиться к этой физике, искусственный интеллект должен имитировать кофолдинг — сворачивание сразу нескольких биомолекул в присутствии друг друга, обеспечивая их взаимную «чувствительность». Это то, что есть в биохимии и физике белка; это то, что хотят моделировать биоинформатики; это то, чего не было в AlphaFold 2; ну и, наконец, это то, что появилось — пусть в не окончательном виде — в третьей редакции этой нейросети.

AlphaFold (для краткости иногда будем писать AF) и AlphaFold 2 никак не могли учесть эти изменения конформации, вызванные лигандом, и поэтому выдавали только «свободные» структуры, не очень пригодные для дизайна лекарственных средств и новых ферментов (для которых нужен комплекс с переходным состоянием реакции). Для практического применения белок должен быть «свернут» сразу в комплекс с лигандом. Именно такую задачу и решает AlphaFold 3, опубликованный в 2024 году [13]. Кстати, в отличие от второй версии, запустить которую на своем железе могли только опытные биоинформатики, современная редакция общедоступна на AlphaFold Server, работающем под единым Google-аккаунтом с лимитом на 30 предсказаний в сутки.

Техническая эволюция AlphaFold 3

Добавление лиганда в предсказываемую систему потребовало глубокого переосмысления всей архитектуры AlphaFold, хотя ключевые ее черты — извлечение эволюционной информации, создание пространственного представления и генерация 3D-координат атомов — остались прежними (рис. 3). Если AF 2 работал со структурами, состоящими из 20 протеиногенных аминокислот (и ни с чем более), в третью версию изначально добавили возможность построения «молекулярных сцен», включающих все основные типы биомолекул: белковые комплексы (а не просто изолированные молекулы), нуклеиновые кислоты, лиганды и ионы. Нейросетевой движок, по мере своего разумения, проводит кофолдинг всей этой сцены, пытаясь изобразить реалистичную картину внутри- и межмолекулярных взаимодействий.

Архитектура AlphaFold 3 состоит из нескольких блоков, каждый из которых состоит из множества нейросетей

Рисунок 3. Архитектура AlphaFold 3 состоит из нескольких блоков, каждый из которых состоит из множества нейросетей: (1) Входной модуль, отвечающий за сбор «эволюционной информации» и сохранение ее в форме MSA-выравнивания; поиск структурных шаблонов, инициализирующих структурное представление; и исходную генерацию 3D-конформеров лигандов и модифицированных остатков белков и нуклеиновых кислот — именно та часть, что позволяет строить богатые «молекулярные сцены», не ограничиваясь биополимерами стандартного строения. (2) Модуль встраивания (input embedder), производящий токенизацию на уровнях атомов и остатков и обеспечивающий всю дальнейшую обработку на этих двух «уровнях подробности» (это нужно для моделирования достаточно больших по числу атомов систем). (3) Группа блоков на месте бывшего Evoformer: отдельный MSA-блок для обработки выравниваний и Pairformer с упрощенной структурой. Это деление сделано ради большей архитектурной логичности, а также облегчения алгоритмической сложности — многие дорогие MSA-операции проводятся лишь несколько раз перед основной «молотилкой» Pairformer’а. (4) Диффузионный модуль — в нем кроется вся соль новой программы и под который менялась вся предшествующая архитектура. Конечно, все это очень сложные алгоритмы, и в рамках одной компактной научно-популярной статьи их не объяснить. Но наиболее отчаянных читателей мы отправляем к англоязычным источникам, в которых это все-таки сделано: Understanding AlphaFold 3, An Opinionated AlphaFold 3 Field Guide и The Illustrated AlphaFold.

Что такое токены и зачем к ним сводить атомы и остатки

Прежде всего, изменения потребовались на стадии токенизации. Современные нейросети делят любой массив данных на токены — своеобразные «атомы» датасета, минимальные дискретные единицы, между которыми вычисляются взаимные зависимости через механизм внимания (attention). Поэтому перед входом в любую нейросеть данные предварительно нужно токенизировать — разбить на эти токены. И для разных типов данных эта задача решается по-разному — в человеческих языках одним образом (см. врезку), а для молекул — совсем другим.

Если в языковых моделях (мы уже говорили о них в контексте биохимии [14]) токен — это, как правило, слово или кусок слова, то в AlphaFold токен — это атом или остаток. В AF 2 все было просто: 1 аминокислота = 1 токен, потому что, кроме аминокислот, больше ничего и нет (соответственно, было 20 токенов — которые на тот момент даже не назывались этим словом). А вот в AlphaFold 3 токенов пришлось добавить (соответственно, в статье появилось слово токенизация), чтобы работать с небелковыми молекулами — но разработчикам удалось сделать это экономно и дифференцированно:

  • 1 аминокислота = 1 токен (как и в AF 2);
  • 1 нуклеотид (ДНК отдельно, РНК — отдельно) = 1 токен;
  • В нестандартных аминокислотах и нуклеотидах с модификацией : 1 атом = 1 токен;
  • Малая молекула (лиганд) : 1 атом = 1 токен;
  • Ион также представляет отдельный токен.

У каждого стандартного токена в AF 3 есть свой центр (Cɑ-атом в аминокислоте или C1’-атом в нуклеотиде), относительно которого диффузия достраивает все остальное. Фактически, это центр двухуровневого представления, который позволяет «крупными мазками» моделировать сцены на уровне токенов, а потом дополнительно оптимизировать их химическую корректность уже на атомном уровне.

Для нестандартных молекул, таких как лиганды, стартовый конформер генерируется библиотекой RDKit еще до первого прогона нейросети и таким образом и включается в общее молекулярное представление.

Всего токенов в «молекулярной сцене» в AlphaFold 3 может быть до 5000.

Однако токенизация — это только начальный этап. Самое интересное — как дальше информация об этих токенах обрабатывается. Отбрасывая физическое представление о молекулах, все программы семейства AlphaFold опираются на большие данные и в первую очередь используют информацию об эволюции. Из тех самых последовательностей, которых у нас очень много благодаря методам NGS [4].

Как превратить эволюционный сигнал в «черновик» 3D-структуры

Вторичная и третичная структура белка стабилизируется внутримолекулярными контактами главной и боковых цепей (см.: «Роль слабых взаимодействий в биополимерах» [15]). Пары остатков, связанные водородными, ионными, гидрофобными, π-π и π-катионными контактами, образуют своего рода внутренние «защелки» белка. Но в таком случае случайная замена одной из аминокислот защелки грозит разрушить весь белок! Поэтому аминокислоты должны меняться либо на структурно родственные (которые тоже могут защелкиваться), либо вместе: парами (поменяли защелку целиком, с ответной частью) — то есть коэволюционировать. А значит, методами машинного обучения можно решить обратную задачу: преобразовать информацию о коэволюции, полученную сравнением большого числа последовательностей , в информацию о пространственном сближении аминокислот — а это уже «черновик» 3D-структуры.

Такой анализ проводят на множественном выравнивании последовательностей, или MSA — это ключевой биоинформатический артефакт не только для изучения эволюции, но и для предсказания 3D-структур.

Впервые такую задачу попробовали решить еще в 2011 году [16] методом анализа прямых ковариаций (direct coupling analysis, DCA). Но на тот момент для надежного предсказания целых белков не хватало статистической мощности выборки последовательностей — она должна была быть очень большой. Но к 2017 году за счет метагеномных данных стало доступно гораздо больше последовательностей — и американским биофизикам Сергею Овчинникову и Дэвиду Бейкеру впервые удалось предсказать [17] структуры белков на основе извлеченной из них коэволюционной информации  — для получения конечной структуры там использовался «физический» движок Rosetta [18], с которым прочно связывают имя Бейкера. Теперь дело оставалось за мощными нейросетями — а после триумфа AlphaGo они были у DeepMind.

Через несколько лет именно этот эволюционный принцип лег в основу AlphaFold, только для извлечения структурной информации из эволюционной сокровищницы там стали использовать не физические подходы, а уже нейросети — этим и прославились создатели AF Джон Джампер и Демис Хассабис, на тот момент работавшие в Google Deepmind. Вместе с ними прославился и их «заклятый друг» Бейкер, но уже за другое достижение — белковый дизайн: «Несуществующие в природе белки́ — за что вручили Нобелевскую премию по химии (2024)» [19]. Но остается любопытный факт: сама предпосылка возникновения AlphaFold принадлежит не его создателям, а тому же Бейкеру (и Овчинникову, работавшему в те годы у него постдоком), а точнее даже — авторам слегка уже подзабытой концепции DCA.

Для первой версии AlphaFold использовалась старая добрая сверточная нейросеть, наподобие тех, что используются в машинном зрении [20] (как я ранее писал в своей статье об истории ИИ [9], это вообще одна из самых первых архитектур, да еще и пришедшая напрямую из биологии). Из поданной на вход последовательности и эволюционной информации (в форме MSA) эта сеть предсказывала лишь матрицу расстояний между аминокислотными остатками («дистограмму») — но само «свертывание» белка осуществлялось механистически: «сырую» структуру белка просто «подтягивали» к предсказанной дистограмме методом градиентного спуска.

Прогрессивным шагом в AlphaFold 2 по сравнению с первой версией стала обработка эволюционной информации трансформерами — нейросетями, пришедшими из обработки естественного языка и работающими, в том числе, внутри современных систем машинного перевода и в GPT (генеративных предобученных трансформерах, в последние годы полюбившихся нам в качестве универсальных чат-ботов). Ключевым преимуществом трансформеров является механизм внимания — математический алгоритм, фиксирующий связи между пространственно удаленными токенами . В машинном переводе это помогает учитывать контекст при переводе слов, а в AF — применять подобный же контекст к ковариациям аминокислотных остатков, анализируя «глубокие выравнивания» в поисках эволюционных сигналов.

В статье «Как языковые модели покорили мир белков» [14] мы не только рассказали о применении ИИ к «белковым текстам», но и сравнили трансформер с двумя хронологически предшествующими архитектурами — рекуррентными нейросетями и сетями с «долгой краткосрочной памятью». Почитайте ту статью, чтобы понять преимущества механизма внимания, допускающего непосредственное взаимовлияние удаленных токенов друг на друга — и через него восстановление картины пространственных контактов внутри белка.

Evoformer vs. Pairformer

В AlphaFold 2 присутствовала целая группа трансформеров, образуя «эволюционный» модуль под названием Evoformer: он параллельно обрабатывал «линейное» и пространственное представление белка, конвертируя эволюционный сигнал в зачатки трехмерной структуры (подробнее об этом — во врезке «Под капотом у Альфа Фолда» статьи про белковые языковые модели [14]). Трансформеры задали новый уровень точности в предсказании структуры белка на основе эволюционного сигнала — но в AlphaFold 3 возникла новая сложность. Из последовательности и выравниваний белка нельзя извлечь информацию о коэволюции с лигандом — хотя как явление она, конечно, существует .

Более того, она исследуется — в качестве примера можно привести статью по стероидным гормонам позвоночных [21], где строилось настоящее эволюционное дерево для лигандов и реконструировался их предок. Но это во многом пионерская работа, которая неспособна сгенерировать выборки подходящей статистической мощности.

Поставив перед собой задачу в третьем релизе AlphaFold предсказывать строение «молекулярных сцен», исходно учитывающих возможность присутствия лигандов, разработчики уже не могли так же активно опираться на коэволюционную информацию, как при предсказании структуры изолированных белков, и приняли решение увеличить вклад попарных взаимодействий, заменив модуль Evoformer на Pairformer. В модуле Evoformer программы AlphaFold 2 множественное выравнивание и матрица попарных взаимодействий между аминокислотными остатками взаимно обновляют друг друга через каждый слой, образуя тяжелую рекурсию с большим вкладом аминокислотных последовательностей.

В архитектуре AF 3, с целью облегчить этот конвейер и сделать его более лаконичным, из Pairformer выделен компактный MSA-блок, где сосредоточены все «дорогие» операции над выравниванием еще до основных прогонов парного модуля. На долю Pairformer остается теперь только парное представление без постоянных обновлений со стороны MSA. В результате модель «научилась» опираться на структуру попарных взаимодействий больше, чем на эволюционную информацию из белковых последовательностей.

Вместе с тем, в Pairformer оставлено одно из ключевых изобретений Evoformer’a — автоматическое соблюдение «треугольного неравенства», накладывающего естественные геометрические ограничения на попарные расстояния между любыми тройками точек. По разным оценкам, такое «переформатирование» ускорило «ствол» нейросети на 40%, не снизив качество считывания эволюционного сигнала и сохранение геометрической консистентности.

В любой непонятной ситуации — диффундируй

Но самые большие изменения произошли непосредственно на стадии генерации структуры — в так называемом структурном модуле. Если в первой и второй версиях AlphaFold нейросеть предсказывала дистограмму (фактически, карту пространственных контактов), и AF 1 получал по ней структуру минимизацией в пространстве торсионных углов; а AF 2 — через прямое предсказание координат и поворотных матриц «рамок» остатков и значений торсионных углов, то AF 3 делает нечто совершенно иное. Его структурный модуль основан на диффузионной генеративной нейросети, управляемой (или, как еще говорят, кондиционируемой, от condition = условие) внутренним представлением структуры белка, порождаемым Pairformer’ом (рис. 4).

Диффузионный структурный модуль AlphaFold 3. Ну а что? Я художник, я так вижу!

Рисунок 4. Диффузионный структурный модуль AlphaFold 3. Ну а что? Я художник, я так вижу! Этот модуль генерирует структуру белка из облака токенов со случайными координатами (слева в центре; напоминаю, что токеном может быть как атом, так и нуклеотид, и аминокислотный остаток). Принцип генерации такой же, как в нейросетях для генерации изображений. Только вместо изменения цветов пикселей здесь двигаются сами точки облака, а вместо текстового промпта используются попарные репрезентации из модуля Pairformer (которые, в свою очередь, получены из гигантского массива последовательностей белков). Коричневые «линии поля» метафорически показывают «кондиционирование» — управляющие воздействия на процесс обратной диффузии (денойзинга), определяемые эволюционной информацией из MSA (поток сверху) и найденными в PDB структурными шаблонами, инициализирующими структурное представление (снизу). Важный момент, что структурную «шпаргалку» можно отключить, и качество предсказаний все равно останется высоким — в отличие от методики моделирования на базе гомологии [8], где такое принципиально невозможно. Обученный на предсказании 3D-структур диффузионный трансформер порождает реалистично выглядящие молекулярные сцены (справа), вторым важным артефактом которых (после собственно 3D-координат атомов) являются метрики уверенности (во врезке), активно применяемые в пайплайнах структурной биоинформатики и белкового дизайна.

Как и в случае с трансформерами, здесь AlphaFold «позаимствовал» технологию, которая уже хорошо себя показала в популярной коммерчески востребованной сфере — генерации изображений. Все современные нейросети-«рисовалки», включая Stable Diffusion и Midjourney, «едут» именно на диффузионных нейронных сетях. Они здесь незаменимы в силу своей ключевой способности: генерации реалистичных паттернов из шума. Причем генерация может быть как случайной — чтобы модель просто блуждала, пока не соберет любую реалистичную картинку, — так и направленной, когда «дрейф» точек случайного шума направляется в заданную сторону. Любой, кто хоть раз вводил текстовый промпт в интерфейс нейросети для генерации изображений, делал именно это.

Принцип работы диффузионного структурного модуля почти такой же, просто вместо случайных цветов пикселей  — координаты атомов , а вместо текстового промпта — то самое внутреннее представление (матрица признаков) Pairformer, агрегирующее все понимание нейросети об устройстве «молекулярной сцены». Диффузионные модели — что графические, что атомистические — обучают на задаче «денойзинга», то есть удаления специально добавляемого шума из исходных данных. Архитектура такой сети — тоже трансформер, только диффузионный: в итоге он обучается из полностью хаотичных цветов пикселей или рандомных координат атомов делать реалистичные картинки или правдоподобные белки. Фактически, он генерирует объекты из того же распределения вероятностей, что и обучающие данные, однако в силу хаотичного старта и стохастической природы алгоритма результат будет каждый раз совершенно разным. Впрочем, нам же не нужна «просто» картинка или «просто» структура белка — мы хотим получить изображение, соответствующее описанию, или структуру, определяемую заданной последовательностью — и это как раз становится возможным с помощью промптинга или кондиционирования.

Генератор изображений работает не с положением пикселей — они заранее закреплены на регулярной сетке, — а с их значениями: цветом и яркостью. В AF 3 все наоборот: набор атомов и их типы известны заранее из входной молекулярной системы, а диффузионная модель восстанавливает именно их пространственные координаты, постепенно превращая случайное облако точек в осмысленную структуру.

Как мы уже обсуждали на рис. 2, для связывания лиганда структура белка не должна быть статичной, а «дышать», чтобы карман мог подстраиваться под форму захватываемой молекулы. Структурный модуль AlphaFold 2 не мог обеспечить такой гибкости — он почти детерминистичен: при подаче на вход одинаковой информации он выдаст одинаковые структуры. В AlphaFold 3 ситуация меняется не только из-за случайности диффузии, но прежде всего потому, что лиганд изначально становится частью единой молекулярной сцены: модель одновременно получает информацию о белке и связанной с ним молекуле и предсказывает уже совместную структуру комплекса. А стохастичность диффузии здесь добавляет вариативность между сэмплами — как в Midjourney не получится одна и та же картинка при двукратном выполнении одного и того же запроса. Впрочем, эта вариативность не равна настоящей конформационной динамике: она дает несколько правдоподобных статических решений, а не воспроизводит «дыхание» белка или полноценный ансамбль его состояний.

Но даже такая ограниченная конформационная вариативность полезна — не только в задаче предсказания структуры de novo (это как бы «максималистская» формулировка моделирования белок-лигандного комплекса), но для обычного гибкого докинга, когда структура белка в общих чертах уже есть — но нужно подогнать не только лиганд под белок, но и белок под лиганд. Именно поэтому почти одновременно с AlphaFold 3 появилась целая плеяда инструментов для гибкого докинга на основе диффузионных нейронных сетей — SurfDock [22], DiffBindFR [23], DiffDock [24]. Это гораздо более мощные и универсальные инструменты, чем те, которыми мы располагали в 2020 году, когда была выпущена моя статья [1]. Может, AlphaFold еще и не все свернул, но подходы, лежащие в его основе, уже успели изменить молекулярное моделирование, включая докинг.

Немаловажно и то, что старый структурный модуль AlphaFold 2 мог работать только с «рамками» аминокислот — их геометрическими представлениями, похожими на крупнозернистую молекулярную динамику. Диффузионный структурный модуль работает с каждым атомом напрямую (а точнее, переключается между уровнями токенов и атомов — это позволяет итеративно уточнять структуру). Прочие отличия структурных модулей двух версий программы для удобства читателей собраны в табл. 1, а также поясняются в видео 1.

Немаловажно и то, что старый структурный модуль AlphaFold 2 мог работать только с «рамками» аминокислот — их геометрическими представлениями, похожими на крупнозернистую молекулярную динамику. Диффузионный структурный модуль работает с каждым атомом напрямую (а точнее, переключается между уровнями токенов и атомов — это позволяет итеративно уточнять структуру). Прочие отличия структурных модулей двух версий программы для удобства читателей собраны в табл. 1, а также поясняются в видео 1.

Таблица 1. Сравнение как структурных модулей AF 2/3, так и общего функционала этих программ, определяемого возможностями структурных модулей.
Структурный модуль AF 2 Диффузионный модуль AF 3
Модель Предсказание (детерминирована) Генерация (стохастична, допускает сэмплирование) ✔️
Разрешение На уровне а/к остатков Полноатомная ✔️
Все тяжелые атомы, включая лиганды и модификации — благодаря «умной» токенизации
Оперирует «Рамки» остатков и углы χ
Фактически, весь структурный модуль AF 2 был «костылем»
Координаты напрямую ✔️
Без концепции «рамок»: трансформер предсказывает координаты токенов и атомов
Эквивариантность Насильственная SE(3)
Требовалась для сохранения поворотной симметрии (костыль)
Не требуется явно ✔️
Возникает при обучении денойзингу
Тип «внимания» IPA (invariant point attention)
«Секретный соус» структурного модуля AF 2 сам был большим костылем
Sequence-local + Global attention (токены)
Без IPA — стандартные трансформерные блоки, адаптированные для денойзинга
Функция потерь FAPE (Frame Aligned Point Error)
Усредняет ошибки атомных координат в локальных рамках
MSE в пространстве шума
предсказываем добавленный шум, не координаты напрямую
Покрытие Только белки (и мультимеры через AF 2-multimer) 🧬🧪🔬💊 Всё ✔️✔️
Белки + ДНК/РНК + лиганды + ионы + модификации а/к и нуклеотидов

Видео 1. Кому не хватает рассказанного в этой статье — милости просим смотреть видеолекцию о нейросетевом предсказании структуры белков. Прибежали в избу дети, срочно требуют отца: «Тятя, тятя, нейросети заменили продавца!». Наверное, такая же судьба ожидает и структурных биологов, за которых AlphaFold уже сделал всю работу, предсказав структуры более 200 миллионов белков. Или нет? Погодите, а откуда вообще так много, если человеческий геном содержит лишь немногим больше 20 тысяч белковых генов? В этой лекции разбираемся в предпосылках, благодаря которым так разгулялся искусственный интеллект, вторгшись в святая святых — научные исследования. А также рассмотрим архитектуру этой нейросети, отталкиваясь от которой она может делать выводы о строении даже самых малоизученных белковых молекул.

Предсказание структуры белков на базе искусственного интеллекта — 7-я лекция курса «Новости компьютерного моделирования биосистем», который редактор этой статьи читает в магистратуре МФТИ

В целом, здесь можно заметить, что эволюция AlphaFold примерно следует эволюции нейросетей в целом: первая версия AlphaFold использовала исторически самые старые сверточные нейросети, AlphaFold 2 появился на фоне бума языковых моделей и заимствовал у них трансформеры, а AlphaFold 3 возник вскоре после выхода на рынок мощных генераторов изображений — и заимствовал уже обкатанную технологию диффузии. Так что прогресс биоинформатики здесь лимитируется скорее не доступностью специфических биологических или биофизических решений, а доступностью новых архитектур генеративных нейросетей, уже опробованных на других, более «массовых», задачах.

Проблемы и ограничения AlphaFold 3

Введение диффузионных нейросетей в архитектуру AlphaFold превращает его в генеративную модель — в отличие от прежней версии. Но вместе с генеративностью приходят и характерные для нее проблемы — галлюцинации, то есть способность «выдумывать» несуществующие структуры. Каждый, кто пытался сгенерировать реферат или научную статью языковой моделью и обнаруживал там фейковые ссылки на статьи, поймет, о чем идет речь. Чтобы снизить влияние таких ошибок, разработчики AlphaFold 3 использовали дистилляцию: модель дополнительно обучали на предсказаниях более ранних, менее генеративных систем — AlphaFold 2 и AF 2-Multimer. Это не отдельный «контролер» внутри модели, а способ удержать диффузионный предсказатель ближе к консервативным решениям предшественников.

При этом неверно думать, что у AlphaFold 2 галлюцинаций не было вовсе. Они просто имели другой характер: AlphaFold 2 мог уверенно строить физически или биологически неправдоподобные структуры, особенно для необычных или трудных последовательностей. Недавняя статья биохимика Георгия Махатадзе в PNAS [25] дополнительно напоминает, что даже успешные предсказания AlphaFold 2 нельзя считать автоматически физически осмысленными — модель вовсе не «понимает» физику белка, а лишь воспроизводит статистические закономерности обучающих данных. Такова data science.

Галлюцинации особенно сказываются на предсказаниях модели в неупорядоченных регионах. Для белков неупорядоченные регионы — это норма [26], [27], но любой генеративный ИИ будет додумывать то, чего нет, на месте недостаточно структурированной или недостающей информации. Ровно таким же образом чат-боты галлюцинируют в составлении списков литературы к рефератам . Биоинформатики в таких случаях повторяют генерацию несколько раз и выявляют участки, где каждый раз предсказания различаются, представляя рыхлый «пучок» (если не «клубок») структур (рис. 5). Хорошо накладывающиеся фрагменты указывают на то, что их первичная структура однозначно определяет третичную (как Анфинсен завещал). А там, где предсказания резко различаются, такой связи нет — а значит, это неупорядоченный регион, внутренней информации в котором явно недостаточно, чтобы удержать белковую цепь в четких рамках.

Или, например, в моем переводе текстов на праиндоевропейский, где ИИ не только напридумывал невозможных неологизмов, но и постарался разложить их на якобы реконструируемые праиндоевропейские морфемы. И если в случае с текстами спасает внимательная постредактура, то с белками чуточку сложнее. Я знаю литературу по своей теме и знаю праиндоевропейский, но как я могу знать структуру неизвестного белка? — Г. К.

. Во всех ли случаях последовательность четко определяет структуру? Не во всех

Рисунок 5. Во всех ли случаях последовательность четко определяет структуру? Не во всех. Не менее 30% белковых доменов не имеют определенной структуры — мы писали об этом в публикациях «Недоупорядоченные белки» [26] и «Внутренне-неупорядоченные белки — „темная материя“ белкового мира» [27]. Причем это скорее не баг, а фича — именно отсутствие жестко фиксированной структуры дает возможность этой структуре формироваться (индуцируемым образом) при взаимодействии со множеством молекулярных партнеров: многие такие белки играют роль «молекулярных хабов», взаимодействуя с десятками разных мишеней. По всей видимости, «информационное содержание» неупорядоченных доменов недостаточно ни для образования структуры по принципу Анфинсена, ни для ее предсказания биоинформатическими подходами. Биоинформатики могут лишь идентифицировать эти домены в последовательности показанным на рисунке методом: по необычно высокой вариабельности предсказанных структур в разных запусках по сравнению с другими участками.

Дальше начинаются общие проблемы всех «белковых» нейросетей, а не только диффузионных — и причиной здесь являются более фундаментальные принципы современных методов машинного обучения.

Искусственный интеллект в упор не «видит» влияния мутаций на структуру белка [28] — в то время как это основной механизм развития наследственных заболеваний, эволюции и направленной модификации белков. Одна точечная мутация способна изменить всю структуру белка, если затрагивает аминокислотных остаток, находящийся в его ядре и стабилизирующий белок за счет какого-нибудь взаимодействия. Но, как я уже писал выше, программы линейки AlphaFold на физику вообще не опираются — а значит, одного взаимодействия просто не заметят в массе других, «перетягивающих» предсказание на себя. Эффект от мутаций в таких нейросетевых моделях сглаживается — как любой GPT-чатбот сгладит вашу опечатку, если она прокрадется в запрос.

Неспособность учитывать физику взаимодействий приводит к неправильной оценке влияния лиганда на конформацию белка — в том числе в G-белок-сопряженных рецепторах (GPCR). Это одно из ключевых семейств мембранных рецепторов животных, включающее в себя львиную долю всех фармакологических мишеней. Но смена их конформации и активация физиологического ответа при связывании лиганда обеспечивается всего несколькими «защелками» в глубине структуры (см. врезку ниже) [29]. Когда AlphaFold работает с таким белком, происходит то же самое, что с точечными мутациями: он не способен просчитать физику внутренних «защелок». Поэтому он часто помещает GPCR в активную конформацию, даже если лиганд — антагонист [30]. То есть корректное предсказание влияния лиганда на работу рецептора и биологического ответа становится невозможным. В дискуссии о лейкотриеновом рецепторе, упомянутой в начале статьи, это приобретает особую актуальность: точно ли AF «все свернул», если он допускает такие ошибки на данном семействе рецепторов? И это не единственный пример терапевтически важных белков, где ИИ не справляется в полной мере: комплексы «антиген—антитело» также представляют собой слабое место AlphaFold. Это один из немногих случаев, где традиционные модели физического докинга его обходят по точности [31].

Напрашивается идея, что предсказания AlphaFold 3 затем резонно подвергать моделированию молекулярной динамики (МД), которая могла бы исправить эти недочеты. Но тут есть затруднение — его предсказания годятся для МД не так же хорошо, как экспериментально полученные структуры [36]. Причина все в том же — нейросеть не опирается на физику, поэтому предсказанные модели могут быть далеки от энергетически оптимальных. А для МД важна правильная физика, и старт из неправильной точки может испортить всю картину. И это затруднение не единственное — правильно «готовить» молекулярную динамику куда труднее, чем многие могут себе представить. «По умолчанию» это просто траектория движений белка с течением времени, что-то вроде мультика в 3D, но она склонна показывать картину вблизи единственного локального минимума, а любые интересные с точки зрения биологии процессы — это переходы между разными минимумами, которые «обычная» МД моделирует гораздо хуже. Настройка протокола таким образом, чтобы из этой траектории выжать статичную модель связывания, пригодную для дальнейшего докинга и фармакофорного анализа, — серьезная исследовательская задача.

AlphaFold не опирается на физику — как и любая модель машинного обучения, он ищет закономерности в данных и обучается их статистически обобщать (в качестве подсказок извлекая эволюционную информацию). Поэтому даже AlphaFold 3 хуже справляется с предсказаниями структур белков, для которых известно мало гомологов — не только орфанных белков, но и, например, белков растений, недостаточно представленных в базах [28]. А ведь именно для таких белков больше всего нужны методы предсказания ab initio, без моделирования по гомологии.

Получается, AlphaFold пока не полностью оправдал ту основную надежду, которая на него возлагалась. Более того, не только нестандартная последовательность белка, но и нестандартные лиганды или даже нуклеиновые кислоты — резко отличные от белков по структуре — могут вызывать у программы большие затруднения [37]. Это было отмечено даже в CASP — самом главном конкурсе по предсказанию структур белков, где, в общем-то, AlphaFold 3 показал хорошие результаты [38].

Это не значит, что AlphaFold 3 неудачный. Дело в том, что ИИ (для определенности уточняем, что мы не говорим про AGI), какой бы он ни был мощный — это просто модель машинного обучения. Она обучена статистически выдавать определенные ответы на определенных данных, и поэтому в принципе не может быть панацеей. Сказать «AlphaFold уже все свернул» — это все равно что заявить «Midjourney уже все нарисовал».

Успехи AlphaFold 3

Все написанное выше, однако, касается отдельных сложных случаев, с которыми плохо справляется ИИ — своеобразных стресс-тестов, как праиндоевропейский язык для GPT. Если же взглянуть на общие оценки AlphaFold 3, то они не так уж и плохи: в большинстве тестов CASP он показал себя на уровне лучших доступных на данный момент методов (state-of-the-art) или чуть выше.

При этом следует отметить, что тестирование в CASP было не совсем полным: в нем участвовал только сервер AlphaFold 3, где доступно только ограниченное количество лигандов и невозможна гибкая настройка. Из-за таких технических ограничений получилось провести не все тесты. Предсказание в ручном режиме во время конкурса пыталась делать группа Арне Элофссона — однако они отправили результаты в последний момент, а лиганды были не в том формате, поэтому они не вошли в финальные результаты [38].

Обычно новые инструменты оцениваются по прорывным открытиям, которые были сделаны с их помощью (а в физике элементарных частиц и астрономии такие открытия даже «планируются» при создании инструмента). Но что-то прорывных открытий с участием AlphaFold 3 пока не отмечено. Но дело в том, что сделать прорывное открытие с помощью AlphaFold — это как написать хорошую научную статью нейросетью ChatGPT. Если положиться целиком на него — велика вероятность, что он ошибется или просто выдаст груду трюизмов, и такую статью будет обязан отклонить каждый приличный журнал. Если же автор вычитал статью сам и откорректировал ошибки — то он все равно воспользовался «традиционным» методом написания с помощью своего ума, перепроверив «вручную» все выводы. И в любом случае — формулировка «дебютной идеи» — пока что исключительно прерогатива человека. Тогда в итоге это заслуга автора, а не ChatGPT, роль которого была сугубо технической.

Аналогичным образом, предсказания AlphaFold все равно надо перепроверять экспериментальными методами — и в итоге одним ИИ открытие не сделаешь, и на его «баланс» не запишешь. Да и в целом AlphaFold — инструмент скорее не для фундаментальных, а для коммерческих исследований. Основным потребителем для него и подобных ему решений будет крупный фармацевтической бизнес, где срок одного успешного «открытия» до вывода препарата на рынок измеряется десятилетиями.

Более того, за весь этот срок может произойти много неудач, не связанных непосредственно с биоинформатикой. В статье о дизайне белков мы уже писали, что «придуманные» нейросетью терапевтические белки не дошли до клиники [12]. Не потому, что нейросеть сгенерировала их плохо: структурно они оказались более чем подходящими для связывания со своей мишенью, но в организме человека или животного проявили иммуногенность либо просто не дошли до ткани-мишени. Структурная нейросеть таких сложностей просчитать не может в принципе.

Так мы оказываемся в ситуации, когда программа произвела фурор и доступна уже два года — но быстрых прорывов ждать не приходится. Из обнадеживающих результатов можно упомянуть статью о предсказании структуры сплайсосомы, где AlphaFold 3 успешно дополнил пробелы в кристаллографических данных, а его предсказания хорошо согласуются с биохимическими (рис. 6) [39]. В своем блоге разработчики также заявляют о случаях, когда AlphaFold 3 корректно нашел новый аллостерический связывающий участок для нового лиганда (рис. 7) — при этом ни участок не был заранее известен, ни лиганда в обучающей выборке не было. Но этот материал не был опубликован в рецензируемом журнале, где мог бы подвергнуться независимой проверке — поэтому остается надеяться на хорошие коммерческие результаты.

По всей видимости, этот фурор стоит записать на счет не сделанных с помощью AlphaFold открытий, а простотой его использования не-биоинформатиками и необычайно широким принятием всем сообществом молекулярных биологов. Если десятилетие и более назад даже самое простое моделирование мог сделать только специально обученный человек [40], сейчас построить AF-модель интересующего белка может построить любой исследователь, который даже пипетки в руках не держал пары команд в консоли не сможет написать. Именно это стоит назвать настоящей революцией AlphaFold, а вовсе не глубокие научные прозрения, посетившие нас с его помощью.

Структура сплайсосомы в процессе сборки, предсказанная AlphaFold3

Рисунок 6А. Структура сплайсосомы в процессе сборки, предсказанная AlphaFold3: комплекс сплайсосомных белков с шапероном pICln, «помогающим» сплйсосоме правильно собраться. Эта предсказанная модель использовалась как дополнение к экспериментальным данным, чтобы выяснить механизм вытеснения pICln из комплекса, когда его функция выполнена.

Структура сплайсосомы в процессе сборки, предсказанная AlphaFold3

Рисунок 6Б. Наложение предсказанной структуры комплекса фосфатидилинозитол-5-фосфат-4-киназы типа 2 (PI5P4Kγ) с новым ингибитором и экспериментально определённой структуры этого же комплекса. PI5P4Kγ фосфорилирует хорошо известный вторичный мессенджер клетки фосфатидилинозитол-5-фосфат, тем самым играя активную роль в регуляции ее сигнальных путей. Эта киназа рассматривается как перспективная фармакологическая мишень для лечения онкологических заболеваний, так что кофолдинг ее с новыми игнибиторами — востребованная задача.

Форк-проекты: «потомки» AlphaFold 3

Выше я рассказывал о научных и технических проблемах AlphaFold 3, но у него есть и еще одна проблема, которую можно назвать политической или правовой. Это первая программа в линейке AlphaFold, которая представлена как закрытая модель. И хотя ее код доступен на Github, просто так скачать ее и сразу заняться предсказаниями не получится. Нейросеть без весов связей между нейронами представляет собой tabula rasa — ведь именно эти веса меняются в ходе обучения. А вот веса связей AlphaFold 3 открыто не доступны (только по запросу и не всем). Свободно доступен публичный сервер — однако, как я писал выше, у него нет гибких настроек, и с ним можно работать только в интерактивном режиме. Это стало помехой даже в CASP, а в свой конвейер его точно не включишь.

К счастью, на это проприетарное решение научное сообщество ответило [41] серией свободных аналогов. Одним из самых многообещающих «заменителей» стала линейка программ серии Boltz: Boltz-1 [42] и Boltz-2 [43]. Разработчики из MIT поставили себе амбициозную задачу: не просто создать примерно то же самое (но в свободном доступе), а попытаться справиться с одним из основных недостатков AlphaFold. С неспособностью учитывать физику, галлюцинациями и стерическими затруднениями (когда аминокислотные остатки в модели пространственно «схлестываются», образуя физически невозможную структуру).

Для этого в Boltz-1 добавили технику под названием Boltz-steering. Это не отдельный физический движок и не молекулярная динамика в привычном смысле — никакой симуляции сил и траекторий во времени тут нет. Вместо этого во время самой генерации структуры диффузионной моделью ее «смещают» заранее заданным физически мотивированным потенциалом, который штрафует за стерические столкновения и нарушения стереохимии. По сути, это легкая «поправка на физику», вшитая прямо в процесс диффузионного сэмплирования, а не полноценное силовое поле МД — но результат похож: готовые структуры получаются заметно более физически правдоподобными.

Начиная с Boltz-2, в проекте появилась еще одна «физическая» особенность: теперь программа может предсказывать энергию связывания белка с лигандом, что давно является энигмой хемоинформатики — правда, несмотря на заверения авторов насчет «FEP-точности», в реальных условиях результаты могут быть куда скромнее: независимые проверки на посторонних датасетах показали слабую корреляцию предсказанных значений с экспериментальными. В итоге проект Boltz по состоянию на сейчас — самый сильный и надежный конкурент AlphaFold. Более того, в независимом сравнении [44] на тройных комплексах PROTAC (комбинированных молекул для направленной деградации белков) и молекулярных клеев Boltz-2 даже обошел AlphaFold 3 по точности предсказанной структуры — хотя более ранние сравнения с первой версией Boltz складывались не в его пользу [45].

Остальные имеющиеся на настоящий момент аналоги представляют собой вариации примерно тех же идей, что мы обсудили выше — в основном подкупая перспективными партнерствами или открытостью инфраструктуры. Так, Protenix от компании ByteDance предлагает удобный сервер (с бóльшими возможностями, чем сервер AlphaFold 3) и бесплатно доступен даже для коммерческого использования. OpenFold работает в партнерстве с NVIDIA и с AISB Consorium, чтобы и создать оптимизированное под него «железо», и повысить мощность за счет данных фармкомпаний. Можно также отметить NeuralPLexer [46] и DragonFold. Последний не совсем является аналогом AlphaFold, скорее он «заточен» именно на задачи кофолдинга белок—лиганд. В этом плане он занимает промежуточное положение между ИИ-моделями для предсказания структуры и упоминавшимися выше решениями для «диффузиного докинга». В целом, все это многообразие аналогов и форков уже с трудом помещается в рамки одной статьи — всего два года спустя после релиза самого AlphaFold 3. А через несколько лет, видимо, хватит на целую книгу.

Вместо заключения

AlphaFold 3 не все свернул. Но порожденная им волна аналогов, а также совпавший «бум» диффузионного дизайна и диффузионного докинга («кофолдинга») демонстрирует технологическую революцию в предсказании белок-лигандных комплексов. Подходы на основе моделирования по гомологии и гибкого докинга не теряют своей актуальности, но state of the art сменился кардинально: попытки неумело моделировать физику уступили место диффузии. Например, несмотря на ошибки AlphaFold 3 при моделировании GPCR, диффузионные нейросети с сочетании с AF 2 используются для дизайна пептидных лигандов для них [47]. И сервисы вроде узконаправленного Galaxy 7TM, который я использовал в своей работе по лейкотриеновым рецепторам [1], скорее всего, окажутся не у дел.

Наряду с этим становится ясно, что AlphaFold 3 — потолок подходов на основе чистого ИИ. Новым вызовом для биоинформатики станет соединение ИИ (не моделирующего реальную физику) и физических моделей — что необходимо для более точных предсказаний. Начальные этапы такой работы уже демонстрируют разработчики AlphaFold 3 в рамках проекта IsoDDE. Это продвинутый ИИ-движок для дизайна лекарств от компании Isomorphic Labs (дочерней структуры Alphabet и DeepMind), представленный для преодоления ограничений модели AlphaFold 3. Он объединяет прогнозирование белковых структур, анализ связывания и молекулярное моделирование в единую вычислительную систему — но конкретно про него мало что можно сказать, потому что он-то уже полностью закрыт (и нацелен на фармразработки в стенах Isomorphic).

Именно в эту фармкомпанию нового типа перешел работать нобелевский лауреат Демис Хассабис, уйдя с поста главы DeepMind и, видимо, забрав с собой остатки надежд на то, что следующая итерация AlphaFold будет свободной. По-видимому, этот проект продолжит развиваться уже в коммерческой «песочнице», а нам будут время от времени рассказывать, как разработанные им лекарства входят и выходят из клинических исследований.

Куда приведет это развитие — «Биомолекула» в свое время вам расскажет!

Литература

  1. G. F. Kurakin, N. P. Lopina, G. E. Bordina. (2020). Comparative Computational Modeling of Agonist Binding to the Leukotriene Receptors BLT1 and BLT2. Mol Biol. 54, 299-309;
  2. C. B. Anfinsen, E. Haber, M. Sela, F. H. White. (1961). THE KINETICS OF FORMATION OF NATIVE RIBONUCLEASE DURING OXIDATION OF THE REDUCED POLYPEPTIDE CHAIN. Proc. Natl. Acad. Sci. U.S.A.. 47, 1309-1314;
  3. Одна последовательность — одна структура: был ли Анфинсен неправ?;
  4. 12 методов в картинках: секвенирование нуклеиновых кислот;
  5. 12 методов в картинках: структурная биология;
  6. Проблема фолдинга белка;
  7. Молекулярная динамика биомолекул. Часть III. От перфокарт до ИИ;
  8. Торжество компьютерных методов: предсказание строения белков;
  9. История развития искусственного интеллекта и его пришествия в биологию;
  10. AlphaFold: нейросеть для предсказания структуры белков от британских ученых;
  11. Белковые галлюцинации: как справляется AlphaFold?;
  12. От структуры к функции: революция ИИ в белковом дизайне;
  13. Josh Abramson, Jonas Adler, Jack Dunger, Richard Evans, Tim Green, et. al.. (2024). Accurate structure prediction of biomolecular interactions with AlphaFold 3. Nature. 630, 493-500;
  14. Как языковые модели покорили мир белков;
  15. Роль слабых взаимодействий в биополимерах;
  16. Faruck Morcos, Andrea Pagnani, Bryan Lunt, Arianna Bertolino, Debora S. Marks, et. al.. (2011). Direct-coupling analysis of residue coevolution captures native contacts across many protein families. Proc. Natl. Acad. Sci. U.S.A.. 108;
  17. Sergey Ovchinnikov, Hahnbeom Park, Neha Varghese, Po-Ssu Huang, Georgios A. Pavlopoulos, et. al.. (2017). Protein structure determination using metagenome sequence data. Science. 355, 294-298;
  18. Новые успехи в предсказании пространственной структуры белков;
  19. Несуществующие в природе белки́ — за что вручили Нобелевскую премию по химии (2024);
  20. Глаза прогресса: как глубокое обучение помогает видеть невидимое для человека;
  21. Gabriel V. Markov, Juliana Gutierrez-Mazariegos, Delphine Pitrat, Isabelle M. L. Billas, François Bonneton, et. al.. (2017). Origin of an ancient hormone/receptor couple revealed by resurrection of an ancestral estrogen. Sci. Adv.. 3;
  22. Duanhua Cao, Mingan Chen, Runze Zhang, Zhaokun Wang, Manlin Huang, et. al.. (2025). SurfDock is a surface-informed diffusion generative model for reliable and accurate protein–ligand complex prediction. Nat Methods. 22, 310-322;
  23. Jintao Zhu, Zhonghui Gu, Jianfeng Pei, Luhua Lai. (2024). DiffBindFR: an SE(3) equivariant network for flexible protein–ligand docking. Chem. Sci.. 15, 7926-7942;
  24. Corso G., Stärk H., Jing B., Barzilay R., Jaakkola T. (2022). DiffDock: Diffusion Steps, Twists, and Turns for Molecular Docking. Quantitative Biology.;
  25. George I. Makhatadze. (2026). The accuracy of electrostatic interactions captured by AI protein structure prediction models. Proc. Natl. Acad. Sci. U.S.A.. 123;
  26. Недоупорядоченные белки;
  27. Внутренне-неупорядоченные белки — «темная материя» белкового мира;
  28. Pei-Yu Lin, Shiang-Chin Huang, Kuan-Lin Chen, Yu-Chun Huang, Chia-Yu Liao, et. al.. (2025). Analysing protein complexes in plant science: insights and limitation with AlphaFold 3. Bot Stud. 66;
  29. B. Trzaskowski, D. Latek, S. Yuan, U. Ghoshdastider, A. Debinski, S. Filipek. (2012). Action of Molecular Switches in GPCRs - Theoretical and Experimental Studies. CMC. 19, 1090-1109;
  30. Haiyang Zheng, Hanfeng Lin, Adebowale A. Alade, Jingjing Chen, Erika Y. Monroy, et. al. AlphaFold3 in Drug Discovery: A Comprehensive Assessment of Capabilities, Limitations, and Applications — openRxiv;
  31. Jing Zhang, Rongqing Yuan, Andriy Kryshtafovych, Jimin Pei, Rachael C. Kretsch, et. al.. (2026). Assessment of Protein Complex Predictions in CASP16 : Are We Making Progress?. Proteins. 94, 106-130;
  32. Зрительный родопсин — рецептор, реагирующий на свет;
  33. Аллостерические регуляторы GPCR: ключи от всех замков;
  34. Аденозиновые рецепторы: история великого обмана;
  35. Нобелевская премия по химии (2012): за рецепторы наших первого, третьего и четвертого чувств;
  36. Xiao Liu, Kaiwen Pang, Hangfei Wu, Bin Chong, Zhixiang Yin, et. al.. (2025). AlphaFold3 prediction of protein-protein complex: Is it ready for thermodynamic analysis?. Comput Struct Biotechnol J. 27, 4373-4383;
  37. Clément Bernard, Guillaume Postic, Sahar Ghannay, Fariza Tahi. (2025). Has AlphaFold 3 achieved success for RNA?. Acta Crystallogr D Struct Biol. 81, 49-62;
  38. Arne Elofsson. (2026). AlphaFold3 at CASP16. Proteins. 94, 154-166;
  39. Matthias Grimmler, Marco Reinhart, Sebastian Alers, Christoph Peter. (2026). Spliceosomal Sm core assembly: AlphaFold 3 predicted structure and phosphorylation-dependent regulation of the human 6S complex. Comput Struct Biotechnol J. 31, 51-60;
  40. Я б в биоинформатики пошёл, пусть меня научат!;
  41. Ewen Callaway. (2024). Who will make AlphaFold3 open source? Scientists race to crack AI model. Nature. 630, 14-15;
  42. Jeremy Wohlwend, Gabriele Corso, Saro Passaro, Noah Getz, Mateo Reveiz, et. al. Boltz-1 Democratizing Biomolecular Interaction Modeling — Cold Spring Harbor Laboratory;
  43. Saro Passaro, Gabriele Corso, Jeremy Wohlwend, Mateo Reveiz, Stephan Thaler, et. al. Boltz-2: Towards Accurate and Efficient Binding Affinity Prediction — openRxiv;
  44. Lino Riepenhausen, Anne‐Christin Sarnow, Dina Robaa, Wolfgang Sippl. (2026). AI‐Based Prediction of PROTAC‐ and Molecular Glue‐Mediated Ternary Complexes: A Comparative Evaluation of AlphaFold 3 and Boltz‐2. Archiv der Pharmazie. 359;
  45. Nils Dunlop, Francisco Erazo, Farzaneh Jalalypour, Rocío Mercado. (2025). Predicting PROTAC-mediated ternary complexes with AlphaFold3 and Boltz-1. Digital Discovery. 4, 3782-3809;
  46. Zhuoran Qiao, Weili Nie, Arash Vahdat, Thomas F. Miller, Animashree Anandkumar. (2024). State-specific protein–ligand complex structure prediction with a multiscale deep generative model. Nat Mach Intell. 6, 195-208;
  47. Edin Muratspahić, David Feldman, David E. Kim, Xiangli Qu, Ana-Maria Bratovianu, et. al.. (2026). De novo design of miniproteins targeting GPCRs. Nature;
  48. Виртуальные тропы реальных лекарств;
  49. Непохожие «гомологичные» белки.

Комментарии

0
Ссылка скопирована в буфер обмена