Искусственному интеллекту для науки нужны не просто данные, а способность рассуждать

ии наука Alphafold агенты открытия воспроизводимость technologyreview.com

Эрик Шмидт и Сухас Махеш объясняют, почему ИИ-агенты, а не AlphaFold, станут главным инструментом научных открытий. Узнайте, как агенты уже нашли механизм устойчивости к антибиотикам за часы вместо десяти лет, автоматизируют проверку гипотез и решают кризис воспроизводимости.

Каждые несколько десятилетий кто-то объявляет, что наука достигла своего конца. В 1903 году уважаемый физик Альберт Майкельсон писал, что «факты физической науки уже все открыты». В 1980-х Стивен Хокинг предсказывал, что теоретическая физика может завершиться к концу века. С взрывным появлением искусственного интеллекта это ощущение снова витает в воздухе — на этот раз в сопровождении Нобелевской премии.

В 2024 году Демис Хассабис и Джон Джампер из Google DeepMind получили часть Нобелевской премии по химии за свою нейронную сеть AlphaFold, которая предсказывает трехмерные структуры белков, обучаясь на тысячах экспериментально измеренных форм. Эта дьявольски сложная задача полвека сопротивлялась систематическим атакам; AlphaFold, казалось, решил её раз и навсегда, и мир зациклился на обещании такого подхода. Хассабис и его команда назвали AlphaFold «шаблоном того, как ИИ может ускорить всю науку до цифровой скорости». Волна стартапов, создающих фундаментальные модели для биологии, химии и открытия материалов, привлекла миллиарды долларов, подпитываемая успехом DeepMind. AlphaFold показал, что сочетание ИИ и достаточного объёма данных может приводить к прорывным открытиям (даже если мы не понимаем лежащие в основе механизмы), и казалось, что перед нами снова проложен путь через всю остальную науку.

Безусловно, ИИ принесёт науке необычайные изменения, но становится всё более очевидным, что AlphaFold и подобные ему системы могут быть не лучшим шаблоном для этой метаморфозы. Хотя это глубокое достижение, условия, породившие AlphaFold, редки, а время, необходимое для создания таких условий в других областях, будет измеряться десятилетиями, а не годами. Вместо этого ускорение науки произойдёт благодаря другому подходу: ИИ-агентам.

Главным условием успеха AlphaFold было существование Protein Data Bank — набора данных из примерно 170 000 экспериментально подтверждённых структур белков, на котором команда DeepMind могла обучать свою модель. Создание Protein Data Bank было непростым: потребовалось 53 года международного научного сотрудничества и, по недавней оценке, около 21 миллиарда долларов экспериментальной работы. Усилия такого масштаба, как известно, трудно финансировать, почти невозможно координировать и чрезвычайно затратны по времени; в результате они часто оказывались безуспешными.

Но даже в областях с необходимым единством и ресурсами, где соответствующие данные не становятся недоступными из-за коммерческой собственности, существует ещё одно препятствие, о котором слишком мало говорят: научная невозможность генерации сопоставимых данных. В случае белковых структур ключевой экспериментальный метод — белковая кристаллография — является необычайно воспроизводимым и надёжным инструментом, настолько, что на него опирались более 25 Нобелевских премий. Но в большинстве экспериментальных наук результаты чаще всего различаются. Клеточные линии дрейфуют. Химикаты содержат следовые загрязнители. Влажность в лаборатории меняется. Создание измерительных наборов данных, которые будут достаточно согласованными, точными, прецизионными и масштабируемыми для обучения современной нейронной сети в биологии или большей части химии, потребует новых видов измерений и новых стандартизированных подходов — ничего из этого не будет готово в ближайшее время.

Конечно, есть несколько областей, где эти требования выполняются: прогнозирование погоды, большая часть геномики, очень ограниченные области химии. В них вскоре могут произойти прорывы в стиле AlphaFold, если они уже не произошли. Государственная поддержка производства и координации этих наборов данных будет критически важной, как утверждала Национальная комиссия США по новым биотехнологиям. Но для большинства открытых вопросов в науке нам понадобится другой план, по крайней мере в краткосрочной перспективе. К счастью, нечто более тихое и скромное начало подавать надежды.

Учёные всегда рассуждали в условиях неопределённости. Биологи, работающие над выявлением новых мишеней для лекарств, никогда не имели идеальных наборов данных. Вместо этого они комбинируют расчёты докинга и известные структуры, учитывают молекулярную динамику, проводят несколько анализов связывания и используют своё суждение, чтобы взвесить каждый метод в соответствии с его конкретными сильными сторонами и точками отказа. Мастерство науки не в каком-то одном инструменте; это синтез того, что производят многие инструменты, и пересмотр результатов по мере поступления доказательств. Именно так на самом деле протекает большая часть исследовательской работы. Но до самого последнего времени ни одно программное обеспечение не могло этого делать.

Теперь агенты могут. Проще говоря, агент — это механизм рассуждения ИИ, которому предоставлен доступ к инструментам — цифровым или физическим — и возможности их использовать. За последние несколько лет фундаментальный архитектурный сдвиг в ИИ позволил быстро распространиться этим программам, которые работают на больших языковых моделях, что резко снизило потребность в научно-специализированных наборах данных. Для науки это технологическое достижение представляет собой основополагающее изменение: оно позволило нам создавать цифровые инструменты, способные имитировать итеративный, крайне зависимый от обстоятельств процесс реального исследования. В то время как такие инструменты, как AlphaFold, применяют мощный подход к ограниченному вопросу, агенты по своей сути являются универсалами. Они не представляют собой новый способ заниматься наукой — вместо этого они цифровым образом моделируют человеческий процесс открытия.

Рассмотрим AI Co-Scientist от Google, анонсированный в мае. Исследователи дали ему одностраничное описание и цель: выяснить, как устойчивость к антибиотикам распространяется между видами бактерий — ключевой фактор лекарственно-устойчивых инфекций. Система запустила под-агентов. Один выдвигал гипотезы из литературы. Другой разбирал их на части, как рецензент. Третий проводил турниры для ранжирования сильнейших кандидатов. Четвёртый дорабатывал победившую гипотезу. Агент заключил, что гены устойчивости путешествуют на бактериальных вирусах, заимствуя тот вирус, который может перенести их в нового хозяина. Гипотеза оказалась верной. Исследователи из Имперского колледжа Лондона потратили десять лет, чтобы прийти к тому же выводу путём кропотливой работы в мокрой лаборатории; их статья, ранее не виденная Co-Scientist, всё ещё находилась на рецензировании.

Такие агенты, как Co-Scientist, всё ещё являются новыми инструментами, и предстоит преодолеть реальные проблемы, прежде чем они станут повсеместной частью научного процесса: они всё ещё склонны к галлюцинациям, их суждения непоследовательны, и у них есть ограничения по памяти и вводу, которые ограничивают время их автономной работы. Но эти технические барьеры исчезнут, и по мере их исчезновения мы начнём замечать совокупные эффекты научных агентов на надёжность, согласованность и скорость, с которой делается наука.

Пожалуй, самое примечательное — агенты предлагают структурное решение «кризиса воспроизводимости» науки — широко распространённой проблемы неспособности исследователей воспроизводить результаты друг друга. На протяжении десятилетий научное сообщество умоляло исследователей делиться своими сырыми данными и точным кодом в попытке стандартизировать экспериментальные процессы. Но исследователи долго сопротивлялись этой утомительной административной работе, которая происходит после того, как интересная наука уже сделана. Агенты, напротив, автоматически регистрируют каждое своё действие, создавая точную запись метода, который привёл к их результатам, и позволяя точно воспроизводить результаты.

Вторым следствием станет усиление научной памяти. Передача знаний между исследователями — это, как известно, мутный процесс; если она не происходит в течение многих лет обучения и наблюдения, аспирантам приходится корпеть над грязными лабораторными журналами, оставленными десятилетиями предшественников, в поисках деталей, которые решат успех или провал их протокола. Однако по мере того, как агенты будут составлять всё большую часть научного процесса, вся научная история лаборатории будет записываться в центральном стандартизированном репозитории институциональных знаний.

Но самым важным воздействием агентов станет скорость. В любой области, когда проверка идеи занимает меньше времени, чем споры о ней на совещании, люди перестают дискутировать и просто проводят тест. Агент, способный прочитать тысячу статей за час, спроектировать 500 молекул и к утру учиться на своих неудачных тестах, снизит стоимость экспериментов и фундаментально изменит темп, с которым делается наука. Он также даст исследователям свободу преследовать смелые, странные вопросы, на которые они раньше никогда не рискнули бы тратить время, открывая научные двери, которые мы ещё не можем вообразить.

Хотя шаблон AlphaFold, безусловно, будет ключом к невероятным открытиям, он сам по себе не приведёт нас к концу науки. Вместо этого сдвиг в сторону агентного ИИ представляет собой гораздо более редкий уровень прорыва: инструмент, который охватывает все области науки одновременно. Исторически такие инструменты появлялись всего несколько раз: исчисление, статистический вывод, спектроскопия, компьютер. Каждый из них открывал мир проблем, которые никто не думал формулировать, и эти проблемы, в свою очередь, заново определяли свои области. С агентами нас ждёт ещё одно такое преобразование.

Эрик Шмидт был генеральным директором Google с 2001 по 2011 год. В 2024 году вместе со своей женой Венди он стал сооснователем Schmidt Sciences — филантропического предприятия, финансирующего нетрадиционные области исследований в науке и технологиях.

Сухас Махеш руководит работой ИИ для науки в AI Center компании Schmidt Sciences. Он специалист по ИИ для открытия материалов.

Дополнительные исследования: Майя Левин, ассоциированный сотрудник и руководитель научного направления, офис Эрика Шмидта.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: