Большая часть работы ИИ в биологии была сосредоточена на проектировании белков. Отчасти потому, что белки выполняют большую часть работы жизни, катализируя интересные химические реакции и структурируя клетки. Таким образом, умение создавать новый белок может означать прямое вмешательство в биохимию, предоставляя новые и потенциально полезные функции.
Поскольку генетический код обеспечивает уровень абстракции между ДНК и белками, было неочевидно, что может делать модель, обученная на ДНК. Тем не менее, исследователи создали большую геномную модель, и оказалось, что она способна выдавать последовательности ДНК, которые могут кодировать функциональные белки в бактериях и имитировать структуры генов, встречающиеся в сложных клетках. Теперь эти же модели были использованы для выдачи геномов вирусов, поражающих бактерии.
Это не научная фантастика — все созданные моделями вирусы тесно связаны с существующим вирусом. Но у них есть некоторые отличительные черты, которые было бы трудно развить в ходе эволюции. И исследователи, выполнившие эту работу, базирующиеся в Стэнфордском университете, предполагают, что нам, возможно, стоит уже сейчас задуматься о подготовке к потенциальной возможности того, что кто-то сможет разработать родственный ИИ, способный создать вирус, нацеленный на позвоночных.
Большие геномные модели
Большие языковые модели по сути обучаются на способности предсказывать следующий фрагмент текста в как можно более обширном собрании созданных человеком текстов, до которого могут добраться их разработчики. Большие геномные модели — это тот же подход, но применённый к ДНК. В некоторой степени это упрощает задачу, учитывая, что ДНК использует всего четыре «буквы»: A, T, C и G. Но это усложняется тем, что в геномах обычно есть участки, где следующая буква имеет огромное значение, перемежающиеся с последовательностями, где следующее основание может быть любым и это не будет иметь значения.
Поэтому большим геномным моделям необходимо распознавать биологический контекст последовательности, которую они выводят, во многих ситуациях, которые мы, люди, ещё не поняли. Тем не менее, если мы скормим им достаточно последовательностей геномов, они, похоже, способны на это. Бактериальные гены со схожими функциями обычно группируются вместе. Если задать большой геномной модели последовательность части такого кластера, она выдаст последовательности ДНК, кодирующие белки со схожими функциями — включая потенциально рабочие белки, которые не похожи ни на что из того, что мы идентифицировали ранее.
Но наше собственное незнание накладывает ограничения на то, что мы можем делать с этими моделями. Если мы зададим им фрагмент последовательности из сложной клетки, они ответят строкой оснований, содержащей то, что выглядит как гены и регуляторная ДНК. Но поскольку большинство генов могут располагаться практически в любом месте эукариотического генома, мы понятия не имеем, какие функции (если они вообще есть) могут выполнять эти сгенерированные гены, поэтому мы не можем их по-настоящему проверить.
Тем не менее, в качестве меры предосторожности при обучении этих моделей, названных Evo 1 и Evo 2, исследователи не предоставляли им никаких последовательностей от вирусов, поражающих сложные клетки. Даже если мы не можем понять, что они выдают, есть вероятность, что они выдадут что-то опасное.
Но существует целый мир вирусов, атакующих бактерии и не способных заражать людей. И исследователи, создавшие Evo, решили, что они допустимы для экспериментов. Поэтому вместо того, чтобы проверять, могут ли Evo 1 и Evo 2 выдавать похожие на нормальные гены, они решили проверить, могут ли они выдать целый геном.
Порядок из хаоса
В качестве тестового примера они выбрали вирус с броским названием ΦX174, часть большого семейства вирусов, заражающих E. coli. Помимо удобства использования самых изученных бактерий на планете для тестов, ΦX174 обладает рядом примечательных особенностей. Он довольно прост: 11 генов, распределённых примерно по 5400 оснований, все 11 генов имеют известные функции, и цикл заражения вируса хорошо описан.
У него также есть полезная особенность с точки зрения работы с большой геномной моделью: конец вируса всегда содержит одну и ту же короткую последовательность оснований. Поэтому, если использовать эти основания в качестве запроса, большая геномная модель должна распознать, что ей нужно ответить, выдав последовательность, так или иначе связанную с ΦX174.
Чтобы дополнительно подготовить модели, Evo 1 и Evo 2 были скормлены более 2 миллионов дополнительных оснований последовательностей ДНК от вирусов, заражающих бактерии (называемых бактериофагами), а затем подвергнуты тонкой настройке на последовательностях, специфичных для Microviridae — группы, к которой принадлежит ΦX174. После этого они экспериментировали с различными запросами. Если задать слишком много начальной последовательности ΦX174, модель просто выдавала остаток генома обратно. Слишком мало — и она генерировала множество несвязанных последовательностей. В итоге исследователи обнаружили, что лучше всего работают запросы из четырёх-девяти оснований начальной последовательности.
Хотя выходные данные были настроены на возврат чего-то похожего на ΦX174, они могли быть буквально чем угодно — от почти точных копий обычного вируса до последовательностей, лишь отдалённо напоминающих вирус. Для решения этой проблемы исследовательская группа установила множество предварительных условий на выходные данные, предназначенных для отбрасывания наиболее экстремальных вариантов, при этом допуская некоторую модификацию.
Например, ΦX174 использует свою собственную версию шиповидного белка для прикрепления к бактериям и заражения; если ген, кодирующий этот белок, отсутствует или повреждён, вирус просто не будет работать. Поэтому они отбрасывали любые выходные данные, в которых шиповидный белок имел менее 60% идентичности с реальным. Они также отбрасывали вирусы, которые были слишком длинными или слишком короткими (< 4000 оснований или > 6000), те, которые содержали цепочки одинаковых оснований длиннее 10, а также те, которые имели необычную частоту двух пар оснований (GC и AT).
Отбрасывание таких вариантов на этапе компьютерного анализа оставило им разумное количество потенциальных выходных данных для тестирования: 302 предложенные вирусные последовательности. Они смогли химически синтезировать последовательности 285 из них и вставили их в бактерии, чтобы посмотреть, что произойдёт. В большинстве случаев ответ был «ничего». Но 16 из этих последовательностей смогли подавить рост E. coli, что позволяет предположить, что они действительно функционировали как вирусы. Девять из них были исходными последовательностями, выданными ИИ, а остальные семь приобрели дополнительные мутации после вставки в бактерии.
Те же, да не те
В некотором смысле эти сконструированные вирусы были довольно похожи на исходный ΦX174, но в других отношениях они были совершенно иными.
С точки зрения «сходства» наиболее эффективные вирусы в группе из 285, как правило, были очень похожи на оригинал. Общая доля жизнеспособных вирусов составила всего 16 из 285 протестированных выходных данных (5,6%). Но если рассматривать только те выходные данные, которые были наиболее похожи на исходный ΦX174 (сходство последовательности от 98% и выше), жизнеспособность возрастала до 46%. Таким образом, если вы не очень похожи на обычный ΦX174, велика вероятность, что вы вообще не будете работать как вирус.
Большинство жизнеспособных вирусов имели тот же набор генов, что и исходный. Ни у одного из них не было ни одного изменения на участке ДНК, где начинается репликация генома вируса.
Всё это согласуется с предыдущими исследованиями, которые показали, что даже одно изменение основания, которое изменяет всего одну аминокислоту в одном из белков, создаваемых из генома вируса, в среднем имеет 20% шанс полностью инактивировать вирус. ΦX174 не просто боится изменений; обычно они его убивают. Соответственно, изменения, предложенные ИИ, дали популяцию жизнеспособных вирусов, которые в среднем выглядели как оригинал.
Но как отдельные особи, вирусы были довольно разными. Один из них полностью потерял один из вирусных белков, компенсируя его потерю изменениями в других местах генома. Другой добавил совершенно новый ген. У многих были гены, которые были либо длиннее, либо короче исходных. Один даже заменил один из генов ΦX174 на ген от очень отдалённо родственного вируса.
Исследователи провели интересный анализ, основанный на идее, что любое изменение одной аминокислоты имеет 20% шанс инактивировать вирус. Проведя расчёты, они утверждают, что любые вирусы с менее чем 25 изменениями имеют только 2,3% шанс быть жизнеспособными. Из примерно 300 вирусов, выданных ИИ, пять вирусов попали в этот диапазон, и три из них были жизнеспособными. При более чем 25 индивидуальных изменениях аминокислот шансы получить жизнеспособный вирус практически равны нулю. Однако почти четверть предложенных ИИ вирусов, имевших более 25 изменений, оказались жизнеспособными, включая два, которые имели более 50 изменений аминокислот.
Это говорит нам о том, что ИИ гораздо чаще вносит изменения, которые оставляют вирус жизнеспособным, чем случайные мутации.
Преимущества и риски
Это исследование интересно с интеллектуальной точки зрения, но исследователи также показывают, что оно может быть полезным. Бактериофаги испытываются в качестве терапии против бактериальных инфекций, устойчивых к стандартным антибиотикам. Но многие штаммы бактерий уже выработали устойчивость к некоторым семействам вирусов, включая ΦX174. Одно из потенциальных решений — использовать коктейль из бактериофагов, поскольку выработать устойчивость ко всем ним может быть нелегко или даже невозможно.
И здесь ИИ произвёл коктейль из потенциальных вирусов. Поэтому команда протестировала коктейль из природных бактериофагов, которые обычно охотятся на E. coli, и сравнила его с коктейлем из 16 жизнеспособных продуктов ИИ. В их тестах природный коктейль бактериофагов не сработал, но группа, созданная ИИ, смогла быстро выработать способность заражать в противном случае устойчивых хозяев. Исследователи подозревают, что процесс преодоления устойчивости включал обмен сегментами ДНК между некоторыми вирусами, созданными ИИ, и появление дополнительных мутаций.
Неясно, является ли это серьёзным потенциальным преимуществом; фаговая терапия рассматривается уже много лет, но не получила широкого распространения, несмотря на растущие проблемы с устойчивыми к лекарствам штаммами бактерий. И авторы совершенно ясно дают понять, что большие геномные модели несут риски. Хотя они исключили вирусы, поражающие позвоночных, из своих обучающих данных, любой, у кого есть достаточные вычислительные ресурсы, может повторить процесс, включив эти вирусы.
Статья заканчивается призывом к лучшему регулированию этой и смежных областей, таких как заказ пользовательских последовательностей ДНК. Однако на данный момент регулирование ИИ в значительной степени не поспевает за быстрыми темпами развития этой области.
Science, 2026. DOI: 10.1126/science.aec2657 (О DOI).
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – John Timmer




