Google придумал, как ставить водяные знаки на белки, разработанные ИИ

ии белки маркировка биобезопасность Deepmind arstechnica.com

Защитите биобезопасность: внедрите маркировку белков, разработанных ИИ. Система работает с популярным инструментом проектирования белков.

Инструменты на базе ИИ, похоже, представляют угрозу безопасности почти ежедневно, отчасти потому, что мы медленно осознаем потенциальные угрозы. Однако одна область, где мы, похоже, опережаем события, — это биобезопасность.

Как и в случае с большинством биологических явлений, польза идет рука об руку с угрозами. Мы разработали все более совершенные инструменты для проектирования белков и добились значительных успехов, например, ферменты, разработанные ИИ, которые могут расщеплять пластик или блокировать белки яда. Но эти же инструменты могут быть использованы для создания токсинов или изменения поведения вирусных белков.

И программное обеспечение, которое мы используем для идентификации последовательностей ДНК, кодирующих потенциально опасные белки, не выявляет белки, разработанные ИИ, поскольку никто не охарактеризовал их достаточно хорошо, чтобы понять, что они представляют угрозу. Почти через год после того, как этот риск был выявлен, по-прежнему не было ясно, что с этим можно сделать.

В среду команда DeepMind в Google опубликовала исследовательскую работу, предлагающую потенциальное решение: маркировка белков. Система создает водяной знак непосредственно на самих белковых последовательностях, не нарушая функцию белка. Это позволяет идентифицировать новые белки, разработанные доверенными исследователями, открывая все остальное для более тщательного изучения.

Работает ли это вообще?

Работа была основана на технологии Google SynthID, которая может добавлять незаметный водяной знак к цифровым материалам, сгенерированным ИИ. Водяной знак влияет на вероятность определенных выборов, которые делает ИИ, и этот перекос систематически распределяется по всему продукту, будь то текст или изображения. Поскольку вы не можете идентифицировать водяной знак, не зная, как он был закодирован, его невозможно удалить. И поскольку он распределен по всему изображению, он может выдерживать базовое экспортирование, изменение размера и так далее.

,

Довольно легко понять, как это может работать с тонкими различиями, например, в цветах фотографии. Гораздо сложнее понять, как это можно сделать с белком.

Белки состоят всего из 20 аминокислот, любая из которых может быть важна для структурной целостности или каталитической активности. Хотя некоторые из этих аминокислот химически схожи (например, лейцин и изолейцин), другие имеют противоположные заряды. Многие белки имеют значительные области, где допустимы ограниченные изменения в последовательности аминокислот, и другие области, где даже малейшее отклонение от существующей последовательности инактивирует белок.

Белки также малы. В то время как изображения часто содержат миллионы пикселей, белки, содержащие 500 аминокислот, считаются довольно большими. Это гораздо меньше сырья, в котором можно скрыть какой-либо сигнал.

Поэтому не было ясно, будет ли технология SynthID работать; она может быть неспособна скрыть достаточный сигнал в типичном белке, или, если она втиснет достаточно информации для создания функционального водяного знака, полученные белки могут оказаться неактивными. Единственный способ узнать — это попробовать.

Применение маркировки к белкам

Чтобы лучше понять, как работает система, полезно знать немного о химии белков. Аминокислоты имеют постоянную часть, в основном состоящую из двух атомов углерода, связанных с азотом. Белок образуется путем соединения ряда этих постоянных частей для формирования длинной цепи, называемой остовом. Каждая аминокислота также имеет так называемую боковую цепь, свисающую с нее. Они могут варьироваться по сложности от одного атома водорода до больших кольцевых структур; боковые цепи могут быть простыми углеводородами, кислотами, основаниями и т. д.

,

Боковые цепи определяют, как остов сворачивается в трехмерном пространстве. В растворимом белке все чисто углеводородные боковые цепи оказываются упакованными в центре, в то время как кислоты, основания и боковые цепи, содержащие гидроксилы, обращены к воде. После того как белок сворачивается в свою окончательную форму, остов описывает общую форму белка.

Команда Google начала с одного из самых популярных инструментов для проектирования белков с помощью ИИ — ProteinMPNN. (Это программное обеспечение было разработано лабораторией Бейкера, а Дэвид Бейкер был удостоен той же Нобелевской премии, что и глава DeepMind.)

ProteinMPNN работает в два этапа. Сначала отдельный инструмент описывает конфигурацию остова, подходящую для дизайна. Затем ProteinMPNN проходит по остову, размещая боковые цепи по одной аминокислоте за раз. Каждая аминокислота выбирается на основе ее способности вписаться в форму, определенную остовом, взаимодействовать с соседними аминокислотами и соответствовать любым другим ограничениям, определенным экспериментом. (Эти ограничения могут включать такие вещи, как формирование каталитических карманов или взаимодействие с другим белком.)

На этом этапе вмешивается вариант SynthID от Google под названием SynthIDBio. Он использует ключ (аналогичный криптографическому ключу) и идентификацию ранее выбранных аминокислот для предложения новой. Затем ProteinMPNN определяет, работает ли аминокислота, предложенная SynthID, с точки зрения формирования функционального белка. Если нет, он отклоняет ее. Если да, он переходит к следующему шагу. Другими словами, по мере того как система проходит по остову аминокислота за аминокислотой, она включает аминокислоты с водяным знаком только тогда, когда они соответствуют функциональному белку.

,

Можно думать об этом так: когда система сталкивается с местом, где набор химически связанных аминокислот будет работать (например, лейцин/изолейцин/валин или серин/треонин), она будет использовать ту, которая соответствует водяному знаку, когда это возможно. Другой взгляд на процесс, предложенный одним из участников разработки системы, заключается в том, что она ищет в пространстве функциональных белков подмножество, которое случайно имеет достаточное количество аминокислот с водяным знаком.

В результате водяной знак случайным образом распределяется по всей длине белка, и его обнаружение — это не простой вопрос «да» или «нет». Вам нужно просканировать всю последовательность, зная ключ, и измерить, как часто аминокислоты, предложенные SynthIDBio, фактически появляются в окончательной последовательности. Google также разработала необходимое для этого программное обеспечение.

Он жив!

Вопрос в том, функциональны ли белки с водяными знаками. Команда использовала систему для проектирования белков, которые физически взаимодействуют с ключевыми природными белками, ранее являвшимися целью для дизайнов ИИ. И версии с водяными знаками работали отлично, связываясь с предполагаемыми мишенями. Это не такой строгий тест, как поиск катализатора, но он предполагает, что нет причин ожидать серьезных проблем при более сложных задачах проектирования.

Таким образом, пока белок достаточно длинный, система может обнаружить водяной знак. Как это может быть полезно? Опять же, все сводится к биобезопасности. Когда кто-то заказывает последовательности ДНК, люди, которые производят ДНК, обычно проверяют последовательность на ее способность кодировать части вирусов, токсичные белки и другие подобные угрозы. Однако в настоящее время, когда они видят белок, который не похож ни на что нам уже известное — что потенциально верно для любых белков, разработанных ИИ — они не могут оценить его угрозу.

,

Google рассматривает свою систему как способ повысить уверенность синтезаторов ДНК в отношении этих белков. Если им будет предоставлен набор ключей от доверенных организаций, таких как университеты или крупные биотехнологические компании, они смогут быстро определить, является ли неизвестный белок дизайном ИИ из доверенного источника. Это позволит им сосредоточить свое внимание и ресурсы на оценке того, что не является доверенным — в частности, тех вещей, которые выглядят как дизайны ИИ, но не исходят из доверенного источника.

Другими словами, это не гарантирует безопасность заказов ДНК, но упрощает процесс проверки угроз.

Команда, стоящая за этой работой, выделила несколько потенциальных недостатков. Во-первых, вся система безопасна только настолько, насколько безопасна система, используемая для распространения и поддержания ключей для маркировки. Очень короткие белки потенциально могут содержать слишком мало аминокислот с водяным знаком для идентификации. И можно дополнить маркированную последовательность чем-то, что ее не содержит — подумайте о слиянии белка, разработанного ИИ, с естественным флуоресцентным белком — что может разбавить водяной знак.

Существует также ряд пакетов программного обеспечения для проектирования белков на основе ИИ, которые не полагаются на ProteinMPNN. Некоторые, но не все, используют аналогичный подход «по одной аминокислоте за раз», который должен хорошо интегрироваться с SynthIDBio. Поэтому, пока Google не найдет способ обрабатывать другие формы интеграции, не все смогут маркировать белки, которые они проектируют.

И поскольку идентификация водяного знака осуществляется на статистической основе, то, как вы устанавливаете порог, имеет большое значение с точки зрения ложных срабатываний и ложных пропусков.

Неясно, будет ли это особенно полезно на практике, по крайней мере, в первоначальном виде. Но довольно интересно, что это вообще работает. И приятно знать, что по крайней мере некоторые люди в индустрии ИИ думают о том, как ограничить риски.

Nature, 2026. DOI: 10.1038/s41586-026-10965-y (О DOIs).

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: