Во вторник Google анонсировала AlphaGenome Atlas — ресурс, который пытается предсказать последствия каждого возможного однонуклеотидного варианта в геноме человека. Геном человека состоит примерно из 3 миллиардов оснований, поэтому проверка других трех азотистых оснований, которые не присутствуют в нашем эталонном геноме, означает прогон 9 миллиардов оснований через программное обеспечение AlphaGenome.
AlphaGenome предназначен для идентификации потенциальных функций некодирующей ДНК, которая не кодирует белки, но составляет подавляющее большинство генома человека. Часть этой некодирующей ДНК необходима для контроля активности кодирующей белки части — она указывает клетке, где и когда производить матричные РНК, как обрабатывать их в зрелые белково-кодирующие формы и так далее. Однако большая ее часть выглядит не более чем остатками вирусов и других молекулярных паразитов.
Возможность идентифицировать функциональные участки очень полезна, как и проведение всего анализа с помощью единого пакета программ. Но пока биологи не начнут активно его использовать (предполагая, что они это сделают), будет неясно, что AlphaGenome предлагает сверх того, что мы могли бы получить из его обучающих данных.
Некодирующие последовательности
Хотя мы склонны фокусироваться на белках, доля генома человека, кодирующая белки, составляет менее 3 процентов. Большая часть генома некодирующая и содержит различные элементы, включая центромеры, которые помогают обеспечить равномерное распределение хромосом между клетками, и теломеры, защищающие концы хромосом. Также существует регуляторная ДНК, контролирующая активность генов, наряду с сигналами, помогающими определить, что должно и что не должно быть включено в зрелые матричные РНК, производимые генами. Другие последовательности помогают контролировать упаковку ДНК внутри клетки.
,
Но большая часть некодирующей ДНК — это «мусор»: остатки древних вирусных инфекций, ДНК-паразиты, гены, инактивированные мутациями, и так далее. Определение того, что полезно, а что нет, является постоянной проблемой для биологов по многим причинам.
Во-первых, белки, взаимодействующие с ДНК, не очень избирательны в отношении последовательностей, к которым они присоединяются, потенциально связываясь случайным образом по всему геному и допуская определенную степень мутаций. Многие из этих белков также специфичны для типа клеток; в клетках печени, нервных клетках, иммунных клетках и так далее существует разная популяция ДНК-связывающих белков. Во многих случаях наличие множества различных сайтов связывания белков в компактном пространстве важнее, чем наличие какого-либо одного из них.
Мы разработали различные программные инструменты, которые идентифицируют отдельные участки интереса в некодирующей ДНК. Но это именно та проблема, которую хорошо решает ИИ: проблема, связанная с неточными вероятностями, сильно зависящими от контекста. Поэтому Google разработал систему ИИ AlphaGenome, которая оценивает последовательности на предмет их потенциальной функции.
(Для биологов-энтузиастов, которые не хотят разбираться в статье: AlphaGenome пытается идентифицировать «экспрессию генов, инициацию транскрипции, доступность хроматина, модификации гистонов, связывание транскрипционных факторов, карты контактов хроматина, использование сайтов сплайсинга, а также силу и координаты сайтов сплайсинга».)
В настоящее время система ограничена последовательностями мышей и человека. Она также была обучена только на ограниченном количестве типов клеток, которые биологи тщательно изучили. Тем не менее, она может быть полезна. Если исследователь, изучающий ген, обнаруживает изменения в его некодирующих областях, бывает трудно определить, насколько они значимы. AlphaGenome может дать подсказку об их значимости вместе с гипотезой о причине. И его прогнозы, как правило, так же хороши или лучше, чем у специализированных программных инструментов.
Делаем все
Теперь Google использовал эту систему для оценки всех возможных однонуклеотидных изменений в геноме человека. Другими словами, если первое основание на хромосоме 1 — это А, система оценивает, что произойдет при его замене на G, C или T. Затем она переходит к следующему основанию и повторяет процесс.
Будем откровенны: вероятно, никто на Земле не имеет эталонной последовательности генома, которую Google использует в качестве базовой. Каждый из нас, вероятно, отличается от нее на миллионы оснований в своем геноме, и большинство из нас, вероятно, несет некоторые комбинации вставок, делеций, дупликаций и перевернутых последовательностей. Многие из них не имеют значения, поскольку они попадают в последовательности, не имеющие функционального значения. В то же время многие некодирующие последовательности идентичны у всех людей просто потому, что с момента появления общего предка не прошло достаточно времени для накопления изменений.
Таким образом, лишь небольшая доля изменений, оцененных Google, вероятно, появится в реальном геноме человека и будет иметь функциональное значение.
Зачем Google этим занимается? Есть пара причин, почему это может быть полезно. Во-первых, это фактически предварительный расчет потенциальных мутаций, которые могут заинтересовать исследователей. Поэтому, если кто-то обнаружит мутацию в результате секвенирования генома, он сможет немедленно оценить ее потенциальные последствия. Вторая причина заключается в том, что это дает исследователям возможность искать по всему геному изменения, имеющие определенный тип воздействия.
Однако большая часть этой информации могла быть получена просто путем изучения набора данных ENCODE, который был среди данных, на которых обучалась модель. Больший потенциал заключается в развитии системы до такой степени, чтобы она могла выполнять анализ, которому мы можем доверять, для данных, на которых она не обучалась, таких как геномы неандертальцев и денисовцев или типы клеток, для которых у нас нет данных ENCODE. На данный момент неясно, достигли ли мы этого.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – John Timmer




