Не дайте себя обмануть — большие языковые модели не обладают мышлением

ии Alphago машинное обучение рассуждение нейросети Deepmind technologyreview.com

Узнайте, как AlphaGo совершил прорыв в ИИ, используя рассуждения, а не только интуицию. Откройте для себя новый подход к созданию надежных ИИ-систем для науки и медицины.

Однажды днем в Сеуле в марте 2016 года я наблюдал, как программа, которую я помог создать, поставила камень на пятой линии доски для игры в го, что выглядело как подарок ее человеческому противнику. Ход 37 во второй партии из пяти выглядел настолько абсурдным, что некоторые комментаторы посчитали его ошибкой в программе.

Это не было ошибкой. AlphaGo выиграл партию, в итоге одержав победу со счетом 4:1 над Ли Седолем, одним из величайших профессиональных игроков в го всех времен. «Я думал, что AlphaGo основан на вероятностных расчетах и что это просто машина», — сказал Ли после игры. «Но когда я увидел этот ход, я изменил свое мнение. Несомненно, AlphaGo — это творчество». 

Когда Deep Blue победил тогдашнего чемпиона мира по шахматам Гарри Каспарова в 1997 году, он сделал это, просчитывая на шесть-восемь ходов вперед для каждого игрока и оценивая 200 миллионов шахматных позиций в секунду, используя правила, жестко закодированные людьми. Го — гораздо более сложная игра. Ценность камня зависит от того, как развернутся удаленные группы и территория за десятки ходов. Вычисление даже доли возможных исходов заняло бы у суперкомпьютера миллиарды лет. Чтобы победить, AlphaGo должен был с первого взгляда определить, кто лидирует, и даже изобретать ходы, которые ни один человек не додумался бы сделать.

Именно поэтому во многих описаниях матча AlphaGo против Ли ход 37 изображается как вспышка чистого машинного наития. Но это заблуждение. На самом деле именно способности AlphaGo к рассуждению сделали этот творческий выбор — и эти способности сегодня отсутствуют у ИИ. Если мы хотим, чтобы будущие системы ИИ давали надежные результаты и действительно новые идеи в таких областях, как наука и медицина, мы должны наделить их подлинными способностями к рассуждению.

AlphaGo состоит из двух систем. Первая, его сетевая политика, была обучена угадывать, какой ход сделает сильный игрок. Эта «интуитивная» часть считала ход 37 ничем особенным — ход, вероятность которого среди экспертов составляла примерно один к 10 000. Что заставило AlphaGo выбрать его, так это поисковый механизм программы, который заглядывал дальше непосредственной правдоподобности и взвешивал будущие последствия предлагаемых ходов. Он явно построил и исследовал дерево игры с тысячами ветвей, каждая из которых представляла собой различное возможное будущее. 

Известная теория в поведенческих науках, популяризированная Даниэлем Канеманом, различает два режима человеческого мышления: Система 1 — быстрая, интуитивная, легкая; Система 2 — медленная, пошаговая и обдуманная. AlphaGo предложил поразительный машинный аналог этого разделения. Его сети поставляли наития — этот ход выглядит перспективным, эта позиция кажется выигрышной — а его поиск обеспечивал обдумывание, проверяя эти наития на основе последующих ходов и контрходов. Как и в человеческом познании, ни одна половина не работает в одиночку. Одна лишь интуиция никогда бы не выбрала ход 37, а грубый поиск с трудом просеял бы все многочисленные возможные ходы.

Это разительно отличается от того, как работают современные модели ИИ. Большая языковая модель выбирает следующий токен снова и снова. Это равносильно действию Системы 1 — быстрой, ассоциативной и удивительно хорошей в завершении паттернов практически по всем темам, о которых пишут люди.

Вскоре после дебюта ChatGPT стало ясно, что одной лишь языковой беглости недостаточно для истинной полезности. Очевидным решением стало создание моделей, которые обдумывают: вместо того чтобы отвечать немедленно, они теперь могут генерировать промежуточные шаги, которые разлагают проблему, переносят частичные результаты и влияют на последующие рассуждения — процесс, известный как цепочка мыслей (chain of thought).

Прирост оказался реальным, прежде всего в математике и программировании. Но, в отличие от поиска AlphaGo, это не вводит подлинно отдельный механизм рассуждения: промежуточные рассуждения по-прежнему генерируются тем же процессом предсказания следующего токена, итерируемым дольше, прежде чем модель примет окончательный ответ.

Три недостатка мешают тому, что делают чат-боты, претендовать на звание рассуждения (в том смысле, в каком это мог бы признать ученый). Во-первых, эти модели обычно не поддерживают явного, постоянного и проверяемого эпистемического состояния. Нет открытого реестра, который бы излагал гипотезы, рассматриваемые моделью, степень ее уверенности в различных объяснениях, взвешиваемые ею доказательства и нерешенные вопросы, которые она держит в уме — все то, что должно систематически пересматриваться по мере поступления новой информации.

Во-вторых, им не хватает четкого разделения между тем, что система знает, и тем, как она манипулирует этими знаниями. Знания и рассуждения неразрывно связаны в весах нейронной сети — нет независимого, явно представленного набора убеждений. В-третьих, хотя цепочки мыслей, которые генерируют чат-боты, выглядят как обдумывание, исследования показали, что боты часто придумываютих постфактум, достигая ответа одним путем, но сообщая о другом.

Это проблема, потому что в критически важных приложениях, которые нас всех волнуют, таких как медицина, инженерия и научные исследования, важно не только то, к какому выводу приходит система, но и то, как она к нему приходит. Когда случаются ошибки — например, при диагностике и лечении заболеваний — мы должны иметь возможность точно определить, что пошло не так: было ли виной рассуждение системы, использовала ли она недействительные доказательства или сделала неверные предположения? 

Именно поэтому я недавно покинул свою должность в Google DeepMind. Я считаю, что нам нужен новый подход к машинному рассуждению — подход, основанный на архитектуре AlphaGo. AlphaGo ведет учет того, что он знает о данной позиции: дерево игры. Эта структура данных содержит все вариации, возможные будущие, которые AlphaGo рассмотрел, причем каждый ход и позиция аннотированы суждениями, сделанными его нейронными сетями. По мере прогрессирования рассуждений AlphaGo обновляет дерево игры и в конечном итоге синтезирует информацию из него, чтобы решить, какой ход сделать. 

Аналогично, для общего рассуждения система должна поддерживать эпистемическое состояние, которое представляет собой то, что система считает установленным, в чем она сомневается, что она исключила, какие вопросы остаются открытыми. Рассуждение тогда можно понимать как последовательность ходов, которые изменяют эпистемическое состояние для продвижения знаний и снижения неопределенности: вывод следствий, разбиение проблем на части и — что особенно важно — решение, какой вопрос задать, какое вычисление выполнить или какой эксперимент провести дальше.

Конечно, рассуждение в открытом мире сложнее, чем игра в такие настольные игры, как го или шахматы. В реальном мире текущее состояние дел известно лишь частично, набор доступных действий велик и изменчив, а последствия действий стохастичны или неизвестны. 

Но недавние достижения в области LLM и других нейронных моделей теперь дают нам возможность решать такие общие проблемы рассуждения. Например, LLM могут предлагать способы решения проблемы на основе известных фактов и доступных ресурсов. Они могут взаимодействовать с инструментами через API или код и помогать оценивать, подтверждается ли утверждение имеющимися доказательствами. 

Самое главное, чтобы система оставалась честной, независимая часть системы должна оценивать каждый ход по тому, насколько он действительно разрешает неопределенность, обновляя убеждения только тогда, когда изменение подкреплено доказательствами. Как только эти правила будут соблюдены, модель сможет накапливать сертифицированные знания и улучшать свою политику рассуждения, обучаясь на прошлом опыте рассуждений. Вы можете думать о такой системе как о научной методе на стероидах, с целью производства знаний, которые выдержат проверку.

Я не думаю, что мы достигнем надежного машинного интеллекта, делая Систему 1 больше. Масштаб обостряет интуицию, но не делает интуицию более обдуманной. Ход 37 имел значение, потому что машина заняла позицию, взвесила возможные будущие и выбрала ход, который ее искусственные инстинкты, вероятно, отвергли бы. 

Обществу нужны такие творческие ходы в разработке лекарств, материаловедении, климатологии, диагностике — областях, где доска совсем не похожа на доску для го, и никто не дает нам правил. Мы получим такие идеи только от систем, которые рассуждают — систем, чьи выводы возникают из проверяемой последовательности доказательств, выводов и пересмотра убеждений, а не из убедительной истории, рассказанной постфактум. 

Торэ Грепель — заведующий кафедрой машинного обучения в Университетском колледже Лондона. Он был ключевым членом команды AlphaGo в DeepMind и работает над тем, чтобы ИИ приносил пользу человечеству.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: