Головоломки и игры лежат в основе развития ИИ с самого начала. Подобно тому, как мы, люди, любим проверять свой ум с помощью кроссвордов или логических задач, разработчики могут проверить, насколько продвинулись модели, с помощью игрового испытания. Термин «машинное обучение» популяризировал в 1959 году в своей статье специалист IBM по информатике Артур Сэмюэл, описав алгоритм, который научился играть в шашки. Шахматы и китайская настольная игра Го также являются известными полигонами для тестирования ИИ.
Если судить исключительно по способности решать головоломки, ИИ значительно прогрессирует — и быстро. В конце 2024 года группа учёных из Колумбийского университета показала, что даже лучшие модели могли разгадать лишь 18% печально известных головоломок Connections из The New York Times; к началу 2025 года некоторые модели стали решать их почти идеально каждый раз.
Но головоломки не только подчёркивают неумолимое развитие возможностей ИИ. Наблюдение за тем, где модели преуспевают, а где терпят неудачу — и где мы, люди, всё ещё их превосходим — может дать полезное представление о сильных и слабых сторонах технологии. Несмотря на прогресс, современные модели всё ещё допускают ошибки: незначительные изменения в классических загадках часто сбивают их с толку, а визуальные головоломки являются особенно слабым местом.
Здесь у вас будет возможность проверить свою смекалку на головоломках, которые в разное время ставили модели в тупик. Некоторые могут оказаться для вас такими же сложными, как и для ИИ; другие настолько просты, что заставят вас усомниться, действительно ли ИИ разумен. Каждая из них демонстрирует как минимум одно различие между машинным и человеческим познанием. Если вы успешно пройдёте тест, то докажете, что можете переиграть ИИ в головоломках — по крайней мере, пока.
Пространственное мышление
Начнём с области, в которой у людей огромное преимущество: пространственное мышление. Если вы когда-нибудь проходили тест IQ, возможно, вы сталкивались с задачами на мысленное вращение. В таких головоломках нужно определить, являются ли разные изображения одними и теми же объектами под разными углами. Хотя современные языковые модели обычно способны анализировать визуальные данные, они всё ещё проваливаются в этих задачах. При всех разговорах о том, как модели мира помогают ИИ понимать физическую среду, LLM, похоже, всё ещё не могут манипулировать 3D-объектами так, как это делают люди с пространственным мышлением — архитекторы и инженеры-механики.
Мысленное вращение
Инструкции: Выберите ответ, который показывает объект из задания, но под другим углом. В каждом случае есть только один правильный ответ!
Память и адаптивность
Передовые LLM обладают необычайной памятью: во время обучения они были подвергнуты огромному объёму фактов и могут точно воспроизводить многие из них. Это преимущество в соревновании с людьми в викторинах, но это может быть и недостатком. Когда головоломка очень похожа на ту, что модель видела во время обучения, она может пропустить ключевые различия и ответить заученным.
Это подтвердилось в исследовании 2024 года, в котором исследователи из Google и Университета Иллинойса в Урбане-Шампейне обучали и тестировали модели на небольших вариациях классического типа головоломок «Рыцари и лжецы». В этих задачах одни персонажи всегда говорят правду, а другие всегда лгут, и нужно выяснить, кто есть кто. Тот же принцип может действовать в тесте под названием SimpleBench. Эти вопросы напоминают более сложные задачи, с которыми модели, вероятно, сталкивались во время обучения. Люди замечают подвох, но даже лучшие модели спотыкаются.
Рыцари и лжецы
Инструкции: Единственное, что нужно знать для решения этих головоломок: рыцари всегда говорят правду, а лжецы всегда лгут. Определите, кто есть кто, на основе того, что говорит каждый персонаж.
SimpleBench
Инструкции: Внимательно прочитайте эти задачи SimpleBench, и вы сможете найти ответы в мгновение ока.
Абстрактное и визуальное мышление
ИИ не только плохо справляется с визуальными задачами в 3D — два измерения тоже могут его запутать. Это важный фактор того, насколько хорошо модели работают с самым известным бенчмарком на основе головоломок — ARC-AGI. Эти задачи требуют вывести абстрактные, общие правила из набора примеров. Модели лучше справляются с головоломками ARC, когда каждая сетка представлена не как изображение, а как строка чисел, кодирующая цвет каждой ячейки.
Исследования показывают, что даже когда модели правильно отвечают на вопросы ARC-AGI, они часто делают это с помощью запутанных и необобщаемых правил, тогда как люди опираются на простые визуальные концепции. Несмотря на эти недостатки, за последний год модели стали довольно хорошо решать ARC-AGI, но некоторые головоломки — например, приведённая здесь — всё ещё ставят их в тупик.
ARC-AGI
Инструкции: Изучите три пары сеток, показанные ниже, чтобы понять правило, по которому левые преобразуются в правые. Затем возьмите маркеры или цветные карандаши и заполните четвёртую сетку, используя это правило. (Решение одинаково независимо от ориентации сеток.)
Интуиция
Не только модели ИИ попадают в ловушки. У нас, людей, есть свои когнитивные слабости, многие из которых ИИ лишён. Психологи разработали наборы задач, которые переворачивают феномен SimpleBench: на эти вопросы люди часто дают интуитивные ответы, тогда как модели отвечают обдуманно. Некоторые задачи эксплуатируют ошибки в том, как мы интуитивно делаем математические вычисления; другие сформулированы так, чтобы подсказывать очевидные ответы, которые рушатся при внимательном прочтении.
Блиц-раунд
Инструкции: Ответьте на вопросы ниже как можно быстрее.
Растущая сложность
В некоторых случаях способность LLM решить головоломку зависит от масштаба. Одно исследование учёных из Apple показало, что LLM отлично справляются с простыми версиями задачи «Ханойская башня», которая заключается в перемещении стопки дисков по одному, не помещая больший диск на меньший, и с задачами о переправе через реку, где группа людей должна пересечь реку по определённым правилам. Но только до определённого предела: когда количество дисков или людей достигает шести и более, модели начинают давать сбои.
В другом исследовании учёные из Вашингтонского университета, Стэнфордского университета и Института искусственного интеллекта Аллена заметили, что LLM аналогичным образом испытывают трудности с логическими сетками, которые требуют вывести атрибуты набора людей из списка подсказок. Статья Apple стала вирусной, но комментаторы задались вопросом, выявляют ли результаты уникальное ограничение рассуждений LLM — или просто то, что ошибки нормальны по мере нарастания сложности.
Переправа через реку
Инструкции: Используя предложенный сценарий, спланируйте рейсы, необходимые для переправы всех через реку.
Логическая сетка
Инструкции: Используя список подсказок, определите, кто живёт в каждом доме и какой стиль музыки предпочитает каждый человек. Существует только одно возможное решение. Возможно, вам будет полезно заполнить сетку ниже, чтобы отслеживать свои выводы.
Грейс Хакинс — журналистка по ИИ в MIT Technology Review. Имеет докторскую степень по нейронауке.
Авторство:
Мысленное вращение: CC BY 4.0. Stogiannidis, Ilias, Steven McDonagh, Sotirios A. Tsaftaris. Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models (copyright 2025); иллюстрации Джона МакНила. Рыцари и лжецы: Предоставлено Дэном Макинноном. SimpleBench: CC BY 4.0. SimpleBench Team. The Text Benchmark in which Unspecialized Human Performance Exceeds that of Current Frontier Models (copyright 2024). ARC-AGI: Предоставлено ARC Prize Foundation. Блиц-раунд: CC BY 4.0. Hagendorff, Thilo, Sarah Fabi, Michal Kosinski. Human-like intuitive behavior and reasoning biases emerged in large language models but disappeared in ChatGPT. Nat Comput Sci 3, 833–838 (copyright 2023). Переправа через реку: Адаптировано из Propositiones ad Acuendos Juvenes, Алкуин Йоркский (ок. 800 г. н. э.). Логическая сетка: Apache License 2.0. Lin, Bill Y., Ronan Le Bras, Kyle Richardson, et al. ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning (copyright 2025)
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – J. Juniper Friedman




