ИИ-модели проваливают эти тесты на интеллект. А вы справитесь лучше?

Ai головоломки пространственное мышление логика тестирование Llm technologyreview.com

Проверьте, насколько ваш ум превосходит ИИ: решите головоломки, которые ставят в тупик современные модели. Узнайте, где ИИ силён, а где слаб — от пространственного мышления до логики и интуиции. Пройдите тест и докажите, что вы умнее машины.

Головоломки и игры лежат в основе развития ИИ с самого начала. Подобно тому, как мы, люди, любим проверять свой ум с помощью кроссвордов или логических задач, разработчики могут проверить, насколько продвинулись модели, с помощью игрового испытания. Термин «машинное обучение» популяризировал в 1959 году в своей статье специалист IBM по информатике Артур Сэмюэл, описав алгоритм, который научился играть в шашки. Шахматы и китайская настольная игра Го также являются известными полигонами для тестирования ИИ.

Если судить исключительно по способности решать головоломки, ИИ значительно прогрессирует — и быстро. В конце 2024 года группа учёных из Колумбийского университета показала, что даже лучшие модели могли разгадать лишь 18% печально известных головоломок Connections из The New York Times; к началу 2025 года некоторые модели стали решать их почти идеально каждый раз.

Но головоломки не только подчёркивают неумолимое развитие возможностей ИИ. Наблюдение за тем, где модели преуспевают, а где терпят неудачу — и где мы, люди, всё ещё их превосходим — может дать полезное представление о сильных и слабых сторонах технологии. Несмотря на прогресс, современные модели всё ещё допускают ошибки: незначительные изменения в классических загадках часто сбивают их с толку, а визуальные головоломки являются особенно слабым местом.

Здесь у вас будет возможность проверить свою смекалку на головоломках, которые в разное время ставили модели в тупик. Некоторые могут оказаться для вас такими же сложными, как и для ИИ; другие настолько просты, что заставят вас усомниться, действительно ли ИИ разумен. Каждая из них демонстрирует как минимум одно различие между машинным и человеческим познанием. Если вы успешно пройдёте тест, то докажете, что можете переиграть ИИ в головоломках — по крайней мере, пока.


Пространственное мышление

Начнём с области, в которой у людей огромное преимущество: пространственное мышление. Если вы когда-нибудь проходили тест IQ, возможно, вы сталкивались с задачами на мысленное вращение. В таких головоломках нужно определить, являются ли разные изображения одними и теми же объектами под разными углами. Хотя современные языковые модели обычно способны анализировать визуальные данные, они всё ещё проваливаются в этих задачах. При всех разговорах о том, как модели мира помогают ИИ понимать физическую среду, LLM, похоже, всё ещё не могут манипулировать 3D-объектами так, как это делают люди с пространственным мышлением — архитекторы и инженеры-механики.

Мысленное вращение

Инструкции: Выберите ответ, который показывает объект из задания, но под другим углом. В каждом случае есть только один правильный ответ!


Память и адаптивность

Передовые LLM обладают необычайной памятью: во время обучения они были подвергнуты огромному объёму фактов и могут точно воспроизводить многие из них. Это преимущество в соревновании с людьми в викторинах, но это может быть и недостатком. Когда головоломка очень похожа на ту, что модель видела во время обучения, она может пропустить ключевые различия и ответить заученным.

Это подтвердилось в исследовании 2024 года, в котором исследователи из Google и Университета Иллинойса в Урбане-Шампейне обучали и тестировали модели на небольших вариациях классического типа головоломок «Рыцари и лжецы». В этих задачах одни персонажи всегда говорят правду, а другие всегда лгут, и нужно выяснить, кто есть кто. Тот же принцип может действовать в тесте под названием SimpleBench. Эти вопросы напоминают более сложные задачи, с которыми модели, вероятно, сталкивались во время обучения. Люди замечают подвох, но даже лучшие модели спотыкаются.

Рыцари и лжецы

Инструкции: Единственное, что нужно знать для решения этих головоломок: рыцари всегда говорят правду, а лжецы всегда лгут. Определите, кто есть кто, на основе того, что говорит каждый персонаж.

SimpleBench

Инструкции: Внимательно прочитайте эти задачи SimpleBench, и вы сможете найти ответы в мгновение ока.


Абстрактное и визуальное мышление

ИИ не только плохо справляется с визуальными задачами в 3D — два измерения тоже могут его запутать. Это важный фактор того, насколько хорошо модели работают с самым известным бенчмарком на основе головоломок — ARC-AGI. Эти задачи требуют вывести абстрактные, общие правила из набора примеров. Модели лучше справляются с головоломками ARC, когда каждая сетка представлена не как изображение, а как строка чисел, кодирующая цвет каждой ячейки.

Исследования показывают, что даже когда модели правильно отвечают на вопросы ARC-AGI, они часто делают это с помощью запутанных и необобщаемых правил, тогда как люди опираются на простые визуальные концепции. Несмотря на эти недостатки, за последний год модели стали довольно хорошо решать ARC-AGI, но некоторые головоломки — например, приведённая здесь — всё ещё ставят их в тупик.

ARC-AGI

Инструкции: Изучите три пары сеток, показанные ниже, чтобы понять правило, по которому левые преобразуются в правые. Затем возьмите маркеры или цветные карандаши и заполните четвёртую сетку, используя это правило. (Решение одинаково независимо от ориентации сеток.)


Интуиция

Не только модели ИИ попадают в ловушки. У нас, людей, есть свои когнитивные слабости, многие из которых ИИ лишён. Психологи разработали наборы задач, которые переворачивают феномен SimpleBench: на эти вопросы люди часто дают интуитивные ответы, тогда как модели отвечают обдуманно. Некоторые задачи эксплуатируют ошибки в том, как мы интуитивно делаем математические вычисления; другие сформулированы так, чтобы подсказывать очевидные ответы, которые рушатся при внимательном прочтении.

Блиц-раунд

Инструкции: Ответьте на вопросы ниже как можно быстрее.


Растущая сложность

В некоторых случаях способность LLM решить головоломку зависит от масштаба. Одно исследование учёных из Apple показало, что LLM отлично справляются с простыми версиями задачи «Ханойская башня», которая заключается в перемещении стопки дисков по одному, не помещая больший диск на меньший, и с задачами о переправе через реку, где группа людей должна пересечь реку по определённым правилам. Но только до определённого предела: когда количество дисков или людей достигает шести и более, модели начинают давать сбои.

В другом исследовании учёные из Вашингтонского университета, Стэнфордского университета и Института искусственного интеллекта Аллена заметили, что LLM аналогичным образом испытывают трудности с логическими сетками, которые требуют вывести атрибуты набора людей из списка подсказок. Статья Apple стала вирусной, но комментаторы задались вопросом, выявляют ли результаты уникальное ограничение рассуждений LLM — или просто то, что ошибки нормальны по мере нарастания сложности.

Переправа через реку

Инструкции: Используя предложенный сценарий, спланируйте рейсы, необходимые для переправы всех через реку.

Логическая сетка

Инструкции: Используя список подсказок, определите, кто живёт в каждом доме и какой стиль музыки предпочитает каждый человек. Существует только одно возможное решение. Возможно, вам будет полезно заполнить сетку ниже, чтобы отслеживать свои выводы.


Грейс Хакинс — журналистка по ИИ в MIT Technology Review. Имеет докторскую степень по нейронауке.


Авторство:

Мысленное вращение: CC BY 4.0. Stogiannidis, Ilias, Steven McDonagh, Sotirios A. Tsaftaris. Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models (copyright 2025); иллюстрации Джона МакНила. Рыцари и лжецы: Предоставлено Дэном Макинноном. SimpleBench: CC BY 4.0. SimpleBench Team. The Text Benchmark in which Unspecialized Human Performance Exceeds that of Current Frontier Models (copyright 2024). ARC-AGI: Предоставлено ARC Prize Foundation. Блиц-раунд: CC BY 4.0. Hagendorff, Thilo, Sarah Fabi, Michal Kosinski. Human-like intuitive behavior and reasoning biases emerged in large language models but disappeared in ChatGPT. Nat Comput Sci 3, 833–838 (copyright 2023). Переправа через реку: Адаптировано из Propositiones ad Acuendos Juvenes, Алкуин Йоркский (ок. 800 г. н. э.). Логическая сетка: Apache License 2.0. Lin, Bill Y., Ronan Le Bras, Kyle Richardson, et al. ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning (copyright 2025)

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: