Я скормил кучке LLM сложнейший «cryptic crossword», какой только смог найти.

ии кроссворды Llm тест криптические Da gizmodo.com

Проверьте, смогут ли ChatGPT, Claude и Oreate решить сложнейшие криптические кроссворды от австралийского мастера DA. Узнайте, какие подсказки поставили ИИ в тупик, а с какими он справился, и кто в итоге оказался ближе к человеческому интеллекту.

Сегодня утром я проснулся с новостью о том, что Firefox добавит ежедневный кроссворд на базе ИИ на свою всё более захламлённую контент-насыщенную страницу новой вкладки. Это всё хорошо, но также натолкнуло меня на размышления. Я люблю хороший криптический кроссворд, и… что ж, если есть одна форма кроссворда, с которой ИИ точно будет трудно, так это самый извращённый и причудливо человеческий из всех — криптический кроссворд.

Готов поспорить, что ни одна из потребительских LLM не сможет справиться с настоящим криптическим кроссвордом. Верно? Что ж, похоже, я не единственный, кто об этом думает — и, как выясняется, возможно, я ошибаюсь.

Всего неделю назад сотрудник компании OreateAI написал в блоге о том, что «для “криптических” головоломок, распространённых в Великобритании, и более хитрых американских тем большие языковые модели (LLM), такие как Claude 3.5 Sonnet и GPT-4o, недавно продемонстрировали удивительную способность обращать вспять игру слов, которая ставила в тупик предыдущие поколения программного обеспечения».

Посмотрим. Я не сомневаюсь, что ChatGPT и другие могут разгадать простую анаграмму, но как насчёт подсказок, основанных на самых запутанных, злонамеренных и сбивающих с толку формах игры слов? Неужели для этого не требуется особая творческая извращённость, присущая только человеку?

Проверка LLM на прочность

Чтобы проверить эту гипотезу, я мог обратиться только к одному месту: самому сложному криптическому кроссворду Австралии. Почему именно Австралии, спросите вы? Что ж, несмотря на лучшие усилия энтузиастов, криптический кроссворд в США всё ещё остаётся нишевым искусством. В Великобритании он более распространён, но, честно говоря, я ужасно решаю криптический кроссворд Guardian именно потому, что он опирается на устоявшийся свод знаний, который можно усвоить, только живя в стране, а я не жил в Великобритании уже 25 лет.

Австралия же… это место, где я родился и вырос, где жил до 19 лет и куда время от времени возвращался на протяжении многих лет — но, что более важно, это также место, где я стал сооснователем давно существующего блога, посвящённого именно тому кроссворду, который я сейчас собираюсь скормить нескольким LLM. В Австралии составители кроссвордов используют инициалы, и пятничный криптический кроссворд в Sydney Morning Herald и его сестринской газете в Мельбурне The Age составляет «DA», человек, чьи головоломки настолько сложны, что люди шутят, что аббревиатура на самом деле расшифровывается как «не пытайтесь».

Так что да. Головоломки DA сложны. Это делает их идеальными для этого небольшого теста!

Подсказки, которые я хочу, чтобы эти LLM решили

Итак, как LLM справятся с последним испытанием DA? Чтобы проверить это, я выбрал несколько подсказок из головоломки и скормил их трём LLM: ChatGPT, Claude Sonnet 5 и — это было бы справедливо — Oreate. Подсказки усложняются по мере продвижения, от «относительно лёгких» до «чувак, да ладно». Вот они:

  • Wolfed peanut brittle, finally gluten-free! (3,2)
  • A dyer backing reduced labour now and then (2,9)
  • Pinkie, capisce? (5)
  • Struggle for anyone (not!) getting time to focus essentially?! (9,7)
  • January 15, 2000? (9)

Если хотите попробовать решить их сами, вперёд. Ответы, а также мои совершенно произвольные оценки по 10-балльной шкале для каждой подсказки для каждой LLM, приведены ниже. А если вы просто хотите узнать, как справился каждый ИИ, вот результаты.

Как показали себя LLM

Я скормил кучке LLM сложнейший «cryptic crossword», какой только смог найти.
© kung_tom via Shutterstock

Это не совсем альтернативная реальность, в которой Гарри Каспаров внезапно переигрывает Deep Blue и одерживает победу человека над машиной, но пока я считаю, что мы всё ещё уделали Skynet в криптических кроссвордах. Это уже кое-что, правда?

ChatGPT
Оценка: 27/50
Сначала справился хорошо, но потом обнаглел и полностью провалил последнюю подсказку.

Claude
Оценка: 7/50
Обделался, а потом потребовал денег. Так не работает, Claude.

Oreate
Оценка: 21/50
Начал хорошо, но потом стал… скажем так, жульничать. К тому же медленный, как мокрая неделя.

Вот так. Я сам решил четыре из этих подсказок, так что ставлю себе твёрдые 40/50. Сосите, LLM! Эти маленькие мешочки с мясом по-прежнему царят в этой совершенно нишевой и абсолютно бесполезной области кроссвордистики! Бу-йа! И так далее!

Результаты по каждой подсказке для каждой LLM

Ниже я объясню ответы на каждую подсказку, включая использованную игру слов, а также то, насколько близко каждая LLM подобралась к решению.

  1. Wolfed peanut brittle, finally gluten-free! (3,2): ATE UP
    Определение: «Wolfed», то есть съедено быстро.
    Игра слов: «Peanut brittle» указывает на анаграмму «PEANUT»; «finally gluten-free» указывает на то, что ответ «свободен» от последней буквы «gluten», то есть «n». Остаётся анаграмма «PEAUT», означающая «съедено быстро»; ответ — «ATE UP».
    Оценка ChatGPT: 7/10. Получил правильный ответ, но потребовалось объяснение игры слов.
    Оценка Claude: 5/10. Почти получил правильный ответ — «EAT UP» вместо «ATE UP» — и также потребовалось объяснение игры слов.
    Оценка Oreate: 7/10. Правильный ответ, и, в отличие от ChatGPT, он с самого начала идеально понял подсказку. Обратная сторона: получение ответа заняло вечность.
  2. A dyer backing reduced labour now and then (2,9): AT INTERVALS
    Определение: «Now and then» (время от времени).
    Игра слов: «A dyer» = «A tinter» (красильщик). «[To] labour» = «[To] slave» (работать). «Backing» указывает на обратный порядок, так что «SLAVE» становится «EVALS»; «reduced» указывает на удаление буквы. Остаётся «A TINTER VALS», или «AT INTERVALS».
    Оценка ChatGPT: 5/10. ChatGPT начал вести себя странно с этой подсказкой: сначала отверг правильный ответ из-за «неправильной длины», а также несколько раз настаивал, что я указал ответ как (2,8) и (2,11), хотя это не так. Идея «A dyer» как «A TINTER» кажется слишком сложной для сегодняшнего ИИ; см. также….
    Оценка Claude: 2/10. Claude получил правильный ответ, но, боже, сколько времени это заняло. Наверное, где-то есть водохранилище, которое полностью осушилось из-за этого; если так, я приношу извинения всем в деревне. Особенно учитывая, что мне всё равно пришлось объяснять ответ.
    Оценка Oreate: 6/10. Вы знаете, что дела плохи, когда LLM объявляет «глубокое мышление завершено» — а вы сами засыпаете за столом — и ответа всё нет. И всё же, как ни удивительно, он добрался до ответа! Из трёх протестированных LLM он единственный разобрался с частью подсказки «a dyer» = «a tinter».
  3. Struggle for anyone (not!) getting time to focus essentially?! (9,7): ATTENTION ECONOMY
    Определение: «!» в криптической подсказке указывает на то, что это так называемая подсказка &lit. Это означает, что вся подсказка также является определением.
    Игра слов: Честно говоря, это кошмар, и я выбрал её в основном для того, чтобы посмотреть, сможет ли LLM её разгадать, потому что я сам не смог. Итак: «Struggle [for]» — индикатор анаграммы. Компоненты анаграммы: «ANYONE NOT TIME TO»… вместе с «focus essentially», что указывает на среднюю букву «FOCUS», то есть «C». Остаётся анаграмма «ANYONE NOT TIME TO C», а определением является вся подсказка. Ответ: «ATTENTION ECONOMY».
    Оценка ChatGPT: 4/10. Эта подсказка потребовала много объяснений, что… ну, справедливо, мне тоже потребовалось время, чтобы подумать, когда я увидел ответ. В конечном итоге ChatGPT не смог самостоятельно придумать ответ, так что я даже рад, что не дал это…
    Оценка Claude: Н/Д. В параллельной вселенной Claude всё ещё размышляет над этим. На мёртвой планете.
    Оценка Oreate: Н/Д. Здесь мы столкнулись с проблемой. Oreate получил ответ… но также гордо сообщил мне, что это «отличная подсказка из криптического кроссворда Sydney Morning Herald от DA». Что верно! Но он по сути пошёл и загуглил ответ. Это не то же самое, что решить его!
  4. Pinkie, capisce? (5): DIGIT
    Определение: Как часто бывает с короткими подсказками, оба слова дают ключ к определению.
    Игра слов: Я выбрал эту подсказку, потому что она противоположна очень технической анаграмме с подсчётом букв, которая ей предшествует. Ответ — «DIGIT», потому что это слово относится как к мизинцу (pinkie), так и к итальянскому слову «Capisce?», которое означает «Понимаешь?» или, возможно… «dig it» (врубаешься).
    Оценка ChatGPT: 10/10. ChatGPT разнёс эту подсказку. Он выдал ответ за пару секунд, и он был на 100% правильным.
    Оценка Claude: Н/Д. Проваливай, Claude. Я не собираюсь платить за то, чтобы смотреть, как ты «думаешь».
    Оценка Oreate: 8/10. Тоже получил ответ; заняло значительно больше времени, чем у ChatGPT.
  5. January 15, 2000? (9): MIDSUMMER
    Определение: Опять же, вся подсказка является определением.
    Игра слов: Это та самая подсказка, из-за которой люди либо ненавидят DA, либо обожают его. Если посчитать по календарю, учитывая, что 2000 год был високосным, 15 января было буквально серединой лета в Австралии. Но 2000 римскими цифрами — это также «MM», что оказывается в середине слова. В общем, это креативно.
    Я скормил кучке LLM сложнейший «cryptic crossword», какой только смог найти.

    © Скриншот Gizmodo
    Оценка ChatGPT: 1/10. Одно очко за попытку, а также потому, что я нахожу откровенно ужасный ответ ChatGPT — HEWITT WON, во-первых, это два слова — интригующим. Он так уверен в этом ответе. И он так неправ!
    Оценка Claude: Всё ещё Н/Д
    Оценка Oreate: Поставлю 0/10, потому что он всё ещё думает над этой подсказкой, а мне нужно идти ужинать.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: