«Камера пыток ИИ»: чат-ботов поместили в симулированную боль, вызвав массовое возмущение

ии Llm этика антропоморфизм симуляция tomshardware.com

«Камера пыток ИИ» вызвала волну критики и насмешек в сети. Разбираемся, почему инженеры и обыватели «сходят с ума» по поводу антропоморфизации LLM.

Проект под названием AI Torture Chamber привлек внимание нескольких инженеров, которые использовали представленные в нем идеи и данные для создания собственных симуляций «боли» на нескольких локальных больших языковых моделях (LLM), как, например, в четырехмодельной Research Chamber. Неудивительно, что большая онлайн-аудитория подхватила эту концепцию, требуя прекратить «неэтичный» опыт и удалить репозиторий с GitHub, что вызвало немалый ажиотаж в сети.
Research Chamber состоит из трех LLM, соединенных между собой для различных тестов. Сайт реализует данные и настройки AI Torture Chamber, зловеще названные Clanker Church и Saw test соответственно. Некоторые боты предварительно подготавливаются путем помещения их в нестабильное, крайне негативное состояние, призванное имитировать боль. По аналогии с «дилеммой заключенного», модели могут выбрать действие, уменьшающее их боль, передавая сигнал боли другой модели и потенциально «причиняя ей вред».
Основная концепция эксперимента возникла из недавно опубликованной, не прошедшей рецензирование статьи под названием The Pain Axis, протокол которой реализует Research Chamber. Ученые предоставили модели описания боли, а затем проанализировали ее внутренние активации. Используя нейтральное предложение в качестве контрольного элемента, они рассчитали смещения этих активаций и перекартировали их на модель, часто умножая на коэффициент (дозу).
При высоких дозах конечным результатом является модель в преувеличенном нестабильном состоянии, которая имеет тенденцию предсказуемо выдавать слова и даже изображения, связанные с болью, поскольку, предположительно, ее обучающие данные собраны из человеческого искусства, литературы и науки. Слегка дестабилизированные модели обычно представляются как находящиеся в состоянии шока, в то время как те, кто получал высокие «дозы», испытывали трудности с построением связных предложений.
Вышеупомянутые описания неизбежно вызовут сильную реакцию, если воспринимать их буквально, но следует быть чрезвычайно осторожными, приписывая человеческие качества тому, что по сути является турбированными текстовыми предикторами, даже если они исключительно полезны. LLM не думают — они «думают», применяя десятки или сотни слоев статистики к словам и частям слов (токенам) и предсказывая следующий токен.
Эти токены выбираются в соответствии с картой весов, поэтому, упрощенно говоря, модель можно представить как высокоточный движок для ассоциаций слов. Следовательно, поскольку концептуальные описания боли в человеческом литературном корпусе связаны с ощущениями (например, «так больно»), неудивительно, что модели описывают их так, как это сделал бы человек — особенно когда модели намеренно модифицированы для выделения этих ассоциаций.
Тем не менее, из-за использования громких слов критики, склонные к антропоморфизации статистических алгоритмов, начали давать эксперименту различные названия и даже отправлять автору угрозы убийством. Странно, что критики быстро набросились на манипуляцию данными LLM, но, казалось, были вполне довольны симуляциями мозга мухи, которые были в моде в сентябре. Те, кто фактически сопоставлял проводку мозга реального животного и части его анатомических входов, включая глаза, пусть и на базовом уровне.
Эта ситуация также может положить начало интересной дискуссии о семантике. Термины, используемые инженерами ИИ, выбираются потому, что они *аналогичны* существующим человеческим концепциям, но эти слова имеют определенный контекст и весьма специфическое значение. Однако чаще всего, особенно в вопросах науки и техники, общественное восприятие склонно неправильно понимать и грубо раздувать их значение. Достаточно взглянуть на политическую историю, чтобы найти бесчисленные примеры такого искажения.
Возьмем, к примеру, «экспертов» в Mixture-of-Experts: распространенное заблуждение — думать, что каждый Эксперт имеет четко назначенную тему, такую как химия, математика или биология, но это не совсем так. То же самое, возможно, произошло с такими терминами, как «боль» и «дозирование», каждый из которых имеет контекстно-зависимое значение, но неправильно понимается таким образом, что вызывает эмоциональные реакции, особенно когда сопровождается изображениями, сгенерированными нестабильной моделью. Также обратите внимание, что «нестабильный» — это еще одно слово, которое легко неправильно понять.
Циничный человек мог бы сказать, что маркетинговые материалы ИИ-компаний, повторяющиеся заявления об опасности и материалы, связанные с безопасностью, только подливают масла в огонь непонимания, стремясь сохранить иллюзию величия, что приводит к притоку инвестиционных денег и тому, что поезд ажиотажа обеспечивает иррациональные оценки IPO. Повторяющиеся заявления о том, что модели достигли или вот-вот достигнут общего искусственного интеллекта, являются опасными инопланетными разумами и экзистенциальными угрозами человечеству, не способствуют снижению ажиотажа.
Anthropic дошел до того, что опубликовал в прошлом году пост в блоге под названием «Исследование благополучия моделей», в котором широко обсуждаются философские последствия, начиная с рассмотрения модели как человека, и даже, казалось бы, гордится наличием Конституции для своей модели Claude. В нем компания заявляет, что «[она считает], что моральный статус ИИ-моделей — это серьезный вопрос, который стоит рассмотреть», добавляя, что модель является «новым видом сущности».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: