Мы до сих пор не знаем, как на самом деле люди используют «AI»

Ai Observatory использование ии независимые данные Anthropic Openai диалоги technologyreview.com

Узнайте, как независимая платформа AI Observatory раскрывает реальное использование ChatGPT, Claude и Grok — вопреки корпоративным отчетам. Исследуйте 25 000 диалогов, чтобы увидеть различия в темах, чувствительном контенте и эволюции взаимодействия. Получите объективные данные для принятия решений.

Компании, разрабатывающие ИИ, такие как Anthropic и OpenAI, регулярно публикуют отчеты о том, как люди используют продукты вроде Claude и ChatGPT, но они предоставляют только те данные, которые хотят показать, утверждают исследователи ИИ.

«Не существует независимого источника, который мог бы это подтвердить», — говорит Анка Реуэл, кандидат наук в области компьютерных наук в лаборатории Stanford Trustworthy AI Research (STAIR).

Реуэл — соруководитель нового исследовательского проекта под названием AI Observatory, который призван заполнить этот пробел. Это публичная платформа, которая агрегировала и проанализировала реальные диалоги с популярными моделями ИИ, такими как Claude и Gemini, собранные с согласия пользователей из семи существующих наборов данных. Цель Observatory — предоставить независимые источники информации для исследователей и политиков, чтобы оценить, как люди используют генеративный ИИ. Заинтересованные стороны в настоящее время принимают крайне важные решения о преимуществах и рисках ИИ на основе очень ограниченных данных, говорит Реуэл.

AI Observatory обнаружил, что использование ИИ значительно различается в зависимости от модели и меняется со временем. Его исследование показывает гораздо больше чувствительных видов поведения, чем отражено в отчетах крупных ИИ-компаний, которые, по их словам, больше фокусируются на работе, чем на личном использовании.

Anthropic Economic Index — один из самых известных и широко цитируемых источников данных об использовании ИИ, но у него есть слепые зоны. Как следует из названия, он фокусируется на рабочих и продуктивных вариантах использования Claude AI, отфильтровывая диалоги, не связанные с этими целями.

Когда команда AI Observatory применила методы Anthropic к своему набору данных, они обнаружили, что почти половина диалогов — 48% — была бы отфильтрована. Эти отфильтрованные нерабочие диалоги с большей вероятностью включали темы здоровья и отношений (44,2% против 31,2% в анализе Anthropic), взрослые или запрещенные темы (7,9% против 2,1%), домогательства и ненависть (27,5% против 5,66%) и сексуальный контент (16,7% против 2,4%). (Отчет OpenAI 2025 года об использовании ChatGPT, аналогично, показал, что только 30% потребительского использования было связано с работой.)

Anthropic опубликовал отдельные записи в блоге о том, как люди используют Claude для поддержки или общения, и даже для генерации CSAM, «но наличие [у AI Observatory] общего анализа, а не разбитого на отдельные отчеты, помогает» исследователям более последовательно понимать различные варианты использования, говорит Дэвид Уиддер, доцент Школы информации Техасского университета в Остине, который изучает взаимодействие людей с ИИ-системами и не участвует в проекте AI Observatory.

Наборы данных, которые изучал AI Observatory, включают диалоги, происходившие в период с 2023 по 2025 год, и были обнаружены различия как в том, как люди использовали ИИ, так и в том, как различные ИИ-платформы реагировали.

Диалоги в WildChat, одном из крупнейших и наиболее детализированных наборов данных, включенных в исследование AI Observatory, со временем становились длиннее и сложнее, о чем свидетельствует увеличение токенов в запросах, токенов в ответах и количества оборотов диалога.

Со временем также значительно увеличилось количество светских бесед. Это предполагает, что общение с ИИ становилось более распространенным; в то же время самораскрытие ИИ-ассистентов (т.е. что это чат-бот) снизилось.

Кроме того, обмены, которые исследователи классифицировали как чувствительное использование — то есть потенциально вредный или ограниченный контент, включая сексуальные домогательства и разжигание ненависти — сократились. Это может указывать на то, что платформы в целом внедряли более эффективные меры защиты.

AI Observatory также обнаружил, что использование ИИ значительно различалось в зависимости от модели. В зависимости от инструмента пользователи различались по темам, стилям взаимодействия, структурам диалогов, а также по вероятности и типу чувствительных случаев использования.

Например, исследователи обнаружили, что люди чаще использовали Grok и Gemini для поиска информации. Grok, в частности, был особенно популярен для получения информации о новостях и политике, но именно там, как правило, концентрировалась дезинформация. (Это согласуется с другими исследованиями, которые также показали, как легко дезинформация распространяется на Grok. xAI не ответил на запрос о комментарии.)

Между тем, люди чаще обращались к Anthropic для программирования, к Gemini — для социальных и ролевых игр, а к ChatGPT — для помощи с домашними заданиями.

Были даже различия между разными версиями одной и той же модели. Исследователи обнаружили, что люди вели более короткие диалоги с ChatGPT на базе GPT-3.5 и более длинные и итеративные с GPT-4o — что логично, учитывая, что эта версия стала известна тем, что приводила к эмоциональной зависимости. 

Однако корпоративные отчеты, как правило, не отражали эти нюансы ни между моделями, ни даже внутри собственных моделей. «Ни один отдельный отчет компании не рассказывает всей истории», — говорит Шейн Лонгпр, недавний выпускник PhD из MIT Media Lab, который руководил исследованием вместе с Реуэл.

Для создания AI Observatory Реуэл и исследователи из MIT, Stanford, Data Provenance Initiative и других учреждений агрегировали 24 521 диалог, состоящий из 85 633 оборотов (то есть запрос пользователя и соответствующий ответ ИИ) из семи реальных наборов данных, собранных в предыдущих исследованиях. Эти диалоги поступили от 5 000 пользователей, взаимодействовавших с 52 различными моделями, включая ChatGPT, Gemini, Claude и Grok, в период с 2023 по 2025 год.

Но эти диалоги — капля в море по сравнению с данными, к которым имеют доступ сами крупные лаборатории. Последний Anthropic Economic AI Index, например, основан на анализе 1 миллиона диалогов Claude; отчет OpenAI об использовании ChatGPT проанализировал 1,5 миллиона диалогов.

Представитель Anthropic заявил, что их опубликованные исследования отражают конкретные вопросы и интересы их исследовательских групп, а также важность поддержки внешних независимых исследований. OpenAI не ответил на запросы о комментариях.

Кроме того, тот факт, что набор данных AI Observatory основан на добровольно предоставленных источниках, означает, что он, вероятно, недопредставляет чувствительные виды использования, которыми люди могут делиться реже. Таким образом, исследователи предупреждают, что их выводы не отражают все использование ИИ.

Однако работа Observatory расширяет доступ для исследовательского сообщества. ИИ-компании обычно не делятся своими данными чатов для анализа, что означает, что их отчеты, как правило, сосредоточены на выводах, которые выставляют их компании в лучшем свете, утверждают независимые исследователи, такие как Реуэл и Уиддер.

«Когда мы хотим спросить, например: используется ли универсальная ИИ-система Anthropic… в основном во благо или в основном во вред… у нас нет способа ответить на этот вопрос, потому что эта информация является собственнической», — объясняет Уиддер, доцент Школы информации Техасского университета в Остине.

Данные AI Observatory будут доступны исследователям для анализа, и команда надеется со временем расширить свои наборы данных. В идеале, говорит Реуэл, ИИ-компании делились бы своими данными с независимыми исследователями — конечно, способами, защищающими конфиденциальность пользователей. Но в нынешней ситуации любой, кто принимает решения на основе данных об использовании ИИ, рискует «полностью действовать вслепую и принимать эти действительно важные решения, не зная, что на самом деле происходит за пределами этих корпоративных нарративов», — говорит Реуэл.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: