Иногда клин клином вышибают. Но когда речь идет об ИИ-мусоре и разжигающем ненависть контенте, угрожающих безопасности и ценности социальных платформ, добавление еще большего огня — в данном случае большего количества ИИ — может усугубить проблему.
В лучшем случае социальные сети могут стать убежищем для людей, желающих поделиться своим опытом и знаниями. Они максимально приближаются к этому идеалу, когда пользователи вносят аутентичный, ценный контент, будь то уникально продуманный пост в блоге или полезное видео о том, как собрать ПК. Полагаться в первую очередь на инструменты ИИ для сохранения этой аутентичности — значит упускать из виду то, что делает социальные сети ценными изначально: людей, стоящих за ними.
Ошибочные удаления
В апреле канал Slack для модераторов сообщества r/AskHistorians на Reddit был обычно занят. Канал, который автоматически получает ссылки на сообщения модераторской почты, был завален оповещениями после того, как десятки комментариев и постов, датированных 10 годами ранее, были автоматически удалены из сабреддита.
«И мы ничего не могли с этим поделать — ни мы, ни эксперты [опубликовавшие удаленный контент]», — рассказала мне доктор Сара Гилберт, одна из модераторов.
Это было особенно разрушительно для сабреддита, поскольку его пользователи рассматривают сообщество как архив подробных ответов, которые продолжают обучать людей еще долго после публикации контента.
Недавно обновленные инструменты модерации на основе ИИ от Reddit, по мнению модераторов, были ответственны за удаления. После восстановления текста некоторых постов один из модераторов AskHistorians заметил, что весь удаленный контент содержал ссылки на Rare Historical Photos — сайт для обмена историческими изображениями. Модераторы считают, что Reddit мог пометить этот сайт — и, следовательно, любой пост, использующий его контент для пояснительных иллюстраций, — как спам.
Reddit не ответил на запрос о комментарии.
Удаление контента стерло ценную информацию, на сбор которой ушло время (Гилберт рассказывает мне, что некоторые люди тратят часы, «иногда в течение нескольких дней», на исследование и написание ответов на вопросы, заданные в сабреддите). Однако возможно, что эти ошибочные удаления и другие подобные им способствовали появлению метрик, призванных продемонстрировать, насколько эффективна модерация с помощью ИИ на Reddit.
Reddit заявляет, что благодаря ИИ он «увеличил количество мер по борьбе с контентом, разжигающим ненависть и насилие, более чем на 200 процентов» и что ИИ обеспечивает «более быстрое и масштабное применение мер». ИИ «помог сократить воздействие потенциально вредного контента более чем на 40 процентов», заявил Reddit в этом месяце. Он также сообщил, что использует большие языковые модели (LLM) для выявления «очень тонких, скоординированных паттернов поддельного поведения и искусственного ажиотажа».
Но, как показывает инцидент с AskHistorians, больше мер не обязательно означает лучше.
Проблема ложных срабатываний
Развитие генеративного ИИ создало новые препятствия для модерации социальных сетей. Гилберт отметила, например, что большие языковые модели «значительно усложнили обнаружение спама», поскольку они стремятся имитировать голоса реальных людей. «За последние два-три месяца нас буквально наводнили спам-боты на базе LLM», — сказала она.
Маркетинговые агентства создают контент для соцсетей, предназначенный для того, чтобы бренды цитировались генеративными ИИ-чатботами. Маркетологи давно используют неаутентичные посты в соцсетях для повышения видимости, но рост популярности чат-ботов открыл новый фронт. Стартап ReachLLM, например, специализируется именно на маркетинге через чат-ботов. В рамках этих усилий представители компании создают и модерируют сабреддиты на Reddit.
Эти проблемы побудили некоторые компании социальных сетей изучать новые методы модерации на основе ИИ. Reddit, например, заявляет, что его инструменты ИИ «ежедневно отзывают почти [2 миллиона] фальшивых голосов» и что он использует LLM «для выявления очень тонких, скоординированных паттернов поддельного поведения и искусственного ажиотажа, которые старые системы раньше пропускали».
Но многие платформы социальных сетей стали чрезмерно полагаться на инструменты модерации на основе ИИ, которые быстро наказывают пользователей за безобидный контент.
Недавно Discord признал, что его система модерации на основе ИИ ошибочно забанила около 8 400 аккаунтов в период с мая по начало июля. ИИ ошибочно пометил изображения, содержащие квадратные сетки, такие как шахматные доски или электронные таблицы, как CSAM и впоследствии выдал загрузившим их пользователям перманентный бан. (Discord сообщает, что все затронутые аккаунты с тех пор были восстановлены.)
Компания заявила, что ее модерация на основе ИИ не предназначалась для использования без контроля человека. Она утверждала, что сотрудник-человек должен проверять контент, отмеченный ИИ, прежде чем Discord предпримет какие-либо действия, но ошибка привела к тому, что ИИ обошел человеческий этап и забанил аккаунты.
Предполагаемый сбой подчеркивает, почему человеческие защитные механизмы остаются необходимыми в модерации контента. Без надлежащего контроля система модерации на основе ИИ может совершить тысячи ошибок за несколько недель с долгосрочными последствиями.
С 2025 года многиепользователи Facebook* и Instagram жаловались на массовые баны, которые они связывают с модерацией на основе ИИ. Отсутствие человеческой модерации только усилило разочарование среди пользователей, которые утверждают, что не нарушали никаких правил, особенно учитывая, что нет возможности поговорить с сотрудником Meta* о причине бана или о том, как восстановить аккаунт. Meta* не сообщила, стоит ли ИИ за этими банами, но компания в последние годы все больше полагается на модерацию на основе генеративного ИИ, а не на людей — сдвиг, который, по мнению некоторых, включая сотрудников Meta*, происходит слишком быстро.
Tumblr — еще одно социальное сообщество, где автоматизированные системы модерации дали сбой. В марте Ченда Нгак, руководитель отдела коммуникаций материнской компании Tumblr Automattic, рассказала The Verge, что автоматические системы Tumblr ошибочно забанили «менее 200» аккаунтов Tumblr за один день.
А в 2025 году пользователи Tumblr жаловались после того, как автоматические системы модерации контента платформы неточно помечали контент как «взрослый», снижая его видимость. В обоих случаях пользователи винили ИИ. Tumblr никогда не подтверждал, что ИИ стал причиной этих проблем, но компания заявляла, что использует «сочетание классификации на основе машинного обучения и человеческой модерации».
Модерация на основе ИИ может сэкономить компаниям социальных сетей деньги и помочь быстрее удалять вредоносный контент. Но пока эти системы не смогут устранить базовые ошибки — например, пометку изображения шахматной доски как CSAM, — им необходим контроль человека.
«Раньше, когда в системе было больше прозрачности, мы регулярно сообщали о разжигании ненависти и получали автоматический ответ, что это на самом деле не нарушает правил Reddit, что побуждало нас начинать процесс апелляции», — сказала модератор AskHistorians Гилберт. «Так что трудно доверять цифрам, потому что трудно доверять „суждению“ систем Reddit».
Ложные срабатывания — это «огромная проблема» на Reddit, сказала она.
Предвзятость ИИ
Типичные системы модерации социальных сетей на основе ИИ используют классификаторы машинного обучения для анализа постов и выявления контента, нарушающего правила платформы. Но машине трудно понимать нюансы сарказма, сатиры и сленга.
Кроме того, некоторые исследования (примеры здесь, здесь и здесь) показывают, что маргинализированные группы могут непропорционально сильно страдать от модерации на основе ИИ. Без контроля человека ИИ может в конечном итоге наказывать именно те сообщества, которые наиболее уязвимы для разжигающего ненависть контента, для борьбы с которым и предназначены эти системы.
Гилберт, которая также является директором по исследованиям Лаборатории граждан и технологий Корнелльского университета, говорит, что «маргинализированные и уязвимые группы населения входят в число тех, кто сталкивается с самыми высокими показателями модерации, и обычно это является результатом „ложных срабатываний“», часто вызванных случаями контрречи, языковой рекламации и «реакций на разжигающий ненависть контент».
«Ложные срабатывания — это вопрос справедливости. Они означают, что группы, которые уже маргинализированы, еще больше заставляют замолчать и подвергают цензуре», — добавила она.
Модераторы на основе ИИ также могут делать сообщества менее эффективными в саморегуляции. На Reddit, например, некоторые модераторы сабреддитов предпочли бы банить пользователей, использующих риторику ненависти или насилия. Но если ИИ Reddit удаляет такой контент до того, как его увидит модератор-человек, эти модераторы теряют возможность оценить, оправдан ли бан.
Что касается предоставления модераторам-людям большего контроля, Reddit на этой неделе объявил о расширении тестирования Rules Hub — набора инструментов, который позволяет модераторам-людям «выбирать, какие правила должны применяться автоматически, решать, что произойдет при срабатывании правила (отправить в очередь, отфильтровать или удалить), просматривать работу до ее включения, а также изучать журналы и аналитику». Ожидается, что Rules Hub в конечном итоге заменит инструмент Automod, который в первую очередь полагается на точные ключевые слова.
ИИ — это инструмент, а не решение
Модераторы, с которыми я общался, неоднократно обвиняли бум генеративного ИИ в всплеске контента, нарушающего специфические для сообщества или общие правила платформы. Это серьезная проблема для сайтов социальных сетей, которые полагаются на вклад пользователей.
Компании будут продолжать пробовать новые методы более надежной и эффективной модерации, но сокращение участия человека — это шаг назад. Низкокачественный контент, созданный ИИ, меняет задачи, стоящие перед командами модераторов, но это делает более необходимыми усиленные подходы, при которых обнаружение на машинном уровне может сочетаться с человеческим суждением и опытом.
Подобно тому, как социальные сети не имеют ценности без людей, модерация контента не может быть успешной без человеческого суждения на переднем плане.
Advance Publications, владеющая Condé Nast, материнской компанией Ars Technica, является крупнейшим акционером Reddit.
Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Scharon Harding




