Мы живем в эпоху, когда искусственный интеллект все больше доминирует в интернете, затрудняя различение реального контента и фейковых новостей. Любое изображение или видео, которое вы видите сегодня, может быть создано ИИ, а традиционные маркеры, которые могли бы это выдать, быстро исчезают. Существуют инструменты, помогающие определить, создано ли что-то с помощью ИИ, и Nvidia — пожалуй, главный бенефициар гонки ИИ — только что выпустила собственный, под названием “Synthetic Video Detector” (SVD). SVD представляет собой микросервис вывода Nvidia (NIM), часть программы компании AI for Media Private Access, поэтому он недоступен широкой публике, но существует демо-версия. В любом случае, задача SVD проста: обнаружить, является ли видео реальным или сгенерированным с помощью ИИ. Он может анализировать видео в масштабе, разбивая их на отдельные кадры для выявления аномалий. Он основан на передовых исследованиях, получивших награды на конференции по компьютерному зрению ICCV. Вместо того чтобы рассматривать видеофайл как единое целое, SVD разбивает его на обрезанные кадры, каждый размером 504×504 пикселя. Затем эти кадры пропускаются через два мощных Vision Transformer от Meta*: DINOv2 и DINOv3. Задача Vision Transformer — научиться формировать паттерны без необходимости в размеченных человеком данных. Они обычно используются для классификации изображений, поиска изображений, обнаружения объектов и оценки глубины. Таким образом, после прохождения через эти трансформеры их характерные пространственные признаки быстро оцениваются, и каждому кадру присваивается оценка от 0 до 1 — 0 означает полностью реальное изображение, а 1 — полностью поддельное. В конце баллы суммируются для получения среднего значения, которое сообщает пользователю, является ли видео реальным или нет, на основе процентной оценки из 100. Таким образом, новостные агентства, вещатели и медиа-компании могут проверять полученные видеоматериалы намного быстрее и с большей уверенностью. SVD даже спроектирован для работы в условиях сжатия в социальных сетях, поскольку видео, загруженные в интернет, маскируют свои недостатки. Но трансформеры все равно могут обнаруживать паттерны, невидимые человеческому глазу, проникая сквозь поверхностные аномалии и фокусируясь на внутренних артефактах. Как видно на диаграмме AI GVD выше, несжатое видео по-прежнему дает наилучшие результаты: SVD демонстрирует невероятную точность 92%. При 15% сжатии точность модели падает до 87%, а при 50% сжатии все еще достигается впечатляющая точность 82% в обнаружении контента, созданного ИИ. Поскольку это микросервис, он также обладает исключительной задержкой, обрабатывая видео 1080p всего за 22 мс на графических процессорах Nvidia RTX и за 30 мс на рабочих станциях Nvidia. Тем не менее, SVD требует кодировщика NVENC, поэтому датацентровые карты, такие как B100, не могут запускать его нативно. Nvidia заявила, что уже работает с Wowza над внедрением обнаружения синтетического видео в реальном времени в рабочие процессы прямых трансляций. Демо-версию можно попробовать прямо сейчас на build.nvidia.com, но учтите, что обработка занимает много времени, поскольку происходит в облаке, максимальный размер файла составляет всего 100 МБ, и часто возникает тайм-аут.
Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Hassam Nasir




