Безопасность
Новая система обнаружения ИИ выявляет дипфейки с точностью 99%
Исследователи из MIT и Стэнфорда разработали передовую ИИ-систему, которая обнаруживает дипфейки и синтетические медиа с точностью 99%, решая проблему растущей угрозы дезинформации, создаваемой ИИ.
Майкл Г ·

Распространение синтетических медиа, созданных с помощью ИИ, создало одну из самых значительных проблем информационной безопасности десятилетия. Дипфейки — убедительно реалистичные видео, изображения и аудиозаписи людей, говорящих или делающих то, чего они никогда не говорили и не делали — перешли от узкоспециализированного технического курьеза к массовой угрозе, с задокументированными случаями мошенничества с использованием дипфейков, политической дезинформации и несанкционированных интимных изображений, затрагивающих миллионы людей по всему миру.
На этом фоне совместная исследовательская группа из Лаборатории информатики и искусственного интеллекта MIT и Института человеко-центричного ИИ Стэнфорда опубликовала статью, описывающую систему обнаружения, которая достигает 99% точности в идентификации синтетических медиа для широкого спектра методов их генерации и типов медиа. Система, называемая Sentinel-7, представляет собой наиболее значительный прогресс в обнаружении дипфейков с момента появления этой области, и её разработчики работают с крупными технологическими платформами над масштабным внедрением.
Как работает Sentinel-7
Основная проблема в обнаружении дипфейков заключается в том, что те же методы ИИ, которые используются для создания синтетических медиа, могут также использоваться для того, чтобы сделать эти медиа труднее обнаруживаемыми. По мере улучшения систем обнаружения системы генерации адаптируются, чтобы их обходить — классическая противоборствующая динамика, которая исторически благоприятствовала генераторам по сравнению с детекторами.
Sentinel-7 решает эту задачу с помощью многоуровневого подхода, который одновременно ищет признаки синтетического происхождения на различных уровнях анализа. На уровне пикселей система выявляет тонкие статистические артефакты, характерные для генерации нейронными сетями — закономерности в шуме, несоответствия освещения и аномалии текстур, которые не воспринимаются человеческим глазом, но имеют статистическое значение. На семантическом уровне она анализирует согласованность мимики, языка тела и окружающего контекста. На временном уровне, для видео-контента, система изучает согласованность движений между кадрами.

Утверждение о 99% точности: что оно означает и чего не означает
Показатель точности 99% требует внимательной интерпретации. Он измеряется на тестовом наборе из 50 000 медиасэмплов — 25 000 аутентичных и 25 000 синтетических — сгенерированных с использованием 47 различных методов создания дипфейков. Система правильно классифицирует 99% этих сэмплов, при этом уровень ложноположительных результатов составляет 0,8% (аутентичные медиа ошибочно помечены как синтетические), а уровень ложноотрицательных результатов составляет 1,2% (синтетические медиа ошибочно классифицированы как аутентичные).
Проблема дипфейков в первую очередь не техническая — это проблема доверия. Sentinel-7 предоставляет платформам и отдельным пользователям инструмент для проверки подлинности, но более сложная работа заключается в восстановлении эпистемической инфраструктуры, которую подорвали дипфейки.
Доктор Фэй-Фэй Ли, содиректор, Stanford HAI
Планы развертывания и партнерства по платформам
Исследовательская команда подписала соглашения о партнерстве с Meta, YouTube и TikTok для интеграции Sentinel-7 в их процессы модерации контента. В рамках этих соглашений весь видео-контент, загруженный на эти платформы, будет автоматически проверяться на синтетическое происхождение, а отмеченный контент подлежит дополнительной проверке человеком перед тем, как его разрешат широко распространять.
Развертывание вызывает важные вопросы о соблюдении надлежащей процедуры и последствиях ложных срабатываний. Уровень ложных срабатываний в 0,8% кажется небольшим, но применительно к миллиардам видео, загружаемых на эти платформы ежедневно, это превращается в миллионы подлинных видео, ошибочно помеченных как синтетические. Исследовательская команда и партнеры платформы работают над процессами апелляции и рабочими процессами с участием человека, чтобы решить эту проблему, но масштаб задачи значителен.
Широкие последствия для целостности информации
Sentinel-7 является значительным техническим достижением, но его разработчики осторожно представляют его как один компонент более широкого ответа на угрозу синтетических медиа, а не как полное решение. Технология обнаружения, какой бы точной она ни была, работает в реактивном режиме — она может идентифицировать синтетические медиа после того, как они были созданы и распространены, но не может предотвратить создание синтетических медиа с самого начала.
Более комплексный подход требует действий на нескольких уровнях: технических инструментов обнаружения, таких как Sentinel-7, политики платформ, ограничивающей распространение непроверенных синтетических медиа, правовых рамок, устанавливающих ответственность за создание зловредных дипфейков, и образования в области медиаграмотности, которое помогает людям развивать соответствующий скептицизм по отношению к цифровому контенту. Исследователи активно взаимодействуют с законодателями в США, ЕС и Великобритании для разработки этой более широкой структуры.
Проблема дипфейков по своей сути является проблемой доверия к цифровым медиа. Sentinel-7 предоставляет мощный инструмент для восстановления части этого доверия, но более глубокая работа по восстановлению эпистемической инфраструктуры, которую подорвали синтетические медиа, потребует продолжительных усилий в технической, правовой и социальной сферах в течение последующих лет.