Top.Mail.Ru
Ученые нашли способ выявлять дипфейки с точностью 98 процентов — RuSamara | Информационная лента

Ученые нашли способ выявлять дипфейки с точностью 98 процентов

2 октября 2026, 00:30 ·

Оптический нейропроцессор для выявления дипфейков

Специалисты Калифорнийского университета в Лос-Анджелесе (UCLA) разработали оптико-нейронный процессор, который задействует свет для быстрого и точного распознавания дипфейк-видео. В отличие от традиционных систем, обычно проверяющих ролики поочерёдно с помощью цифрового оборудования, разработка UCLA способна анализировать 15 и более видеопотоков одновременно. Принципиальное отличие состоит в том, что часть процесса детекции реализуется за счёт физического распространения света.

Благодаря этому множество видео оцениваются параллельно за один оптический проход, тогда как при стандартной цифровой обработке каждое из них пришлось бы пропускать через конвейер отдельно. Технология описана в исследовании «Scalable, Energy-Efficient Optical-Neural Architecture for Multiplexed Deepfake Video Detection», опубликованном в журнале eLight. Оптическую ИИ-систему задумывали как высокопроизводительный и устойчивый к атакам первый рубеж защиты для проверки больших объёмов поддельного и созданного ИИ видео.

Стремительное развитие генеративного ИИ делает синтетические ролики всё более реалистичными, из-за чего растёт потребность в системах обнаружения, которые одновременно точны и способны работать в больших масштабах. Многие продвинутые детекторы дипфейков опираются на огромные объёмы цифровых вычислений: один анализ может требовать сотен миллиардов операций с плавающей запятой, а видео часто обрабатываются последовательно. По мере роста объёмов проверяемого контента пропорционально увеличиваются и время обработки, и энергозатраты. Есть и другая проблема: злоумышленники могут намеренно вносить в поддельные ролики незаметные изменения, призванные запутать детектор и выдать манипуляцию за подлинник.

Профессор Айдоан Озджан и его команда в UCLA создали гибридную цифро-оптическую систему, нацеленную на решение обеих задач. Сначала лёгкий цифровой кодировщик собирает компактные сведения о каждом видео, включая пространственные, спектральные и временные признаки. Эти данные преобразуются в фазовый шаблон и выводятся на программируемый пространственный модулятор света. Полученный оптический волновой фронт проходит через пассивный оптический декодер на основе свободного пространства, а на выходе парные оптические детекторы напрямую выдают оценку подлинности для каждого ролика. По сути, система заменяет ресурсоёмкую цифровую декодирующую сеть физическим процессом, способным обрабатывать множество потоков параллельно.

В экспериментах с видимым светом процессор одновременно проверял 15 видео из набора Celeb-DF за каждый оптический проход. Средняя точность обнаружения составила 97,79% при чувствительности 99,86% и специфичности 95,72%. Чувствительность показывает, насколько успешно система выявляет подделанные ролики, и столь высокий показатель особенно важен для инструмента, призванного не пропускать фальшивый контент. Значение 99,86% соответствовало средней доле ложноотрицательных результатов около 0,14%, то есть лишь очень малая часть манипулированных видео была ошибочно признана подлинной. Исследователи также увеличили ёмкость системы до 18 роликов за один оптический проход — даже в этом режиме средняя точность обнаружения сохранилась на уровне 96,13%.

Команда выяснила, что процессор можно сделать более мощным, увеличив физическую глубину пассивного оптического декодера без существенного роста энергопотребления и задержки вывода. При добавлении двух оптимизированных пассивных дифракционных слоёв во время тестирования на более сложных манипуляциях точность обнаружения выросла примерно на 6,8%. Такие фазовые дифракционные слои можно изготавливать как пассивные статические оптические структуры или поверхности: они выполняют дополнительные вычисления за счёт дифракции света и не требуют дополнительной электроэнергии во время вывода. Этот подход позволяет добиваться более сложной обработки без тех энергозатрат, которые обычно сопутствуют увеличению цифровых нейросетей.

Исследователи не ограничились классическими дипфейками с подменой лиц и проверили процессор на видео, созданных с помощью модели Google VEO-3. Новые генеративные ИИ-системы способны создавать ролики, лишённые многих очевидных артефактов прежних дипфейк-технологий, что делает их более трудной целью для детекторов, обученных в основном на старых видах манипуляций. После минимальной донастройки оптический процессор достиг точности 94,80% и чувствительности 97,61% на ранее не встречавшихся видео VEO-3. Результаты говорят о том, что подход потенциально способен адаптироваться по мере развития генеративного ИИ.

Оптическая система также продемонстрировала устойчивость к чёрноящичным состязательным атакам и обеспечивает встроенную защиту от атак типа «белый ящик». Частично эта безопасность обусловлена тем, как детектор физически выполняет вычисления: поскольку часть процесса вывода происходит за счёт дифракции, важные параметры оптической модели фактически встроены в аппаратуру. Такие параметры трудно измерить, воспроизвести или обратно спроектировать, что значительно усложняет воссоздание детектора и разработку точно подобранных состязательных изменений для его обхода. Процессор продолжал надёжно работать и при наличии шума изображения, размытия, JPEG-сжатия и экспериментальных смещений. По словам исследователей, эти результаты показывают, как оптические вычисления могут обеспечить более защищённую и надёжную основу для некоторых систем искусственного интеллекта.

Процессор UCLA задуман не как полная замена сложных цифровых детекторов, а как высокочувствительная первая ступень более крупной системы обнаружения. Большие объёмы видео могли бы сначала проходить через параллельный оптический процессор, а контент, признанный подозрительным, затем направлялся бы в более ресурсоёмкие цифровые модели для детальной финальной оценки. Такая схема объединила бы сильные стороны обоих подходов: оптическая обработка даёт параллельную работу, низкое энергопотребление декодера, высокую чувствительность, устойчивость к состязательным атакам и способность адаптироваться к новым генераторам ИИ-видео, тогда как обычные цифровые системы обеспечивают более глубокий анализ при необходимости. По мнению исследователей, это сочетание в перспективе может пригодиться для модерации контента в больших масштабах, проверки подлинности медиа, наблюдения и других критичных для безопасности ИИ-приложений. Авторами работы являются Парниан Гапандар Кашани и доктор Шици Чэнь, внёсшие равный вклад, а также профессор Айдоан Озджан; исследователи связаны с кафедрой электротехники и вычислительной техники UCLA, кафедрой биоинженерии UCLA и Калифорнийским институтом наносистем.