FLOT82,34+1,77%CNY Бирж.12,575-0,02%IMOEX2 248,87-1,57%RTSI838,3-1,97%RGBI112,52-0,07%RGBITR768,29-0,04%

НИУ ВШЭ представил в Китае исследование о безопасности нейросетей для анализа видео

Ученые Высшей школы экономики презентавали на международной конференции ChinaMM 2026 в Китае исследование о том, как искажения при передаче видео влияют на работу нейросетей. Авторы предложили новый способ проверять устойчивость таких моделей в условиях, близких к реальному использованию видеосервисов.

Работу представил в Тайюане директор Центра интеллекта машин Института робототехнических систем НИУ ВШЭ Александр Ивченко. Доклад, подготовленный Александром Ивченко, Алексеем Солдатовым, Виктором Минченковым, Владимиром Башуном и Антоном Сергеевым, получил название «Non-Secure VQA: Exploiting Codec Artifacts and Natural Distortions» («Небезопасная VQA: эксплуатация артефактов кодеков и естественных искажений»).

Для демонстрации метода были выбраны модели оценки качества видео, которые, например, используются в YouTube для автоматической оценки качества восприятия пользователей. Такие модели обучались на оценках множества пользователей и должны следовать человеческим шаблонам восприятия.

Обычно устойчивость нейросетей проверяют с помощью специально созданных изменений изображения. Например, в видео или отдельные кадры вносят небольшие изменения, которые человек почти не замечает, и смотрят, насколько сильно меняется ответ модели. Авторы исследования предлагают другой подход: использовать искажения, которые и без специального воздействия возникают при обычной передаче видео по сети. Это могут быть снижение качества изображения при сжатии, потери данных или ошибки во время передачи.

«Основная идея работы заключается в том, чтобы проверять нейросетевые модели в условиях, максимально похожих на реальные. При видеозвонке или просмотре потокового видео изображение меняется из-за сжатия и ограничений сети. Для пользователя такие изменения привычны и приемлемы, но они могут существенно изменять ответы нейросетевых моделей», — отмечает Александр Ивченко.

Исследователи обнаружили, что разные сцены в видео по-разному реагируют на такие изменения. Так, условно статичные сцены без мелких деталей практически не искажаются при небольших потерях в сети и слабо подвержены таким атакам, но сложные сцены, сцены с динамикой приведут к заметному изменению результата. Для проверки нейросетей важно учитывать особенности самого видео, а не только силу внесенного искажения.

Чтобы определить, какие видео наиболее чувствительны к искажениям, авторы разработали набор характеристик сцены. В него входят технические параметры видео, например разрешение, частота кадров и битрейт, а также характеристики изображения: яркость, цвет, контрастность, резкость, особенности движения и многие другие.

На основе этих характеристик исследователи отобрали 270 видеороликов из более чем 40 тысяч, собранных из четырех широко используемых наборов данных. Такой подход позволил получить разнообразную выборку и избежать ситуации, когда в эксперименте оказывается слишком много похожих видео.

На иллюстрациях можно проследить пример «слепой» атаки на нейросетевую модель оценки качества видео UVQ, используемую в YouTube. Слева — исходный кадр: модель оценивает его в 4,007 (из 5). В центре — кадр с сильными, хорошо заметными искажениями: оценка снижается до 3,431 (разница 0,576). Справа — кадр, который визуально почти не отличается от исходного, но из-за естественных искажений при сжатии и передаче видео модель оценивает его еще ниже — 3,380 (разница 0,627). Иллюстрация показывает, что нейросеть может реагировать на малозаметные для человека артефакты сильнее, чем на очевидные дефекты.

Для дальнейших экспериментов ученые создали собственный набор данных NetEmVQA V1. Они воспроизводили разные условия передачи видео по сети: меняли скорость передачи данных и моделировали потерю пакетов. Затем для каждого кадра оценивали, насколько изменилось качество видео и как на это отреагировала нейросетевая модель.

Результаты показали, что разработанный подход позволяет заранее определить, какие части видео наиболее чувствительны к искажениям. Для разделения чувствительных и менее чувствительных данных исследователи получили F1-меру более 95%. Метод также позволяет прогнозировать, насколько оценка качества отдельных кадров будет отличаться от средней оценки видео.

Исследование позволяет не только выявлять чувствительные к искажениям видео. Авторы также рассматривают возможность заранее определять, какие условия передачи данных приведут к нужному изменению оценки нейросети. Такой подход может использоваться для более детального тестирования моделей компьютерного зрения.

Предложенный метод потенциально применим и к другим задачам, в которых нейросети анализируют видео или изображения. Среди них авторы выделяют трекинг объектов и обнаружение дипфейков.

Другие пресс-релизы