Механика обмана
В 2013-м году группа исследователей из Калифорнийского университета в Беркли опубликовала работу, которая заставила научное сообщество пошевелиться. Они показали, что если добавить к изображению тигрису — почти невидимой для человеческого глаза картинке, состоящей из случайного шума с амплитудой 0,01 пикселя — нейросеть с вероятностью 98% распознает её как «тигр». Человек видит просто размытое пятно или животное на грани между кошкой и полосатым зверем. Компьютер видит тигра, потому что его обучение строилось на данных, где определённые математические закономерности в распределении яркости пикселей коррелируют с категорией «тигр», но не совпадают с тем, как мозг человека интерпретирует изображение.
После этого исследования термин adversarial examples (примеры противника) вошёл в оборот. Атаки стали изучать всерьёз: сначала на фотографиях кошек и собак, потом на медицинских снимках МРТ, затем — на транзакционных данных банковских систем. В 2024–2025 годах фокус сместился на модели, которые работают в реальном времени: системы распознавания лиц для доступа к смартфону, автопилоты на электромобилях, фильтры контента в соцсетях.
Проблема не в том, что нейросети «глупые». Проблема в том, что они оптимизированы под другую цель. Задача обучения — минимизировать функцию потерь на обучающей выборке. Это означает: найди такое отображение из пространства признаков в пространство классов, чтобы ошибки были минимальны. При этом модель не знает ничего о причинно-следственных связях между объектами и их визуальными характеристиками. Она просто запоминает статистические зависимости. А злоумышленник может использовать это незнание.
Виды уязвимостей
Существует несколько типов атак, каждый из которых имеет свои уникальные характеристики и методологию. Самые простые — это «White Box» и «Black Box». «White Box» соответствует случаю, когда злоумышленник имеет полное представление о модели машинного обучения, включая её архитектуру и параметры. В отличие от этого, атаки «Black Box» когда злоумышленник имеет ограниченные знания о модели или не имеет их вовсе, и для создания примеров противника ему приходится полагаться на метод проб и ошибок. Атаки «Black Box» наиболее приближены к реальности: вы не знаете весов слоя, но можете подбирать входные данные так, чтобы получить нужный результат.
Targeted атаки направлены на достижение определённого результата — например, неправильную классификацию изображения как определённого класса. Untargeted атаки направлены на то, чтобы просто заставить модель выдать неверный результат, без указания желаемого результата. В первом случае злоумышленник хочет превратить изображение кота в собаку. Во втором — он хочет просто убедить модель, что это не кошка, какая бы классификация ни получилась.
Различия атак по типам данных тоже важны. Модели классификации изображений могут быть атакованы с помощью adversarial примеров, которые визуально похожи на исходное изображение, но были незначительно изменены, чтобы привести к неверной классификации. Аналогичным образом, модели классификации текста могут быть атакованы с помощью adversarial примеров, чтобы заставить модель выдать другой результат. Например, добавление одного символа в запрос к API может изменить ответ от «доступ разрешён» до «запрещено».
Где это происходит на самом деле
Опасности атак не остаются только в лабораториях. В 2017 году исследователи из Стэнфорда продемонстрировали, что наклейки на лобовое стекло автомобиля могут заставить систему автопилота думать, что светофор красный, тогда как он зелёный. Небольшие полоски краски или стикеры меняют пиксели изображения так, что модель классифицирует их как стоп-знак. В реальности это приводит к аварийной остановке машины на перекрёстке.
Финансовые потери — ещё одна сфера применения. Adversarial attacks могут привести к финансовым потерям для организаций и частных лиц за счёт манипулирования моделями машинного обучения с целью получения неверных результатов, в результате чего финансовые операции или инвестиции осуществляются на основе неверных данных. Например, алгоритм кредитования может быть подманиван так, чтобы он одобрял заявку негодному клиенту или отказывал честному. Это достигается внесением изменений в документы, которые человек не заметит, но модель «увидит» как признаки определённого типа документов.
Подрыв доверия общества к машинному обучению — третья проблема. Adversarial attacks могут также подорвать доверие общества к моделям машинного обучения и их способности принимать точные и достоверные решения. Это может иметь далекоидущие последствия для развития и внедрения машинного обучения в различных отраслях. Если люди поймут, что ИИ можно обмануть, они начнут относиться к нему скептически. А это замедлит развитие технологий, которые уже сейчас помогают диагностировать болезни, оптимизировать логистику и предсказывать климатические изменения.
Как защищают нейросети
Защита от Adversarial attacks является важным аспектом обеспечения безопасности и точности моделей машинного обучения. Ключевые методы защиты следующие:
Adversarial Training — это метод, который включает в себя генерацию adversarial примеров и включение их в процесс обучения, чтобы сделать модель более устойчивой к атакам противника. Это помогает повысить точность модели и снизить её уязвимость к adversarial attacks. По сути, модель обучают на данных, которые заранее подделаны, чтобы она «знала» эти подделки и не ошибалась при встрече с ними в production.
Ансамбли моделей. Этот метод подразумевает объединение прогнозов нескольких моделей для повышения надёжности и точности. В случае adversarial attacks ансамбли моделей могут помочь снизить воздействие атак путем усреднения прогнозов нескольких моделей, что затрудняет злоумышленникам манипулировать уязвимостями отдельной модели. Если одна модель ошибается из-за специфики её весов, другая может не ошибиться.
Дизайн обучения модели. Встраивание таких техник, как DropOut, позволяет сделать модель более устойчивой к атакам, а также аугментации входных данных. DropOut — это техника, при которой во время обучения случайно отключаются некоторые нейроны. Это заставляет модель не полагаться на отдельные признаки слишком сильно и делает её более общей. Аугментация — это искусственное расширение обучающей выборки путём преобразований изображений или текста: повороты, сдвиги, добавление шума.
Проблемы робастности в 2026 году
К 2025–2026 годам проблема робастности (устойчивости) нейросетей перестала быть чисто академической. В середине 2010-х годов в области состязательного машинного обучения начали изучать, как можно обмануть модели. Например, существуют методы, которые позволяют находить уязвимости в распознавании лиц, используемых для разблокировки смартфонов или контроля доступа на предприятиях. Злоумышленник может сфотографировать человека со смартфона и использовать это изображение для обхода системы безопасности.
В 2024–2025 годах AI4Science достиг системного уровня генерации новых материалов и лекарств, но здесь тоже есть риски. Модели, предсказывающие стабильность молекул или токсичность веществ, могут быть атакованы так, чтобы они предлагали синтез опасных соединений. Это требует дополнительных проверок и валидаций перед внедрением в промышленность.
Суперкомпьютеры Aurora и El Capitan, запущенные в 2024–2025 годах, позволяют обучать модели с миллиардами параметров, но это не решает проблему уязвимостей. Большие модели могут быть ещё более чувствительны к adversarial примерам из-за их сложности. Чем больше слоев и нейронов, тем сложнее найти глобальный минимум функции потерь, и тем выше вероятность, что модель «запомнит» специфические закономерности, которые можно использовать против неё.
Итоги
Нейросети не идеальны. Малейшее изменение пикселей или буквы может заставить модель сделать неверный вывод. Это не баг, а особенность архитектуры глубокого обучения, которая оптимизируется под статистику данных, а не под причинно-следственные связи. Уязвимости можно уменьшить с помощью adversarial training и ансамблей моделей, но полностью устранить их нельзя. Пока что.
Вопрос «а что бы сделал ты на месте разработчика ИИ» — не риторический. Ровно то же самое сейчас происходит с десятком компаний, чьи продуктами мы пользуемся ежедневно: они знают о рисках, но боятся останавливать развитие из-за потери конкурентных позиций. Читатель сам решит, стоит ли ему доверять системе распознавания лиц на входе в офис или лучше использовать традиционную биометрию по отпечатку пальца.