Каждая команда специалистов по безопасности обучена отслеживать код в момент его выпуска. Практически никто не обучен отслеживать данные в момент их поступления, и именно это «слепое пятно» и использует уязвимость, связанная с отравлением данных. К тому моменту, когда отравленная модель попадает в производство, уязвимость уже не обнаруживается в процессе проверки кода. Она находится в наборе данных, который никто не проверял за несколько месяцев до этого.
В этом словаре объясняется, что такое отравление данных, как атаки с использованием отравления данных происходят на практике, и почему отравление данных с помощью ИИ стало одним из наиболее распространенных методов. наиболее быстрорастущие риски в эпоху ИИ SDLCи как выглядит реальная защита от этого.
Значение отравления данных #
Отравление данных — это преднамеренное манипулирование данными, используемыми для обучения, тонкой настройки или закладки модели ИИ, с целью заставить модель обучаться неправильно, вести себя так, как хочет злоумышленник, или раскрывать информацию, которую она никогда не должна была раскрывать. Вместо того чтобы атаковать модель после развертывания, злоумышленник атакует исходный материал, из которого построена модель.
Основная идея отравления данных проста и тревожна: модель ИИ заслуживает доверия лишь настолько, насколько надежны данные, на которых она обучалась. Если эти данные искажены, предвзяты или содержат ошибки еще до начала обучения, никакая проверка кода, тестирование или мониторинг во время выполнения не смогут обнаружить скрытую уязвимость, потому что модель работает именно так, как ее (злонамеренно) обучили.
Отравление данных ИИ против традиционных уязвимостей программного обеспечения #
Традиционная система безопасности приложений предполагает, что опасность кроется в коде: некорректная функция, необновленная библиотека, неправильно настроенный сервер. Отравление данных ИИ полностью опровергает это предположение. Нет уязвимой строки кода, которую можно было бы обнаружить, поскольку повреждение произошло в обучающем наборе данных, наборе данных для тонкой настройки или индексе поиска задолго до написания какого-либо кода или развертывания какой-либо модели.
Именно поэтому обнаружение отравления данных ИИ с помощью устаревших инструментов представляет собой исключительную сложность. SAST Сканер считывает код. Сканер зависимостей считывает манифесты пакетов. Ни один из них не считывает многогигабайтный обучающий корпус или векторную базу данных, полную встроенных документов, что является предварительной задачей.cisВ некоторых случаях отравление данных ИИ наносит ущерб. Исследователи в области безопасности ответственно раскрывают информацию об этих угрозах. Другие угрозы обнаруживаются и используются злоумышленниками первыми, что и приводит к наибольшему ущербу.
Как на самом деле работают атаки с использованием отравления данных? #
Атаки с использованием отравления данных обычно принимают одну из нескольких форм:
- Отравление обучающих данныхЗлоумышленник вставляет в набор данных, используемый для обучения модели с нуля или тонкой настройки существующей, измененные, неправильно помеченные или вредоносные примеры, заставляя модель распознавать скрытые предубеждения или использовать бэкдор.
- Переворачивание этикеток: более тонкая версия описанного выше, когда злоумышленник изменяет только метки в небольшом подмножестве обучающих примеров, незаметно искажая то, что модель учится связывать с чем.
- RAG и отравление контекстаВ системах генерации с расширенными возможностями поиска злоумышленник внедряет вредоносные документы в базу знаний или хранилище векторов, из которых модель извлекает информацию во время выполнения, так что модель уверенно повторяет ложную или искаженную информацию, как если бы это был проверенный факт.
- Запуск бэкдора: злоумышленник внедряет определенная закономерность в обучающих данных Таким образом, модель ведет себя нормально почти во всех случаях, но выдает выбранный злоумышленником результат в тот момент, когда появляется скрытая триггерная фраза или входные данные.
- Отравление цепочки поставок: Злоумышленник скомпрометирует общедоступный или совместно используемый набор данных. контрольная точка предварительно обученной модели или встраивание pipeline вверх по течению, так что каждая команда, берущая из него энергию, наследует яд, не затрагивая при этом первоначальную атаку.
Все эти атаки с использованием отравления данных объединяет фактор времени. Ущерб наносится еще до того, как модель ответит реальному пользователю, именно поэтому фраза «прежде чем она напишет хотя бы одну строку кода» так точно описывает эту угрозу.cisЭли: модель скомпрометирована в своей основе, а не на выходе.
Как злоумышленники повреждают модель ИИ еще до того, как она напишет хотя бы одну строку кода? #
Все описанные выше атаки с отравлением данных обладают одним и тем же преимуществом во времени: компрометация происходит на более раннем этапе, задолго до того, как модель сгенерирует хотя бы один результат, который увидит пользователь. Нет уязвимой функции, которую нужно было бы исправлять, и нет вредоносного кода. commit Это нужно проверить, потому что модель еще ничего не написала. Она только обучалась, и то, чему она научилась, уже неверно.
Именно это принципиально отличает отравление данных ИИ от уязвимостей, которые обучены выявлять команды специалистов по безопасности приложений. Модель с бэкдором выглядит идентично чистой модели в сравнении кода. Она проходит проверку. pull request Обзор. Он компилирует, развертывает и корректно отвечает на большинство запросов, вплоть до того момента, когда в продакшене наконец-то проявляется конкретное условие, созданное злоумышленником. К тому времени вопрос уже не в том, «какой код это вызвал», а в том, «какие данные это сделали и как далеко в прошлое это простирается».
Почему проблема отравления данных искусственным интеллектом становится все более актуальной? #
Отравление данных ИИ больше не является теоретической проблемой. Это официально признано как LLM04: Отравление данных и моделей Входит в топ-10 OWASP для приложений LLM, занимая место рядом с быстрой инъекцией и рисками в цепочке поставок как одна из определяющих угроз эры генеративного ИИ. Три тенденции выводят её на более высокий уровень в поле зрения каждой команды специалистов по безопасности:
- Повреждения незаметны до тех пор, пока не проявятся. Заражённая модель может пройти все функциональные тесты и безупречно работать в течение нескольких месяцев, пока в производственной среде наконец не появится конкретное условие, установленное злоумышленником.
- Генерация с расширенными возможностями поиска информации распространена повсеместно. Любая система, позволяющая модели извлекать контекст в реальном времени из документов, вики-страниц, заявок или векторной базы данных, имеет новую, непроверенную входную поверхность, и именно эта поверхность является целью атак, направленных на отравление данных.
- В настоящее время наборы данных являются активами цепочки поставок. Команды регулярно загружают предварительно обученные модели, эмбеддинги и общедоступные наборы данных из внешних источников так же, как и пакеты с открытым исходным кодом, и, подобно скомпрометированному пакету, скомпрометированный набор данных может незаметно распространить атаку на каждую команду, которая его использует.
Выявление и защита от отравления данных #
Поскольку отравление данных происходит на более ранних этапах, чем сама модель, защита также должна начинаться на более ранних этапах:
- Обращайте внимание не только на аномальный код, но и на источники аномальных данных. Обнаружение поведенческих аномалий и выявление неполадок должны распространяться на все этапы, до момента поступления данных. pipelineне останавливаться на границе репозитория.
- Изучите каждый набор данных в pipeline. Невозможно провести аудит риска отравления в наборе данных, о существовании которого вы не знаете. Непрерывный поиск обучающих, оценочных и поисковых наборов данных является первой линией защиты.
- Проследите цепочку событий от набора данных к модели и к результату. Отображение пути, который проходит набор данных до модели, и от модели до агента, конечной точки или инструмента программирования, превращает фразу «мы получили некорректный результат» в «мы точно знаем, какой набор данных привел к этому».
- Тщательно изучайте источники поиска, а не только обучающие наборы данных. В системах RAG хранилище векторов и база знаний нуждаются в тех же проверках целостности, что и обучающие данные, поскольку искажение контекста происходит во время выполнения запроса, а не во время обучения.
Как Xygeni помогает преодолеть проблему отравления данных? #
Защита от отравления данных начинается с обеспечения прозрачности, которой большинство организаций просто не обладают. Xygeni'Система s AI Inventory непрерывно обнаруживает все ресурсы ИИ по всей системе. SDLCвключая лежащие в его основе наборы данных: обучающие данные, оценочные наборы и источники RAG или поиска, и отображает их в интерактивный граф взаимосвязей, идущий от набора данных к модели и к конечной точке. агенту на сервер MCP к инструменту кодирования. Именно этот график превращает подозрительный результат работы модели в вопрос, который можно отследить: какой набор данных послужил основой для этого и откуда он взялся.
Помимо этого ассортимента, в Xygeni также есть AI Безопасность Обнаруживает уязвимости векторов и встраиваний, включая искаженный контекст при поиске и RAG. pipelineс, выровненные по Список 10 лучших приложений для получения степени магистра права (LLM) по версии OWASP. Вместо того чтобы полагаться на чистоту источников обучения и извлечения данных для модели, Xygeni рассматривает их как часть поверхности атаки, точно так же, как он уже обрабатывает код, зависимости и pipelineЕсли вы в данный момент не можете ответить на вопрос «на каких данных была обучена эта модель, и можем ли мы это доказать», то именно этот пробел стоит заполнить, прежде чем инцидент с отравлением данных в ИИ заставит вас задать этот вопрос.
FAQ #
Отравление данных в ИИ — это искажение или манипулирование данными, на которых обучается модель (обучающими данными, данными для тонкой настройки или контекстом поиска), в результате чего модель выдает результаты, искаженные злоумышленниками или ненадежные.
Нет. Внедрение подсказок манипулирует поведением модели во время запроса посредством специально сформированных входных данных. Отравление данных искажает исходные данные, на которых обучалась модель или которые она извлекала, поэтому ущерб закладывается еще до отправки каких-либо подсказок.
Да. В системах генерации с расширенными возможностями поиска злоумышленник может исказить документы или базу данных векторов, из которых модель получает данные во время выполнения, добившись аналогичного эффекта, не затрагивая исходный обучающий набор данных.
Потому что она находится в данных, а не в коде. Традиционные инструменты безопасности приложений сканируют исходный код и манифесты зависимостей, а не многогигабайтные обучающие наборы данных или хранилища векторов, поэтому атаки с отравлением данных часто остаются незамеченными инструментами, созданными для модели угроз, ориентированной на код.
Любая организация, занимающаяся тонкой настройкой моделей на внутренних или сторонних данных, использующая генерацию с расширением поиска или извлекающая предварительно обученные модели и наборы данных из общедоступных источников, уязвима, поскольку каждый из этих способов является точкой входа для отравления данных.
