Что такое data poisoning?
Data poisoning (отравление данных) — это форма атаки, при которой злонамеренный актор манипулирует обучающими данными, чтобы повлиять на поведение модели AI. Это может означать добавление сфальсифицированных примеров, изменение меток (label flipping), удаление ключевых данных или тонкую модификацию существующих записей. Результат — модель, принимающая ошибочные решения в определённых сценариях, сохраняя при этом внешне нормальную общую производительность.
Сценарии угроз
В корпоративной среде data poisoning может затрагивать рекомендательные системы (продвижение конкретных товаров), скоринговые модели (благоприятствование определённым субъектам), системы обнаружения мошенничества (сокрытие паттернов мошенничества) или рекрутинговые модели (внедрение дискриминации). Угроза возрастает, когда организации полагаются на внешние источники данных или краудсорсинг для разметки.
Защита целостности данных
Эффективная защита включает валидацию и санитизацию входных данных, мониторинг распределения данных (data distribution monitoring), техники robust learning, устойчивые к заражённым образцам, аудит происхождения данных и ограничение доступа к обучающему pipeline. Организациям следует внедрить политики управления обучающими данными с полным аудиторским следом и контролем версий датасетов.