Некоторый контент на этом сайте был создан с помощью AI
Вернуться к словарю Безопасность

Model poisoning (отравление модели)

Атака, заключающаяся в целенаправленном заражении процесса обучения модели AI с целью внедрения скрытых уязвимостей.

Что такое model poisoning?

Model poisoning (отравление модели) — это атака на этапе обучения, при которой злонамеренный актор манипулирует процессом обучения, чтобы модель приобрела нежелательное поведение. В отличие от состязательных атак на этапе инференса, model poisoning нацелен на сами веса и параметры модели. Отравленные модели могут работать корректно в большинстве сценариев, активируя злонамеренное поведение только при определённых условиях (backdoor).

Векторы атаки

Наиболее распространённые векторы включают: манипуляцию обучающими наборами (внедрение злонамеренных примеров), компрометацию учебного pipeline, модификацию предобученных моделей, распространяемых публично, и атаки на федеративное обучение (federated learning), где участники могут передавать отравленные обновления градиентов. Особенно опасны атаки типа trojan/backdoor, где модель реагирует на специфический триггер, незаметный при нормальном использовании.

Стратегии защиты

Защита требует контроля целостности обучающих данных, аудита происхождения моделей и датасетов, техник обнаружения бэкдоров (neural cleanse, activation clustering) и изоляции обучающей среды. В корпоративных организациях критично важно проверять источники предобученных моделей, применять криптографические подписи и регулярно тестировать модели на предмет скрытого поведения.

Связанные услуги и продукты