Деякий контент на цьому сайті був створений з допомогою штучного інтелекту
Повернутися до словника Безпека

Отруєння моделі

Атака, що полягає у ціловому забрудненні процесу навчання моделі AI з метою введення прихованих вразливостей.

Що таке отруєння моделі?

Отруєння моделі (model poisoning) - це атака на етапі тренування, під час якої зловмисний актор маніпулює процесом навчання, щоб модель набула небажаних поведінок. На відміну від атак адверсарного типу на етапі інференсу, отруєння моделі націлюється на самі ваги та параметри моделі. Отруєні моделі можуть працювати правильно в більшості сценаріїв, активуючи зловмисну поведінку тільки в певних умовах (бекдор).

Вектори атаки

Найпоширеніші вектори включають: маніпуляцію навчальними даними (введення зловмисних прикладів), компрометацію пайплайну тренування, модифікацію попередньо натренованих моделей, що публічно доступні, та атаки на федеративне навчання (federated learning), де учасники можуть передавати отруєні оновлення градієнтів. Особливо небезпечними є атаки типу троян/бекдор, де модель реагує на певний тригер, який не помітний у нормальному використанні.

Стратегії захисту

Захист вимагає контролю цілісності навчальних даних, аудиту походження моделей і наборів даних, технік виявлення бекдорів (нейронна очистка, кластеризація активації) та ізоляції середовища тренування. У підприємствах ключовим є верифікація джерел попередньо натренованих моделей, застосування криптографічних підписів та регулярне тестування моделей на наявність прихованих поведінок.