На чому полягають атаки адверсарні?
Атаки адверсарні (adversarial attacks) - це техніки цілового маніпулювання даними введення моделі AI, щоб вимусити неправильну роботу. Атакуючий вводить субтільні, часто непомітні для людини перебудови — наприклад, зміну декількох пікселів на зображенні — які спричиняють, що модель класифікує дані неправильно з високою певністю. Ці атаки розкривають фундаментальну хрупкість багатьох архітектур машинного навчання.
Типи атак
Виходять атаки білокоробкові (атакуючий знає архітектуру моделі) та чорнокоробкові (брак інформації про модель). До найпоширеніших технік належать: FGSM (Fast Gradient Sign Method), PGD (Projected Gradient Descent), атаки трансферові (експлуатація одного моделі діє на інший) та атаки evasion (оминання виявлення). У контексті мовних моделей популярні prompt injection та jailbreaking.
Захист систем підприємства
Оборона від атак адверсарних вимагає багаторівневого підходу: тренування адверсарне (аугментація даних прикладами атаки), сертифікована стійкість (доказова стійкість), виявлення аномалій на вході, валідация прогнозів та моніторинг поведінки моделі. У виробничому середовищі ключовим є постійне тестування стійкості моделей та впровадження процедур реагування на інциденти, пов'язані з маніпуляцією AI.