Деякий контент на цьому сайті був створений з допомогою штучного інтелекту
Повернутися до словника Безпека

Атаки адверсарні на AI

Метою маніпулювання даними введення системи AI є викликання неправильних прогнозів або обхід механізмів безпеки.

На чому полягають атаки адверсарні?

Атаки адверсарні (adversarial attacks) - це техніки цілового маніпулювання даними введення моделі AI, щоб вимусити неправильну роботу. Атакуючий вводить субтільні, часто непомітні для людини перебудови — наприклад, зміну декількох пікселів на зображенні — які спричиняють, що модель класифікує дані неправильно з високою певністю. Ці атаки розкривають фундаментальну хрупкість багатьох архітектур машинного навчання.

Типи атак

Виходять атаки білокоробкові (атакуючий знає архітектуру моделі) та чорнокоробкові (брак інформації про модель). До найпоширеніших технік належать: FGSM (Fast Gradient Sign Method), PGD (Projected Gradient Descent), атаки трансферові (експлуатація одного моделі діє на інший) та атаки evasion (оминання виявлення). У контексті мовних моделей популярні prompt injection та jailbreaking.

Захист систем підприємства

Оборона від атак адверсарних вимагає багаторівневого підходу: тренування адверсарне (аугментація даних прикладами атаки), сертифікована стійкість (доказова стійкість), виявлення аномалій на вході, валідация прогнозів та моніторинг поведінки моделі. У виробничому середовищі ключовим є постійне тестування стійкості моделей та впровадження процедур реагування на інциденти, пов'язані з маніпуляцією AI.

Пов'язані послуги та продукти