Деякий контент на цьому сайті був створений з допомогою штучного інтелекту
Повернутися до словника Безпека

AI Червоне командування

Перевірка безпеки систем штучного інтелекту шляхом симуляції атак — виявлення вразливостей, обхідних шляхів та способів маніпулювання моделлю.

Що таке AI Red Teaming?

AI Red Teaming — це практика тестування безпеки систем штучного інтелекту шляхом симуляції атакових дій. Команда red team намагається: обійти обмеження моделі, змусити генерацію шкідливих контентів, витягнути навчальні дані, маніпулювати результатами та знайти уразливості prompt injection.

Чому це потрібно?

AI Act накладає на постачальників систем AI високого ризику обов'язок тестування стійкості (стаття 9). Навіть без регуляцій, red teaming — це найефективніший метод виявлення уразливостей до впровадження продукту — значно дешевше, ніж обробка інциденту після факту.

Техніки red teamingu AI

Ключові техніки: prompt injection (введення інструкцій у вхідні дані), jailbreaking (обхід обмежень моделі), data extraction (витягнення фрагментів навчальних даних), adversarial inputs (змодифіковані вхідні дані, які викликають неправильні результати) і model inversion (відтворення навчальних даних з моделі).