Некоторый контент на этом сайте был создан с помощью AI
Вернуться к словарю Безопасность

AI Red Teaming

Тестирование безопасности систем AI путём симуляции атак — выявление уязвимостей, обхода guardrails и способов манипуляции моделью.

Что такое AI Red Teaming?

AI Red Teaming — это практика тестирования безопасности систем искусственного интеллекта путём симуляции состязательных атак. Команда red team пытается: обойти guardrails модели, вынудить генерацию вредоносного контента, извлечь обучающие данные, манипулировать результатами и найти эксплойты prompt injection.

Почему это обязательно?

AI Act налагает на поставщиков систем AI высокого риска обязанность тестирования устойчивости (ст. 9). Даже без регулирования red teaming — самый эффективный метод выявления уязвимостей до промышленного внедрения — значительно дешевле, чем обработка инцидента постфактум.

Техники red teaming AI

Ключевые техники: prompt injection (внедрение инструкций во входные данные), jailbreaking (обход ограничений модели), data extraction (извлечение фрагментов обучающих данных), adversarial inputs (модифицированные входные данные, вызывающие ошибочные результаты) и model inversion (восстановление обучающих данных из модели).

Связанные понятия

Связанные услуги и продукты