Časť obsahu tejto stránky bola vytvorená s pomocou AI
Späť na slovník Bezpečnosť

Adversarialné utoky na AI

Adversariálne útoky zneužívajú zraniteľnosti v AI modeloch tým, že vytvárajú vstupy navrhnuté na spôsobenie chybnej klasifikácie alebo neočakávaného správania.

Čo sú adversariálne útoky?

Adversariálne útoky sú zámerné manipulácie so vstupnými dátami navrhnuté tak, aby spôsobili AI modelom produkciu nesprávnych výstupov. Zavedením starostlivo vytvorených perturbácií — často pre ľudí nepostrehnuteľných — môžu útočníci spôsobiť klasifikátorom obrázkov chybnú identifikáciu objektov, oklamať modely prirodzeného jazyka na generovanie škodlivého obsahu alebo úplne obísť bezpečnostné systémy.

Typy adversariálnych útokov

Útoky white-box predpokladajú plnú znalosť architektúry modelu a váh, umožňujúce presné perturbácie na základe gradientu. Útoky black-box fungujú bez prístupu k modelu, využívajúce prenosové útoky alebo metódy založené na dotazovaní. Útoky úniku modifikujú vstupy v čase inferencie, zatiaľ čo útoky otrávením dát poškodzujú trénovacie dáta.

Obrana podnikových AI systémov

Robustná obrana vyžaduje vrstvený prístup. Adversariálne trénovanie vystavuje modely príkladom útokov počas trénovania. Metódy pred-spracovania vstupov môžu neutralizovať perturbácie. Pre podnikové nasadenia by malo byť pravidelné adversariálne testovanie integrované do životného cyklu vývoja AI.

Súvisiace služby a produkty