Čo sú adversariálne útoky?
Adversariálne útoky sú zámerné manipulácie so vstupnými dátami navrhnuté tak, aby spôsobili AI modelom produkciu nesprávnych výstupov. Zavedením starostlivo vytvorených perturbácií — často pre ľudí nepostrehnuteľných — môžu útočníci spôsobiť klasifikátorom obrázkov chybnú identifikáciu objektov, oklamať modely prirodzeného jazyka na generovanie škodlivého obsahu alebo úplne obísť bezpečnostné systémy.
Typy adversariálnych útokov
Útoky white-box predpokladajú plnú znalosť architektúry modelu a váh, umožňujúce presné perturbácie na základe gradientu. Útoky black-box fungujú bez prístupu k modelu, využívajúce prenosové útoky alebo metódy založené na dotazovaní. Útoky úniku modifikujú vstupy v čase inferencie, zatiaľ čo útoky otrávením dát poškodzujú trénovacie dáta.
Obrana podnikových AI systémov
Robustná obrana vyžaduje vrstvený prístup. Adversariálne trénovanie vystavuje modely príkladom útokov počas trénovania. Metódy pred-spracovania vstupov môžu neutralizovať perturbácie. Pre podnikové nasadenia by malo byť pravidelné adversariálne testovanie integrované do životného cyklu vývoja AI.