Pochopenie otrávenia dát
Otrávenie dát je technika útoku, kde útočníci zámerne zavádzajú poškodené, nesprávne označené alebo škodlivé vzorky do trénovacej dátovej sady AI systému. Pretože modely strojového učenia sa priamo učia vzory z dát, aj malé percento otrávených vzoriek môže významne zmeniť správanie modelu. Tieto útoky sú zvlášť nebezpečné, pretože nastávajú pred trénovaním.
Bežné vzory útoku
Útoky prevrátením štítkov menia štítky trénovacích príkladov na spôsobenie systematickej chybnej klasifikácie. Útoky čistými štítkami vkladajú správne označené, ale adversariálne vytvorené príklady, ktoré posúvajú rozhodovacie hranice. Útoky na dostupnosť degradujú celkový výkon modelu vkladaním šumu.
Podnikové zmierňovanie
Obrana proti otráveniu dát vyžaduje prísnu správu dát v celom životnom cykle AI. Sledovanie proveniencie dát zabezpečuje, že každá trénovacia vzorka má overený zdroj. Techniky detekcie štatistických odľahlých hodnôt a sanitácie dátovej sady môžu identifikovať anomálne vzorky pred trénovaním.