Časť obsahu tejto stránky bola vytvorená s pomocou AI
Späť na slovník Bezpečnosť

Otrávenie modelu (Model Poisoning)

Otrávenie modelu je typ adversariálneho útoku, pri ktorom útočník injektuje škodlivé trénovacie dáta alebo manipuluje s procesom tréningu s cieľom ovplyvniť správanie AI modelu.

Čo je otrávenie modelu?

Otrávenie modelu (model poisoning) predstavuje vážnu bezpečnostnú hrozbu pre systémy strojového učenia. Útočník cielene kompromituje trénovací proces tak, aby sa výsledný model správal nešpecifikovane – napríklad ignoroval určité vstupy, poskytoval nesprávne odpovede alebo obsahoval skryté backdoor triggery.

Na rozdiel od inferenčných útokov, ktoré cielia na model počas používania, otrávenie zasahuje model počas jeho tvorby.

Typy útokov otrávenia

Data poisoning spočíva v upravení trénovacích dát – pridaní škodlivých vzoriek alebo manipulácii existujúcich labelov. Backdoor útoky zakomponúvajú skrytý trigger (napr. špecifické slovo alebo pixel vzor), ktorý spustí predurčené správanie len keď je prítomný.

Model poisoning je zvlášť nebezpečný pri federated learningu, kde trénujú modely na rozdelených zdrojoch dát, ktoré centrálny server nemôže plne kontrolovať.

Obrana a mitigácia

Obranné stratégie zahŕňajú overovanie trénovacích dát, anomaly detection v distribúciách dát, certifikáciu robustnosti a techniky ako differential privacy. Organizácie by mali implementovať chain-of-custody pre trénovacie datasety a pravidelne auditovať modely na prítomnosť backdoorov.

Súvisiace služby a produkty