Part del contingut d'aquest lloc s'ha creat amb assistència d'IA
Tornar al glossari Seguretat

Atacs Adversaris a la IA

Atacs que enganyen o manipulin sistemes de IA mitjançant entrades cuidadosament construïdes per produir sortides incorrectes o comportament no desitjat.

Què són els Atacs Adversaris?

Els atacs adversaris són tècniques en les quals entrades cuidadosament dissenyades fan que els models de IA produeixin sortides incorrectes o no desitjades. En la visió per computadora, modificacions mínimes de píxels, invisibles per als humans, poden fer que una imatge es classifiqui incorrectament. En els models de llenguatge, els atacs d'injecció de prompt poden eludir les salvaguardes de seguretat. Aquestes vulnerabilitats són especialment preocupants per a aplicacions crítiques de seguretat.

Tipus d'Atacs

Els atacs d'evasió manipulen les entrades en el moment de la inferència per provocar una classificació errònia. Els atacs d'enverinament danyen el model injectant dades malicioses en el conjunt d'entrenament. Els atacs de backdoor entrenen models per produir sortides predefinides quan s'activen certs disparadors. Els atacs d'inversió de models intenten extreure informació sobre els conjunts d'entrenament dels models.

Estratègies de Defensa

Les empreses han de realitzar avaluacions de robustesa adversària com a part de la seva estratègia de seguretat IA. Les tècniques inclouen: entrenament adversari, validació i sanejament d'entrades, mètodes d'ensemble, monitorització de sortides en busca de patrons anòmals i exercicis de red teaming. Els sistemes IA en aplicacions d'alt risc necessiten mecanismes de defensa especialment robustos.

Serveis i productes relacionats