Què és l'enverinament de models?
L'enverinament de models (Model Poisoning) és un atac contra sistemes d'IA en el qual un atacant introdueix dades nociues o manipulades en el procés d'entrenament. L'objectiu és influir en el model perquè produeixi sortides incorrectes o nociues per a determinades entrades, mentre apareix correcte per a entrades normals.
Tipus d'atac
El atacs de porta de darrere (backdoor) amaguen disparadors en el model que activen comportaments no desitjats davant certes entrades. L'enverinament d'etiquetes manipula les etiquetes d'entrenament per desplaçar els límits de decisió de classe. L'enverinament de dades introdueix exemples cuidadosament construïts que orienten el model en una direcció determinada.
Mesures de protecció
Les empreses es protegeixen mitjançant una validació i filtratge cuidosos de les dades, monitoratge de les fonts de dades d'entrenament, proves de robustesa adversària i detecció d'anomalies en les dades d'entrenament. És especialment important protegir les canonades de dades i verificar els conjunts de dades de tercers.