Part del contingut d'aquest lloc s'ha creat amb assistència d'IA
Tornar al glossari Seguretat

Enverinament de Models

Atacs adversaris en els quals es introduïxen dades nociues en el procés d'entrenament per manipular el comportament del model.

Què és l'enverinament de models?

L'enverinament de models (Model Poisoning) és un atac contra sistemes d'IA en el qual un atacant introdueix dades nociues o manipulades en el procés d'entrenament. L'objectiu és influir en el model perquè produeixi sortides incorrectes o nociues per a determinades entrades, mentre apareix correcte per a entrades normals.

Tipus d'atac

El atacs de porta de darrere (backdoor) amaguen disparadors en el model que activen comportaments no desitjats davant certes entrades. L'enverinament d'etiquetes manipula les etiquetes d'entrenament per desplaçar els límits de decisió de classe. L'enverinament de dades introdueix exemples cuidadosament construïts que orienten el model en una direcció determinada.

Mesures de protecció

Les empreses es protegeixen mitjançant una validació i filtratge cuidosos de les dades, monitoratge de les fonts de dades d'entrenament, proves de robustesa adversària i detecció d'anomalies en les dades d'entrenament. És especialment important protegir les canonades de dades i verificar els conjunts de dades de tercers.