Què és l'Enverinament de Dades?
L'enverinament de dades és un atac contra la integritat dels sistemes d'IA en el qual els atacants comprometen el procés d'entrenament injectant punts de dades maliciosos en el conjunt d'entrenament. A diferència dels atacs d'inferència que ataquen models acabats, els atacs d'enverinament apunten al fonament del model — les dades de les quals aprèn. El model enverinat resultant pot comportar-se normalment per a la majoria d'entrades però està compromès per a entrades especials.
Tipus d'Atacs
Els atacs de backdoor embedding incrusten disparadors ocults en el model — un patró o prefix específic que, quan està present, produeix una sortida predefinida. Els atacs de degradació del rendiment redueixen la precisió general del model sense disparadors específics. Els atacs dirigits influeixen en les prediccions per a classes o individus específics.
Medides de Defensa
Per protegir-se contra l'enverinament de dades: valideu les fonts de dades i implementeu el seguiment de la procedència de les dades. Feu servir mètodes estadístics per detectar anomalies en el conjunt de dades d'entrenament. Implementeu procediments d'entrenament robustos com tècniques de privacitat diferencial. Monitoritzau el comportament del model en busca de patrons anòmals que puguin indicar backdoors.