¿O que é o Envelenamento de Datos?
O envelenamento de datos é un ataque contra a integridade dos sistemas de IA no que os atacantes comprometen o proceso de adestramento inxectando puntos de datos maliciosos no conxunto de adestramento. A diferenza dos ataques de inferencia que atacan modelos terminados, os ataques de envelenamento apuntan ao fundamento do modelo — os datos dos que aprende. O modelo envelenado resultante pode comportarse normalmente para a maioría dos inputs pero está comprometido para entradas especiais.
Tipos de Ataques
Os ataques de backdoor embedding incrustan disparadores ocultos no modelo — un patrón ou prefixo específico que, cando está presente, produce unha saída predefinida. Os ataques de degradación do rendemento reducen a precisión xeral do modelo sen disparadores específicos. Os ataques dirixidos inflúen nas predicións para clases ou individuos específicos.
Medidas de Defensa
Para protexerse contra o envelenamento de datos: valide as fontes de datos e implemente o seguimento da procedencia dos datos. Use métodos estatísticos para detectar anomalías no conxunto de datos de adestramento. Implemente procedementos de adestramento robustos como técnicas de privacidade diferencial. Monitorice o comportamento do modelo en busca de patróns anómalos que poidan indicar backdoors.