¿Qué son os Ataques Adversarios?
Os ataques adversarios son técnicas nas que entradas coidadosamente deseñadas fan que os modelos de IA produzan saídas incorrectas ou non desexadas. Na visión por computador, modificacións mínimas de píxeles, invisibles para os humanos, poden facer que unha imaxe se clasifique incorrectamente. Nos modelos de linguaxe, os ataques de inxección de prompt poden eludir as salvagardas de seguridade. Estas vulnerabilidades son especialmente preoccupantes para aplicacions críticas de seguridade.
Tipos de Ataques
Os ataques de evasión manipulan as entradas no momento da inferencia para provocar unha clasificación errónea. Os ataques de envelenamento danan o modelo inxectando datos maliciosos no conxunto de adestramento. Os ataques de backdoor adestran modelos para producir saídas predefinidas cando se activan certos disparadores. Os ataques de inversión de modelos intentan extraer información sobre os conxuntos de adestramento dos modelos.
Estratexias de Defensa
As empresas deben realizar avaliacións de robustez adversarial como parte da súa estratexia de seguridade IA. As técnicas inclúen: adestramento adversarial, validación e saneamento de entradas, métodos de ensemble, monitorización de saídas en busca de patróns anómalos e exercicios de red teaming. Os sistemas IA en aplicacions de alto risco necesitan mecanismos de defensa especialmente robustos.