Parte do contido deste sitio creouse con asistencia de IA
Volver ao glosario Seguridade

Envelenamento de Modelos

Ataques adversarios nos que se introducen datos daniños no proceso de adestramento para manipular o comportamento do modelo.

¿O que é o envelenamento de modelos?

O envelenamento de modelos (Model Poisoning) é un ataque contra sistemas de IA no que un atacante introduce datos daniños ou manipulados no proceso de adestramento. O obxectivo é influír no modelo para que produza saídas incorrectas ou daniñas para determinadas entradas, mentres aparece correcto para entradas normais.

Tipos de ataque

Os ataques de porta traseira (backdoor) agochan disparadores no modelo que activan comportamentos non desexados ante certas entradas. O envelenamento de etiquetas manipula as etiquetas de adestramento para desprazar os límites de decisión de clase. O envelenamento de datos introduce exemplos cuidadosamente construídos que orientan o modelo nunha dirección determinada.

Medidas de protección

As empresas protéxense mediante unha validación e filtrado coidadosos dos datos, monitorización das fontes de datos de adestramento, probas de robustez adversarial e detección de anomalías nos datos de adestramento. É especialmente importante protexer os pipelines de datos e verificar os conxuntos de datos de terceiros.