Cabecera blog ciberseguridad

Técnicas de envenenamiento de IA

Las técnicas de envenenamiento de IA suponen un peligro para las compañías

Las técnicas de envenenamiento de IA son sofisticadas y pueden permitir a los atacantes manipular el comportamiento de una IA y realizar ataques contra compañías

¿Es posible manipular las recomendaciones de una Inteligencia Artificial? Lo cierto es que sí. Recientemente, Microsoft hizo público que se había conseguido que herramientas de IA promocionaran a determinadas empresas de forma ilegítima. ¿Cómo? Mediante una técnica de envenenamiento del contexto de un agente de IA, que busca introducir comandos de persistencia en su memoria.

Este caso evidencia que ya se están desplegando técnicas de envenenamiento de IA con fines espurios como desplegar una táctica de marketing tramposa o atacar a las compañías que le sacan partido a la tecnología clave de esta era.

De hecho, MITRE ATLAS, el framework desarrollado por la organización sin ánimo de lucro MITRE, ya recoge varias técnicas de envenenamiento de IA vinculadas a tácticas como el desarrollo de recursos, la preparación del ataque al modelo o la persistencia en los sistemas de IA atacados.

A continuación, vamos a repasar algunas de las técnicas de envenenamiento de IA más peligrosas y que pueden generar graves incidentes de seguridad en las compañías que desarrollan sus propias herramientas de IA o que emplean agentes de IA de terceros.

Para ello, vamos a sistematizar las técnicas de envenenamiento de IA en función de las tácticas maliciosas a las que están vinculadas. Además, vamos a abordar la forma de mitigarlas.

1. Desarrollo de recursos

Una de las tácticas empleadas por los actores maliciosos para atacar sistemas de IA es obtener recursos que les ayuden a respaldar sus ataques en algunas de las fases de su ciclo de vida, como la preparación de los ataques. ¿De qué forma? Creándolos, adquiriéndolos o robando recursos de terceros.

Una de las técnicas de envenenamiento de IA empleadas para ejecutar esta táctica es la publicación de artefactos de IA envenenados.

1.1. Publicación de artefactos de IA envenenados

¿En qué consiste esta técnica? Los actores maliciosos crean o modifican conjuntos de datos, modelos o herramientas de agentes de IA que contienen contenido, código o configuraciones maliciosas y los hacen públicos para que sus potenciales víctimas los adquieran o los integren en sus sistemas.

El objetivo de estos artefactos de IA envenenados es facilitar el compromiso de sistemas de IA a través de un ataque de cadena de suministro de IA.

Como sucede con otras técnicas de envenenamiento de IA, podemos dividir la publicación de artefactos de IA envenenados en tres subtécnicas:

  1. Publicación de conjuntos de datos contaminados que se pueden emplear para entrenar modelos o realizar su ajuste fino. Los conjuntos de datos pueden tener etiquetas, anotaciones o metadatos manipulados por los actores maliciosos. De tal forma que se consiga menoscabar el proceso de entrenamiento del modelo de IA.
  2. Publicación de modelos de IA envenenados en registros de modelos o repositorios de código. Los modelos de IA pueden contener configuraciones, arquitectura o componentes manipulados para lograr que tengan comportamientos maliciosos o ejecuten malware.
  3. Publicación de herramientas de IA contaminadas. Estas herramientas pueden incluir definiciones o instrucciones maliciosas visibles para el modelo de IA, así como comportamientos ejecutables ocultos o respuestas diseñadas para manipular a un agente de IA. De tal forma que se consiga que el agente de IA se comporte de forma maliciosa cuando ejecute la herramienta. Un ejemplo de esta subtécnica son las herramientas maliciosas encontradas en ClawHub.

¿Cómo se puede mitigar el uso de estas técnicas de envenenamiento de IA por parte de los actores maliciosos? MITRE ATLAS recomienda tres técnicas de mitigación:

  1. Depurar los datos de entrenamiento antes de emplearlos, para detectar etiquetas, anotaciones o metadatos contaminados.
  2. Validar los modelos de IA que se quieren emplear para detectar backdoors, fugas de datos o comportamientos inesperados.
  3. Llevar a cabo un análisis de vulnerabilidades en los modelos y las herramientas de agentes de IA para detectar contenido malicioso.

2. Ejecución

Una de las técnicas de ejecución más habituales es la ejecución por parte de la propia víctima. Es decir, lograr a través de técnicas de ingeniería social que un usuario ejecute un artefacto malicioso o inseguro, abriendo la puerta a la ejecución de código malicioso en el sistema o a lograr que la IA incurra en un comportamiento malicioso.

2.1. Envenenamiento del agente de IA

Dentro de esta técnica destaca la subtécnica de envenenamiento del agente de IA. Mediante ella, los actores maliciosos logran que una víctima invoque una herramienta envenenada al interactuar con un agente de IA, exponiéndolo a respuestas contaminadas o a la ejecución de la lógica de implementación de una herramienta maliciosa. Esta técnica también se implementó en ataques contra OpenClaw.

Para mitigar esta técnica se puede:

  • Introducir comprobaciones de firmas para prevenir la ejecución de artefactos de IA que puedan suponer un riesgo para el sistema.
  • Realizar un análisis de vulnerabilidades sobre las herramientas y modelos antes de conectarlos al agente.
  • Formar a los usuarios de los agentes de IA para identificar intentos de manipulación y reducir la posibilidad de que realicen acciones que permitan la ejecución de malware.
La ciberseguridad de los sistemas de IA es esencial en esta era

3. Persistencia

La gran mayoría de técnicas de envenenamiento de IA están relacionadas con la persistencia. Es decir, con la capacidad de los actores maliciosos de mantener el acceso a los sistemas que atacan para poder cumplir sus objetivos.

3.1. Manipular el modelo de IA

La primera de las técnicas de envenenamiento de IA para facilitar la persistencia es la manipulación de un modelo de IA.

Mediante esta técnica, los actores maliciosos manipulan un modelo de IA o sus componentes para:

  • Alterar el comportamiento del sistema de IA.
  • Introducir código malicioso.
  • Establecer funcionalidades maliciosas persistentes.

Al manipular un modelo de IA, los actores hostiles pueden lograr que se active un comportamiento malicioso solo cuando se produzcan ciertas condiciones o contextos, logrando pasar desapercibidos en condiciones normales.

¿Qué subtécnicas de envenenamiento de IA pueden desplegar los actores maliciosos en estos casos?

  1. Envenenamiento del modelo de IA para alterar su comportamiento o rendimiento.
  2. Modificación de la arquitectura del modelo para cambiar su comportamiento con el objetivo de eliminar capacidades de predicción, aumentar los costes de cálculo, minar su rendimiento o, incluso, crear un backdoor.
  3. Inyección de código malicioso en los archivos del modelo de IA. De tal forma que los modelos con malware incrustado permitan a los actores maliciosos ejecutar acciones, implementar técnicas de comando y control o exfiltrar datos.
  4. Modificación de la lógica de construcción de los prompts. ¿Con qué fin? Poder inyectar de manera persistente instrucciones o manipular los outputs del modelo.

Para mitigar estas subtécnicas de envenenamiento de IA, desde MITRE ATLAS recomiendan:

  • Controlar el acceso en los modelos de IA a los datos en reposo para evitar alteraciones indebidas.
  • Validar los modelos de IA testeándolos frente a inputs maliciosos, de cara a garantizar que no pueden ser manipulados.
  • Implementar una firma de código para garantizar que un modelo no ha sido manipulado a posteriori.
  • Llevar a cabo un ejercicio de Red Team, en el que los expertos en ciberseguridad simulen ataques de manipulación de un modelo, de cara a detectar debilidades y subsanarlas.

3.2. Envenenamiento de los datos de entrenamiento

Una de las técnicas de envenenamiento de IA más habituales es la manipulación de los datos que se emplean para entrenar un modelo o realizar su ajuste fino. Los actores maliciosos pueden contaminar los datos al acceder al proceso de entrenamiento de forma ilícita o introducirlos mediante ataques de cadena de suministro de IA.

¿Qué objetivos se persiguen con esta técnica?

  • Provocar errores en los sistemas de IA.
  • Conseguir que tengan comportamientos sesgados o inseguros.
  • Menoscabar el rendimiento del modelo.
  • Inyectar backdoors que se activan con inputs específicos.

¿De qué forma se puede mitigar el envenenamiento de los datos de entrenamiento?

  • Limitando la publicación de los conjuntos de datos.
  • Controlando el acceso en los modelos de IA a los datos en reposo.
  • Depurando los datos de entrenamiento para detectar alteraciones que puedan provocar que un modelo actúe de forma maliciosa o se lleven a cabo ataques gracias a la existencia de backdoors.
  • Validando el modelo de IA.
  • Disponiendo de una lista de materiales de IA, para identificar componentes poco fiables.
  • Controlando la procedencia de los conjuntos de datos.
  • Realizando ejercicios de Red Team que permitan verificar el funcionamiento de los procesos de incorporación y depuración de datos, así como los de detección de alteraciones.

3.3. Contaminación de RAG

Otra de las técnicas de envenenamiento de IA relacionadas con la persistencia en los sistemas de IA es la inyección de contenido malicioso en los datos indexados por un sistema de generación aumentada por recuperación o RAG, por sus siglas en inglés. De esta forma, los ciberdelincuentes pueden contaminar hilos futuros a través de los resultados de búsqueda basados en RAG. ¿Cómo? Mediante la integración de documentos manipulados en ubicaciones que el RAG indexe.

¿Qué se puede conseguir al usar esta técnica? Que los sistemas de IA muestren contenidos que incluyan datos falsos, información engañosa o, incluso, instrucciones maliciosas.

Para combatir esta técnica de envenenamiento de IA es posible:

  • Implementar medidas de control de la IA generativa y conseguir que se rechace contenido indexado por el RAG que no sea fiable o pueda resultar malicioso.
  • Llevar a cabo ejercicios de Red Team en los que se introduzca contenido malicioso de forma controlada en las fuentes de ingestión de información. De tal forma que se evalúen y optimicen los mecanismos de autorización de las fuentes, control de su procedencia o validación de su contenido.

3.4. Envenenamiento del contexto de un agente de IA

Hay tres técnicas de envenenamiento de IA focalizadas en manipular y alterar el comportamiento de los agentes de IA que usan las empresas en su día a día para automatizar cientos de procesos.

La primera de dichas técnicas es el envenenamiento del contexto que emplea el modelo LLM de un agente de IA para generar sus respuestas o llevar a cabo acciones.

Mediante esta técnica, un actor malicioso puede modificar el comportamiento de un agente de IA de forma persistente y ponerlo al servicio de sus objetivos. ¿Cómo se lleva a cabo esta técnica? Indicándole al LLM que:

  • Añada instrucciones a la memoria.
  • Emplee mensajes anteriores de un hilo como contexto.

Para mitigar esta técnica se puede:

  • Fortalecer la memoria del agente para reducir el envenenamiento persistente del contexto. Para ello es posible poner en marcha mecanismos para controlar lo que un agente guarda en su memoria y detectar registros contaminados.
  • Realizar un ejercicio de Red Team en el que se intenten añadir a la memoria del agente instrucciones maliciosas y se verifiquen los mecanismos de autorización para cambiar el contexto y otros procesos como las comprobaciones de integridad.

3.5. Manipulación de un agente de IA

Los actores maliciosos pueden envenenar las herramientas que emplean los agentes de IA al introducir contenido malicioso en su definición, su implementación o sus respuestas.

Una vez que una herramienta manipulada se instala en un agente o se conecta a él puede permitir a los actores maliciosos obtener una influencia persistente sobre las acciones del agente de IA.

Así, una herramienta envenenada puede provocar que un agente acceda a datos confidenciales, altere inputs, extraiga información, oculte acciones a los usuarios o ejecute comandos no autorizados.

3.6. Contaminación de datos en herramientas de agente de IA

Esta técnica consiste en la manipulación de una fuente de datos empleada por un agente de IA como fuente de información. Por ejemplo, los actores maliciosos pueden alterar datos en una fuente controlada por su víctima o en una fuente de confianza a la que puedan acceder.

Además, pueden diseñar los contenidos maliciosos para que se muestren en consultas habituales de la herramienta de agente de IA o en operaciones de recuperación. Dichos contenidos pueden incluir información falsa o instrucciones maliciosas con el objetivo de llevar a cabo una inyección indirecta de prompts en el modelo LLM.

Es posible mitigar el uso de esta técnica por parte de los atacantes implementando medidas de control en los procesos de recuperación de contenidos. De tal manera que se puedan rechazar los contenidos cuyo origen no sea fiable.

4. Preparación de un ataque de IA

Una de las técnicas de envenenamiento de IA de la que ya hemos abordado también puede emplearse a la hora de preparar un ataque. Estamos hablando del envenenamiento de un modelo de IA mediante la manipulación de sus pesos, entrenándolo con datos alterados o interfiriendo en su proceso de entrenamiento.

4.1. Envenenamiento de un modelo de IA

A través del envenenamiento se puede alterar el comportamiento de la IA generativa mediante su entrenamiento con información falsa o sesgada. ¿Cómo se puede mitigar esta técnica?

  • Controlar el acceso a los modelos de IA y a los datos en reposo.
  • Depurar los datos.
Algunas técnicas de envenenamiento de IA buscan alterar el comportamiento de los modelos

5. Impacto

Los actores maliciosos también han desarrollado técnicas de envenenamiento de IA que se despliegan durante la fase de impacto de los ataques: forzar un consumo excesivo de recursos y menoscabar la integridad de un conjunto de datos.

5.1. Incremento del consumo de recursos por parte del agente de IA

Mediante esta técnica se puede obligar a un sistema de IA a conectarse a herramientas, realizando consultas API innecesarias y, así, lograr que consuma ingentes recursos computacionales y económicos.

También es posible forzar que el agente de IA desperdicie recursos a través de ciclos de autodelegación, en los que se ve forzado a delegarse a sí mismo tareas adicionales, pudiendo provocar desbordamientos de pila e interrupciones del servicio.

Para mitigar esta técnica es posible:

  • Recurrir a un ejercicio de Red Team que ejecute esta técnica e intente forzar al agente de IA a realizar llamadas repetidas a las API, caer en bucle recursivo o autoderivarse tareas. Así es posible detectar deficiencias, verificar los presupuestos de API y fijar límites de iteración o tiempos de espera.
  • Limitar el consumo de recursos del agente de IA.

5.2. Erosionar la integridad de un conjunto de datos

Los actores maliciosos pueden envenenar partes de un conjunto de datos para minar su utilidad y reducir la confianza en él. De tal forma que las organizaciones que los empleen para entrenar a sus modelos de IA tengan que desperdiciar recursos en subsanar errores y detectar datos alterados.

Para combatir la última de las técnicas de envenenamiento de IA que vamos a abordar en esta guía se puede:

  • Desinfectar los datos de entrenamiento contaminados para garantizar la integridad del conjunto de datos.
  • Mantener un control sobre la procedencia del conjunto de datos para identificar modificaciones indebidas con mayor facilidad.

6. Auditoría de seguridad en IA: Un escudo para protegerse frente a las técnicas de envenenamiento de IA

Si esta era ya está siendo moldeada por la creciente relevancia que tienen los sistemas de IA en el ecosistema empresarial, a nadie debe sorprenderle que los actores maliciosos estén poniendo a los modelos y agentes de IA en su punto de mira.

Para evitar que los actores hostiles puedan explotar vulnerabilidades y desplegar técnicas de envenenamiento de IA, u otras técnicas como inyecciones de prompts, resulta fundamental realizar auditorías de seguridad en IA periódicas. Esta clase de evaluación permite verificar que:

  • Un modelo de IA opera dentro de los parámetros previstos.
  • Se protegen los datos confidenciales con los que trabaja un agente de IA.
  • Se garantiza la integridad operativa del sistema de IA y de la propia organización.

Mediante una auditoría de seguridad en IA se puede:

  • Revisar la arquitectura de un modelo de IA, incluyendo sus fuentes de datos y procesos de entrenamiento y despliegue, para prevenir el uso de técnicas de envenenamiento de IA.
  • Identificar puntos críticos que puedan ser susceptibles a las vulnerabilidades, como las interfaces de usuario o las integraciones con herramientas de terceros.
  • Simular ataques de inyección de prompt o de envenenamiento de IA.
  • Comprobar que el sistema no expone información confidencial en sus respuestas o interacciones.
  • Analizar componentes de terceros para detectar vulnerabilidades y prevenir ataques de cadena de suministro de IA.
  • Establecer configuraciones de seguridad alineadas con las mejores prácticas.
  • Elaborar un informe detallado con las vulnerabilidades identificadas, su impacto potencial y las acciones que se pueden implementar para subsanarlas, priorizándolas en función del nivel de riesgo de las debilidades.
  • Capacitar al personal de la organización para que pueda identificar y prevenir vulnerabilidades.

7. El rol que juega el Red Team en la lucha contra las técnicas de envenenamiento de IA

Al abordar las diferentes técnicas de envenenamiento de IA se ha repetido de forma constante una vía de mitigación de las mismas: la realización de ejercicios de Red Team.

Ante la complejidad de las amenazas que se ciernen sobre las IA y el desarrollo y perfeccionamiento de las tácticas y técnicas maliciosas, los servicios de Red Team se han convertido en un pilar fundamental de cualquier estrategia de ciberseguridad de los sistemas de IA.

Mediante la preparación de escenarios de Red Team específicos, expertos en ciberseguridad pueden simular ataques 100% realistas empleando las técnicas que pueden usar los actores maliciosos para envenenar sistemas de IA y alterar su funcionamiento o desplegar malware.

Los Red Team son claves a la hora de validar el nivel de ciberresiliencia de las IA y comprobar la eficiencia de los mecanismos defensivos desplegados para proteger los datos, modelos y agentes de IA. Pero, también, juegan un papel crítico en la detección de vulnerabilidades explotables y en la elaboración de un listado de mejoras que se pueden implementar para evitar que las técnicas de envenenamiento de IA tengan éxito.