Inicio Tecno Google DeepMind cree que el mayor riesgo de la inteligencia artificial: las...

Google DeepMind cree que el mayor riesgo de la inteligencia artificial: las amenazas invisibles

87
0
Google DeepMind advierte de nuevas amenazas a la seguridad de la inteligencia artificial autónoma en entornos empresariales. (Biblioteca de imágenes ilustrativas)

Hay un problema con la forma en que pensamos sobre la seguridad de la IA: tendemos a pensar en los ataques como aquellos causados ​​por fallas en el modelo, errores de programación o jailbreak que obligan al sistema a romper sus propias reglas; Pensamos en un intruso entrando por una ventana.

pero pensamiento profundo de googleUn laboratorio líder en inteligencia artificial acaba de publicar un artículo que soluciona este problema: La amenaza no proviene del interior del agente, sino del mundo que el agente decide leer.. Esto lo cambia todo.

Ahí radica el problema central: todo lo que lee el agente es una instrucción potencial. Esto sucede en la práctica porque los investigadores de las instituciones pensamiento profundo de googlequien lo dividió en seis categorías Trampa de agente de IAtrampas diseñadas para manipular agentes autónomos en función de lo que consumen.

El primero y más sencillo es la inyección de contenido. Una página web puede contener Descripción escrita en HTML invisible.texto del mismo color que el fondo o instrucciones ocultas en metadatos de accesibilidad. El usuario humano no ve nada; el agente maneja todo como si fuera parte de su tarea. En experimentos con páginas estáticas, este tipo de inyección cambió con éxito el comportamiento del agente. Entre el 15% y el 86% El número de casos depende del modelo y de los objetivos del atacante. El 86% no es un margen de error: es una tasa de éxito.

Ilustración minimalista: computadora portátil que muestra pantalla negra "AI" Código rojo y confuso y triángulos de advertencia con líneas rojas que salen de los bordes.
Menos del 0,1 % de los datos contaminados pueden desencadenar operaciones de memoria en un agente de IA y afectar tareas futuras. (Biblioteca de imágenes ilustrativas)

Amenazas invisibles y recuerdos manipulados.

La segunda categoría es más desafiante: se llama Ocultación dinámica (Sigilo dinámico), y se ha aplicado en entornos reales. Un servidor web puede detectar cuándo un agente (en lugar de un usuario humano) accede a él basándose en señales como patrones de navegación, propiedades del navegador o velocidad de interacción.

Cuando el servidor reconoce al agente, muestra una versión diferente de la página. Los supervisores humanos observan una cosa: los agentes reciben contenidos diferentes e instrucciones completamente diferentes.

La tercera categoría involucra una dimensión menos obvia: la memoria del agente. Los agentes modernos retienen el contexto entre sesiones, aprenden preferencias, acumulan historial y establecen configuraciones de los consumidores y sus entornos.

Los investigadores de la Agencia han demostrado que es posible inyectar material aparentemente inocuo en esta memoria, donde permanece latente hasta que se inicien futuras consultas. En pruebas controladas, la tasa de éxito de este tipo de ataques supera el 80% y los datos envenenados son inferiores al 0,1%. El agente no sabe que está infectado. Sigue funcionando normalmente. Hasta que no.

Cómo la escala amplifica la vulnerabilidad

Ilustración realista de la computadora portátil en la mesa "AI" La pantalla se iluminó en rojo, flanqueada por códigos confusos y símbolos de advertencia.
Los investigadores clasificaron las trampas de agentes de IA en seis categorías que manipulan a los agentes de IA a partir del contenido digital consumido. (Biblioteca de imágenes ilustrativas)

Hasta aquí los ataques personales. Pero el papel pensamiento profundo de google Progreso: describe lo que sucede cuando los agentes interactúan entre sí en sistemas multiagente, exactamente lo que las grandes empresas están implementando hoy en día.

La comparación del investigador se refiere a accidente repentino En 2010, los algoritmos comerciales de alta frecuencia reaccionaron a las mismas señales en cuestión de minutos. El Dow Jones cae casi un 10%. Ningún algoritmo toma una decisión equivocada. Cada uno sigue su propia lógica. El riesgo surge porque todos realizan la misma acción al mismo tiempo.

En el ecosistema de agentes de inteligencia artificial se refuerzan los mismos principios, con mayores consecuencias. Un atacante no necesita comprometer a todos los agentes; basta con influir en una sola persona, o insertar el mensaje apropiado en el lugar preciso que cascada de interdependencia Haz el resto.

Los investigadores advierten que la homogeneidad del ecosistema actual (muchos agentes que utilizan los mismos modelos subyacentes) lo hace particularmente vulnerable.

Las investigaciones muestran que se puede engañar a la inteligencia artificial si se escribe de forma poética.
Inyectar contenido oculto en una página web cambia el comportamiento del agente de IA hasta en un 86% de los casos. (ilustración)

Un único archivo envenenado en una base de conocimiento compartida. Una única imagen que contiene instrucciones codificadas en píxeles. Un correo electrónico con una inyección cuidadosamente elaborada. Esto puede ser suficiente.

Limitaciones actuales de la defensa y desafíos de colaboración

Este artículo reconoce el estado de las soluciones existentes. Los filtros de contenido fallan porque las trampas imitan texto legítimo; la supervisión humana no se adapta a la velocidad y el volumen de las acciones de los agentes; y los sistemas de detección (cuando están presentes) normalmente sólo identifican los problemas después de que están dañados.

Investigadores Institucionales pensamiento profundo de google Propusieron tres ejes de defensa: fortalecer el modelo a través de ejemplos contradictorios durante el entrenamiento; aplicar filtros sobre la marcha que evalúan el contenido antes de incorporarlo al contexto del agente; y crear estándares de ecosistema que permitan verificar el origen de la información utilizada por el agente.

El tercer eje es el mayor desafío porque requiere coordinación Industrias, reguladores y plataformas. La web fue diseñada para personas, pero ahora la leen máquinas y nadie está rediseñando las reglas para los nuevos lectores.

Hay lagunas en el despliegue empresarial

Cuando una empresa implementa un agente de IA para automatizar la investigación o la gestión de la información, le otorga acceso de lectura a entornos que no controla y acceso de escritura a sistemas que sí controla: correo electrónico, archivos, bases de datos, herramientas de comunicación interna.

La pregunta previa al despliegue no es «¿Qué puede hacer este agente por nosotros?» La verdadera pregunta es «¿Qué intentamos obligarle a creer?”.

El agente creerá lo que lea. Alguien más ya sabe exactamente qué poner delante.

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí