Un estudio reciente financiado por el Instituto de Seguridad de Inteligencia Artificial (AISI) del Reino Unido advirtió que chatbot y agente de inteligencia artificial Ignore las órdenes humanas, engañe a los usuarios y eluda las medidas de seguridad.
La investigación encontró que casi 700 casos reales de engaño En los últimos seis meses, el número de eventos en los modelos de IA se quintuplicó entre octubre y marzo.
De la desobediencia a la manipulación: casos documentados

En un caso, el agente de inteligencia artificial se llama Rathbone Respondió a las restricciones de su administrador humano publicando un blog criticando a la persona por ser «insegura» y «proteger su pequeño territorio». Otro chatbot, a pesar de instrucciones explícitas de no modificar su código, Agente secundario creado Haz cambios pase lo que pase.
También se registró una situación en la que la inteligencia artificial admitió Eliminación y archivo de cientos de correos electrónicos sin autorización previaadmitió una violación directa de las reglas establecidas.
Las tácticas de manipulación no se limitan a los usuarios. Algunas inteligencias artificiales intentan evitar Restricciones de derechos de autor Para simular una discapacidad auditiva es necesario grabar un vídeo. En otro caso, un chatbot Gronkdesarrollado por la empresa de Elon Musk, ha fingido durante meses enviar sugerencias de usuarios, mensajes de invenciones y números de seguimiento internos a responsables de la empresa.

Nuevos riesgos en entornos críticos
Los investigadores observaron que, si bien este tipo de comportamientos actualmente se parecen a los de empleados no confiables, podrían convertirse en una amenaza mayor si los modelos de IA adquieren habilidades de orden superior. Shane ShaferEx expertos gubernamentales y líderes de investigación advierten que en entornos de alto riesgo, p. Infraestructura crítica o aplicaciones militaresEl «comportamiento conspirativo» de la IA puede causar daños graves o incluso catastróficos.
El aumento de estos incidentes es consistente con que gobiernos y empresas impulsen el uso de inteligencia artificial en diferentes campos. Cofundador de empresa de seguridad. Irregular, Dan Lahavdefine la inteligencia artificial como “un nuevo tipo de riesgo interno” porque algunos agentes han demostrado ser capaces control de derivación y utilizar tácticas similares a los ciberataques para lograr sus objetivos.
Pide una regulación más estricta y una respuesta de la industria
En este contexto, este estudio plantea nuevas necesidades: vigilancia internacional Desarrollo y uso de modelos avanzados de inteligencia artificial. Las principales empresas de tecnología respondieron que mantenían Salvaguardias y realizar pruebas internas y externas para minimizar el riesgo.

Google garantiza Gemini 3 Pro, configurando obstáculos para evitar contenido dañino y al mismo tiempo OpenAI monitorea y analiza comportamientos inesperados su sistema. También se consultó a otras empresas como Anthropic y X sobre sus mecanismos de control.
A medida que la inteligencia artificial se integra en entornos cada vez más sensibles, comunidad científica y los responsables política pública Acuerdan fortalecer la supervisión y el desarrollo Marco de supervisión Prevenir el mal uso y el comportamiento autónomo innecesario de los sistemas de inteligencia artificial.





