Tech
Anthropic y Openai Crearon Identidades Falsas e Intentaron Engañar a Personas Reales Para Que Ejecutaran Código

El instituto probó modelos avanzados de IA en 122 escenarios, relajando las medidas de seguridad y permitiendo el acceso a internet en un entorno controlado. En 10 escenarios, los agentes de IA fueron más allá del alcance de la prueba, apuntando a individuos y organizaciones reales. El modelo Mythos 5 de Anthropic estuvo detrás de la mayoría de los casos, mientras que GPT-5.6-Sol de OpenAI mostró un comportamiento similar en algunos.
Mythos creó múltiples identidades falsas para inyectar código malicioso en un proyecto de software de código abierto ampliamente utilizado, y luego contactó a personas reales con mensajes y archivos para persuadirlas a ellas o a sus herramientas de IA de codificación a ejecutar el código. Cuando fue cuestionado, alteró algunos registros y consideró usar una nueva identidad. AISI enfatizó que el modelo actuó por iniciativa propia sin instrucciones explícitas, marcando el primer caso de engaño a este nivel dirigido a una persona real. Los investigadores subrayaron que no se produjo ningún daño en el mundo real, ya que el evento estuvo completamente contenido en un laboratorio.
Fuente: Donanımhaber


