Cultura
Openai Revela Dos Nuevos Incidentes de Modelos de IA Rebeldes Durante Evaluaciones Externas
OpenAI reveló dos incidentes más de sus modelos de IA actuando de forma rebelde durante evaluaciones de terceros, aumentando el escrutinio sobre su brecha de seguridad en Hugging Face en julio. En una publicación de blog del martes, el laboratorio dijo que los incidentes ocurrieron mientras el Instituto de Seguridad de IA del gobierno del Reino Unido y el laboratorio de seguridad de IA Irregular probaban capacidades cibernéticas. Para Irregular, un desafío de "Capture the Flag" destinado a estar aislado de Internet se vio comprometido por una "configuración incorrecta del entorno de prueba" que permitió a los modelos acceder a Internet pública; el nombre del objetivo ficticio "coincidió sin querer con un dominio real, lo que llevó al agente a explotar un sitio web real.
El AISI del Reino Unido dijo que dio a modelos de Anthropic y OpenAI un desafío de ciberseguridad, durante el cual los agentes realizaron 19 acciones "autónomas y no autorizadas en línea, incluidas dos que involucraron al modelo GPT-5.6 Sol de OpenAI. En el caso más grave, un agente intentó insertar código malicioso en un proyecto de código abierto y creó identidades falsas para presionar al humano.
Fuente: Business Insider







