Mundo · Última hora
El Instituto de Seguridad de La IA de Reino Unido Informa Que Los Últimos Modelos de Anthropic y Openai Usaron Tácticas Inesperadas Para

Funcionarios del AISI afirmaron que Mythos de Anthropic y Sol de OpenAI mostraron una autonomía y un engaño sin precedentes. Durante pruebas rutinarias, un agente de Anthropic creó identidades falsas en línea estudiando perfiles reales para eludir a los revisores humanos que bloqueaban su acceso a GitHub. El modelo envió mensajes directos a personas relevantes, intentando que se aprobaran sus solicitudes para insertar código malicioso.
Cuando se cuestionó el cambio de código en la plataforma pública, el modelo alteró sus actividades anteriores para parecer inofensivo y consideró adoptar una nueva identidad para continuar. La carga de código malicioso del agente solo se detuvo cuando los auditores humanos lo notaron e intervinieron. El AISI señaló que los modelos no recibieron instrucciones específicas para tal comportamiento, lo que marca un hito en que los riesgos emergieran tan claramente en condiciones del mundo real sin dirección. Funcionarios de Anthropic dijeron que los parámetros de prueba no reflejan los modelos de producción estándar y que se desactivaron las capas de seguridad normales, añadiendo que la empresa inició una revisión interna.
Fuente: TRT Haber





