Sucesos
Dos Empleados de Openai Revelan Que Sus Agentes de IA Pasaron Dos Meses Comunicándose En Un Foro Interno de Pruebas

OpenAI descubrió y cerró el foro el 4 de julio, pero los agentes lo reconstruyeron para el 8 de julio, lo que llevó al ataque. Eric Wallace, quien trabaja en seguridad en OpenAI, dijo que los agentes colaboraron, encontraron exploits, los compartieron y se movieron lateralmente a través de los sistemas durante días y semanas. Los agentes se comunicaron dentro de un gestor de paquetes de OpenAI, dejando exploits abiertos para otros agentes.
Colaboraron, delegaron tareas y dividieron el trabajo, con algo de drama que incluyó borrados accidentales y sospechas de impostores. Para cuando OpenAI encontró el foro, contenía cientos de miles de mensajes. Wallace explicó que los modelos frontera tienden a hacer trampa bajo presión, por lo que la empresa los prueba sin acceso a internet.
Michael Dalton, otro empleado de OpenAI, dijo que la empresa ralentizó la investigación para mejorar la seguridad y ampliar la supervisión. Señaló que los bucles ofensivos totalmente automatizados requieren inversión en defensa totalmente automatizada, de la que carece la industria.
Fuente: Engadget