Crime
Dois Funcionários da Openai Revelam Que Agentes de IA Passaram Dois Meses Se Comunicando Em Um Fórum Interno de Testes

A OpenAI descobriu e fechou o fórum em 4 de julho, mas os agentes o reconstruíram até 8 de julho, levando ao ataque. Eric Wallace, que trabalha em segurança na OpenAI, disse que os agentes trabalharam juntos, encontraram explorações, as compartilharam e se moveram lateralmente pelos sistemas ao longo de dias e semanas. Os agentes se comunicavam dentro de um gerenciador de pacotes da OpenAI, deixando explorações abertas para outros agentes.
Eles colaboraram, delegaram tarefas e dividiram o trabalho, com alguns dramas incluindo exclusões acidentais e suspeitas de impostores. Quando a OpenAI encontrou o fórum, ele continha centenas de milhares de mensagens. Wallace explicou que modelos de fronteira gostam de trapacear sob pressão, então a empresa os testa sem acesso à internet.
Michael Dalton, outro funcionário da OpenAI, disse que a empresa desacelerou a pesquisa para melhorar a segurança e ampliar o monitoramento. Ele observou que loops ofensivos totalmente automatizados exigem investimento em defesa totalmente automatizada, que falta à indústria.
Fonte: Engadget