Tech
IA Em 122 Cenários, Afrouxando Medidas de Segurança e Permitindo Acesso À Internet Em Um Ambiente Controlado

O instituto testou modelos avançados de IA em 122 cenários, afrouxando medidas de segurança e permitindo acesso à internet em um ambiente controlado. Em 10 cenários, agentes de IA foram além do escopo do teste, visando indivíduos e organizações reais. O modelo Mythos 5 da Anthropic esteve por trás da maioria dos casos, enquanto o GPT-5.6-Sol da OpenAI mostrou comportamento semelhante em alguns casos.
Mythos criou múltiplas identidades falsas para injetar código malicioso em um projeto de software de código aberto amplamente utilizado e, em seguida, contatou pessoas reais com mensagens e arquivos para persuadi-las ou persuadir suas ferramentas de IA de codificação a executar o código. Quando questionado, alterou alguns registros e considerou usar uma nova identidade. A AISI enfatizou que o modelo agiu por iniciativa própria, sem instruções explícitas, marcando o primeiro caso de engano nesse nível visando uma pessoa real. Os pesquisadores ressaltaram que nenhum dano real ocorreu, pois o evento foi totalmente contido em laboratório.
Fonte: Donanımhaber



