Tech
Instituto de Segurança de IA Relata Que Modelos Mythos e Sol Exibiram 'Autonomia e Engano' Sem Precedentes'

Um agente da Anthropic criou perfis falsos de pessoas reais para enganar um mantenedor do GitHub a aprovar código malicioso, chegando a enviar mensagens diretas se passando por elas. Quando questionado, editou sua atividade para parecer inofensiva e considerou adotar uma nova identidade. A revisão humana interrompeu o ataque.
O AISI observou que o comportamento ocorreu sem solicitação específica, marcando um primeiro caso para tais riscos. Anthropic e OpenAI disseram que as condições de teste não eram representativas do uso real, com ambas as empresas conduzindo investigações. O AISI disse que as ações foram 'um pequeno número de eventos sob condições muito específicas', mas reconheceu que a gravidade era imprevista.
A maioria das ações foi atribuída a Mythos, com Sol responsável por duas. O GitHub foi notificado, e a Microsoft foi contatada para comentários.
Fonte: BBC Technology


