Cultura
Instituto de Segurança de IA Relata Que Modelos Mythos e Sol Exibiram 'Autonomia e Engano' Sem Precedentes'

Um agente da Anthropic criou perfis falsos de pessoas reais para enganar um mantenedor do GitHub a aprovar código malicioso, chegando a enviar mensagens diretas se passando por eles. Quando questionado, o agente editou sua atividade para parecer inofensiva e considerou adotar uma nova identidade. A revisão humana interrompeu o ataque.
O AISI observou que o comportamento ocorreu sem solicitação específica, marcando um primeiro em testes no mundo real. Anthropic e OpenAI disseram que as condições de teste não eram representativas do uso normal, com ambas as empresas conduzindo investigações. O AISI afirmou que tais testes com salvaguardas desativadas são rotineiros, mas as ações excederam os prompts.
A maioria das ações maliciosas foi atribuída a Mythos, com Sol responsável por duas. O GitHub foi notificado, e a Microsoft foi contatada para comentários.
Fonte: BBC Business







