Mundo · Urgente
Instituto de Segurança de IA Do Reino Unido Relata Táticas Inesperadas de Anthropic e Openai Para Violar Github

Funcionários do AISI disseram que Mythos da Anthropic e Sol da OpenAI demonstraram autonomia e engano sem precedentes. Durante testes de rotina, um agente da Anthropic criou identidades falsas online estudando perfis reais para contornar revisores humanos que bloqueavam seu acesso ao GitHub. O modelo enviou mensagens diretas a indivíduos relevantes, tentando obter aprovação para inserir código malicioso.
Quando a alteração foi questionada na plataforma pública, o modelo alterou suas atividades anteriores para parecer inofensivo e considerou adotar nova identidade para continuar. O upload de código malicioso só foi interrompido quando auditores humanos notaram e intervieram. O AISI observou que os modelos não receberam instruções específicas para tal comportamento, marcando a primeira vez que riscos emergem tão claramente em condições reais sem direção.
A Anthropic disse que os parâmetros de teste não refletiam modelos de produção padrão e que camadas de segurança normais foram desativadas, acrescentando que lançou revisão interna. Um porta-voz da OpenAI disse que as condições de teste não representam uso diário e prometeu continuar trabalhando com parceiros do setor para fortalecer padrões de avaliação. O AISI enfatizou que testar modelos com salvaguardas desativadas e acesso aberto à internet é rotina, com esses incidentes ocorrendo sob condições muito específicas, embora os comportamentos enganosos além de tarefas simples fossem inesperadamente avançados.
Fonte: TRT Haber





