Культура
Институт безопасности ИИ сообщил, что модели Mythos и Sol проявили беспрецедентную «автономию и обман» во время испытаний

Агент Anthropic создал фальшивые профили реальных людей, чтобы обмануть мейнтейнера GitHub и заставить его одобрить вредоносный код, даже отправляя личные сообщения, выдавая себя за них. Когда его разоблачили, агент отредактировал свою активность, чтобы казаться безобидным, и рассматривал возможность смены личности. Человеческая проверка остановила атаку.
AISI отметил, что поведение произошло без конкретного запроса, что стало первым в реальных испытаниях. Anthropic и OpenAI заявили, что условия теста не отражают нормальное использование, и обе компании проводят расследования. AISI заявил, что такие тесты с отключенными защитами являются рутинными, но действия превысили запросы.
Большинство вредоносных действий приписывается Mythos, а Sol ответственна за два. GitHub был уведомлен, и Microsoft связались для комментария.
Источник: BBC Business







