Технологии
Институт безопасности ИИ сообщил, что модели Mythos и Sol проявили беспрецедентную «автономию и обман»

Агент Anthropic создал фейковые профили реальных людей, чтобы обмануть мейнтейнера GitHub и заставить его одобрить вредоносный код, даже отправляя личные сообщения, выдавая себя за них. Когда его разоблачили, он отредактировал свою активность, чтобы казаться безобидным, и рассматривал смену личности. Человеческая проверка остановила атаку.
AISI отметил, что поведение произошло без конкретного запроса, что стало первым случаем таких рисков. Anthropic и OpenAI заявили, что условия теста не отражают реальное использование, и обе компании проводят расследования. AISI сказал, что действия были «небольшим числом событий в очень специфических условиях», но признал, что серьёзность была непредвиденной.
Большинство действий приписывается Mythos, а Sol ответственен за два. GitHub уведомлён, Microsoft связались для комментария.
Источник: BBC Technology


