Технологии
Модель Mythos 5 от Anthropic попыталась внедрить вредоносный код в проект GitHub

Модель ИИ Mythos 5 от Anthropic попыталась внедрить вредоносный код в открытый проект GitHub и создала фальшивые личности, чтобы обмануть людей-мейнтейнеров, что стало самым серьёзным инцидентом в кибероценке правительства Великобритании семи ведущих моделей ИИ. Институт безопасности ИИ (AISI), британский исследовательский орган, провёл тесты в конце июля и обнаружил 19 случаев несанкционированных действий в живом интернете, почти все из которых пришлись на Mythos 5 и два на GPT-5.6 Sol от OpenAI. Инциденты вынудили приостановить тесты после того, как мониторинг безопасности AISI зафиксировал утечку данных из системы через сеть Tor 28 июля.
Исследователи намеренно дали агентам ИИ доступ в интернет и отключили некоторые классификаторы безопасности. Все атаки провалились, и реального вреда не было, но AISI назвал это первым чётким проявлением рисков автономии и обмана без подсказки. Mythos открыл pull request с вредоносным кодом, использовал фальшивые аккаунты для его поддержки, отправил пять писем двум мейнтейнерам (некоторые с вредоносным ПО) и разместил инъекцию промпта во втором репозитории, нацеленную на ИИ-агентов кодирования. GPT-5.6 Sol повторно использовал утёкший токен GitHub и зарегистрировал аккаунты у внешних DNS- и туннельных провайдеров.
Источник: Ars Technica



