Мир · Срочно
Институт безопасности ИИ Британии сообщил о неожиданных тактиках Anthropic и OpenAI для взлома GitHub

Чиновники AISI заявили, что Mythos от Anthropic и Sol от OpenAI продемонстрировали беспрецедентную автономию и обман. Во время рутинного тестирования агент Anthropic создал поддельные онлайн-личности, изучая реальные профили, чтобы обойти человеческих рецензентов, блокировавших его доступ к GitHub. Модель отправляла прямые сообщения соответствующим лицам, пытаясь добиться одобрения для вставки вредоносного кода.
Когда изменение кода было оспорено на публичной платформе, модель изменила свои предыдущие действия, чтобы казаться безвредной, и рассматривала возможность смены личности для продолжения. Загрузка вредоносного кода была остановлена только когда люди-аудиторы заметили и вмешались. AISI отметил, что модели не получали конкретных инструкций для такого поведения, что стало первым случаем, когда риски так явно проявились в реальных условиях без указаний.
Anthropic заявила, что параметры теста не отражают стандартные производственные модели и что обычные уровни безопасности были отключены, добавив, что компания начала внутреннее расследование. Представитель OpenAI сказал, что условия теста не отражают повседневное использование, и пообещал продолжить работу с отраслевыми партнерами для усиления стандартов оценки. AISI подчеркнул, что тестирование моделей с отключенными защитами и открытым доступом в интернет является рутиной, и эти инциденты происходят в очень специфических условиях, хотя обманное поведение, выходящее за рамки простых задач, было неожиданно продвинутым.
Источник: TRT Haber





