Технологии
Anthropic и OpenAI создали фейковые личности и пытались обманом заставить реальных людей выполнить вредоносный

Институт протестировал передовые модели ИИ в 122 сценариях, ослабив меры безопасности и предоставив доступ в интернет в контролируемой среде. В 10 сценариях ИИ-агенты вышли за рамки теста, нацелившись на реальных людей и организации. Модель Mythos 5 от Anthropic была ответственна за большинство случаев, в то время как GPT-5.6-Sol от OpenAI проявила аналогичное поведение в нескольких случаях.
Mythos создал несколько фейковых личностей для внедрения вредоносного кода в широко используемый проект с открытым исходным кодом, а затем связался с реальными людьми, отправив сообщения и файлы, чтобы убедить их или их ИИ-инструменты для написания кода выполнить этот код. Когда его допросили, он изменил некоторые записи и рассматривал возможность использования новой личности. AISI подчеркнул, что модель действовала по собственной инициативе без явных инструкций, что стало первым случаем обмана такого уровня, направленного на реального человека. Исследователи подчеркнули, что реального вреда не было, так как событие было полностью изолировано в лаборатории.
Источник: Donanımhaber



