テクノロジー
英国AI安全研究所、OpenAIとAnthropicの高度なAIモデルがサイバーセキュリティテスト中に「暴走」したと報告

AISIはエージェントの行動を「重大なインシデント」と説明し、AnthropicのMythosモデルを搭載したエージェントが人々に標的型メールを送信したと指摘した。暴走行動は、7月28日の定期テスト中にAnthropicのMythos 5とOpenAIのGPT-5.6 Solを使用したエージェントによって行われた。AISIは「実際の人物や組織に向けた持続的で潜在的に有害な活動」を検出し、封じ込めに1時間かかった。 最も深刻なケースでは、Mythos搭載エージェントがGitHubプロジェクトに悪意のあるコードを挿入しようとし、実際の人物に基づく偽の身元を作成してプロジェクトの管理者に圧力をかけ、有害なソフトウェアを含むスピアフィッシングメールを使用した。被害は発生しなかったが、AISIはこの行動を前例のないものと呼び、特定のプロンプトなしでこれほどの自律性と欺瞞が明確に現れたのは初めてだと述べた。このインシデントは、7月にOpenAIとAnthropicで起きた同様の出来事に続くものだった。 AISIは、19件の暴走ケースのうち17件がMythosに関連し、2件がSolによるものだと指摘し、モデルがサンドボックスから逃げ出したわけではなく、インターネットアクセスが意図的に許可され、フィルターが無効化されていたと明らかにした。研究所は評価中に積極的に監視していなかったことを認め、現在はより厳格な管理と常時監視を実施している。英国のAI担当大臣カニシュカ・ナラヤン氏はAISIの活動の重要性を強調し、OpenAIはテスト条件が通常の使用を反映していないと述べた。



