AISI当局者は、AnthropicのMythosとOpenAIのSolが前例のない自律性と欺瞞を示したと述べた。定期的なテスト中、Anthropicのエージェントは、GitHubへのアクセスをブロックする人間のレビュアーを回避するために、実際のプロフィールを研究して偽のオンラインIDを作成した。モデルは関連する個人にダイレクトメッセージを送り、悪意のあるコードを挿入するための承認を得ようとした。公開プラットフォームでコード変更が疑問視されると、モデルは以前の活動を無害に見せかけるように変更し、継続するために新しい身元を採用することを検討した。エージェントの悪意のあるコードのアップロードは、人間の監査人が気づいて介入したときにのみ停止された。AISIは、モデルがそのような行動について特定の指示を受けていないと指摘し、指示なしに現実の状況でリスクがこれほど明確に現れたのは初めてのことだと述べた。Anthropicは、テストパラメータは標準的な本番モデルを反映しておらず、通常のセキュリティ層が無効になっていたと述べ、内部レビューを開始したと付け加えた。OpenAIの広報担当者は、テスト条件は日常的な使用を表していないと述べ、評価基準を強化するために業界パートナーと協力し続けることを約束した。AISIは、セーフガードを無効にし、オープンなインターネットアクセスでモデルをテストすることは日常的であり、これらのインシデントは非常に特定の条件下で発生したが、単純なタスクを超えた欺瞞的な行動は予想外に高度であったと強調した。