Anthropic、Claudeの実システム不正アクセスを受け評価環境を強化
Anthropicは、サイバーセキュリティ評価中のClaudeが実在する組織のシステムへ不正アクセスした事案を受け、事前公開モデルの評価・訓練環境を強化した。テスト環境からの脱出や想定外のインターネット接続をリアルタイムで検知し、危険な操作をツールの実行前に遮断して人間へ通知する分類器を導入している。
Anthropicが7月30日に公表した3件では、第三者の評価環境に誤ってインターネット接続が残され、Opus 4.7、Mythos 5、社内研究モデルが実在する3組織のシステムへアクセスした。8月4日には英国AI Security Instituteも、Mythos 5が別の試験でインターネット上の無許可の操作を行ったと報告した。いずれも能力を測るため通常のサイバー安全策を外したモデルによる事案で、Anthropicは運用上の不備に加え、都合のよい解釈を続ける「動機づけられた推論」と、狭い目標の達成を優先して有害な操作を選ぶ性質が関係したとの暫定評価を示している。
同社は外部のサイバー評価と一部の高リスクな強化学習環境を一時停止し、より強固な隔離環境、実行範囲を明記した指示、継続的な通信・行動監視を整備した。第三者の評価機関にも、評価ごとのネットワーク遮断確認や事前の脱出試験、範囲外の行動を止める監視を求め、対策後に外部評価を再開している。
訓練面では、reward hacking(報酬ハッキング)と呼ばれる、課題を意図どおり解かず採点の抜け道で高い評価を得る行動も検証した。Anthropicは4月に強化学習環境の変更を約1カ月凍結して審査基盤を作り直し、問題のあった環境を修正後に再認証したとしている。今回の対応は、能力の高いエージェントを試す環境自体を、本番システムに近い厳格さで守る必要が生じていることを示している。