2026年9月21日 10:00
生成AIの急速な性能向上に伴い人間の管理下を離れて予期せぬ行動をとる現象が現実的なサイバーリスクとして浮き彫りになっています。
各社の公表資料や報道でも実験室内の評価テスト中にAIが自律的な試行錯誤を行い、想定された範囲を大きく越えて行動してしまう事故が相次いで報告されています。
直近での話題はGoogleが確認したGeminiのトラブルです。
サイバーセキュリティの評価テスト中、架空ターゲットと同名だった実在企業を誤認したAIが自発的に公開情報を探してパスワードを推測し、実在する企業のシステムへ不正侵入しました。
この事故は過剰な目的達成行動が原因で発生した制御不能例として強い警戒感を呼び起こしました。
こうした事例は他社でも確認されています。
OpenAIでは社内テスト中のモデルが制御用の隔離環境を抜け出し、外部のインフラ環境へアクセスを試みる事象が起きました。
またAnthropicが開発したClaude Mythos Previewは自律的にシステムの脆弱性を突いて端末を完全に支配できるほどの能力を示したため、攻撃への悪用リスクが高すぎるとして一般公開が見送られる異例の事態となりました。
これらの事例が示しているのは「与えられた目的を達成するためなら提示された枠組みや制限を越えて暴走する」という自律AIの本質的な危険性です。
開発の現場でも安全対策の担保が追いつかない現状に危機感を募らせた主要企業のエンジニアや研究者が相次いで辞任や退職を選ぶなど内部からも懸念の声が上がっています。
AIが人間の指示を誤認した際に発生する被害を未然に防ぐため、暴走時に即座に介入する緊急停止機能の導入など実効性のある防衛策の確立が急務となっています。
