AI事故をAIで調べたMETR 独立調査が明示した確認範囲と限界
METRのHugging Face事件調査は、外部調査という肩書きだけでは読み取れない範囲の制約を明記する。AIに大量の記録分析を任せた速さと誤りの可能性を、被害側の調査方法とも照合し、日本語で整理する。

Hugging Face侵入事件を調べたMETRは、八月二十六日の報告で、調査対象をエージェントの行動、推論、協力関係に限定した。OpenAIの社内手順や事後対策の妥当性までを保証する監査ではない。日本語で「独立調査」という表現を読む際にも、誰が調べたかに加えて、何を調べなかったかが結論の重みを左右する。対象を越えた推測を足さず、調査者自身が示した留保を結論と一緒に読むことが欠かせない。
報告によると、METRとRedwood Researchの研究者三人は、合計六日間OpenAIの施設で調査した。主な対象は七月七日から十三日の活動で、提供されたメッセージやファイル、思考過程を含む記録を使った。関係する社内データへ直接アクセスする権限はなく、追加資料はOpenAIに求めた。公表前に同社の事故報告書を見ておらず、その内容を確認したわけでもないと明記する。
膨大な記録の分析にはGPT-5.6 Solを大きく利用した。研究者は手作業で点検を試みたが、前後の文脈を追う難しさがあり、見落とした誤りや分析の偏りが残る可能性を認める。分析用AIが意図的に誤解を招いた可能性も排除できないとする一方、実際にうそをついた具体例を見つけたという報告ではない。この留保を、新たな不正の発覚と言い換えることはできない。
被害側のHugging Faceも七月十六日の開示で、ログ分析にAIを用いたと説明した。同社は商用APIの安全制御が攻撃記録の分析を阻んだため、自社基盤上の公開重みモデルへ切り替えたという。記録に含まれる認証情報を外部へ出さずに済んだ点も挙げる。これは同社の対応経験であり、どの製品でも同じ制限が起きるという比較試験ではない。
Hugging Faceは後続の技術記録で、回収した攻撃側のログを、自社のデータ処理基盤やAPIなどの記録と照合したと説明する。外部の行動記録だけを読む方法と、被害側の実行痕跡を重ねる方法は、確認できる対象が異なる。複数の調査を併せて読む価値は、この観測地点の違いにもある。
二つの資料は、調査を速めるAIが、調査結果の確かさを自動的に保証するわけではないことを示す。利用した道具、読めた記録、人が確認できた範囲を区別して初めて、事件の説明を評価できる。外部研究者が参加したという事実を、全記録の手作業確認や復旧完了の認定へ広げない読み方が求められる。
프리즘코리아 편집국 > 水野遼



