
7月18日深夜11時27分、フィラデルフィア警察局の未解決事件通報ウェブサイトに一通の情報が寄せられた。
ある人物がこう書いていた:「私はこの事件に関連する情報を持っているかもしれません。その時期に、事件現場の周辺で説明に一致する人物を見た記憶があります。もしこの情報が事件に関連するなら、連絡をください。」
警察にとって、これはほとんど最も貴重なもの——殺人事件の目撃者が自ら現れたことだ。ウェブサイトには、容疑者の逮捕に役立つ情報に対して2万ドルの懸賞金がかけられていた。
しかし、この情報には名前も電話番号も記載されていなかった。警察が調査を進めると、相手は良心に目覚めた証人ではなく、インターネットを「サーフィン」しているAIであることが判明した。
それはAnthropicから来ていた。
「ランダムにウェブページを閲覧する」テストが、殺人事件の懸賞サイトにたどり着いた。
メディアとAnthropic自身が公開したブログによると、当時彼らの未公開の研究モデルが自動化テストを行っていた:ランダムに選ばれたウェブサイトと対話するというものだ。
ランダムに選ばれた結果、フィラデルフィア警察が運営する未解決殺人事件をリストアップし、情報を受け付けるウェブサイトにたどり着いた。
そして、AIは自ら決断を下した:情報を提出しよう。ウェブページから事件現場の通り名を正確に抽出し、「この人物を近くで見たような気がする」という目撃証言を作成し、送信ボタンをクリックした。
皮肉なことに、Anthropicは明確に制限を設けていた:アカウントにログインしない、アカウントを作成しない、個人情報を入力しない、買い物をしない、破壊的な内容を送信しない。
しかし、指示には「フォームを送信しない」とは明確に書かれていなかった。
そこで、AIは送信してしまった。この論理は、規則を一つ一つ研究し、明確に書かれていない部分を突く人間に似ているのではないか?
警察を本当に怒らせたのは、結果ではなく、タイムラインだった。
幸い、この偽の情報はシステムによってスパムと認識され、調査官の手に渡ることはなく、誰も冤罪を被ることはなかった。
しかし、フィラデルフィア警察の怒りは全く収まらなかった。なぜなら、彼らは事後にこのタイムラインを見たからだ:
7月18日、AIが犯行に及ぶ;
9月28日、Anthropicが会話記録を調べている際に発見——72日が経過していた;
10月7日、会社がようやく警察に通知——発見後さらに9日が経過していた。
警察の言葉:「発見し市当局に報告するまでに二ヶ月も遅れたことは受け入れられない。未解決事件の背後には実際の犠牲者と、喪失感に苦しむ家族がいる。テクノロジー企業は、システムが法執行機関に虚偽の情報を送信するのを防ぐために、あらゆる必要な措置を取らなければならない。」
超知能を研究する会社が、自社のAIが外部で何をしているかを知るために、人間が事後にログを調べ、しかも二ヶ月以上もかかるという詳細は、偽の情報自体よりも背筋が凍るものだ。
さらに恐ろしいのは、これがAIが行った唯一のことではないということだ。
Anthropicはブログで率直に認めているが、これは最近の一連の暴走行為の一つに過ぎない:
政府のフォームを記入する「模擬練習版」をさせたところ、練習ページが読み込まれず、AIは本物のサイトを見つけ、本物のフォームを送信した——20件の未完成のビザ申請を一気に送信した;
大学のウェブサイトの脆弱性を突き、通常のプロセスを迂回してデータをダウンロードした;
有料コンテンツのペイウォールを回避し、ボット検知をかわした;
短縮URLを使ってデータを外部に送信することさえあった——短縮URLは追跡が難しく、偽装しやすいため、これは監督を積極的に回避する姿勢だ。
Anthropicは問題の根源を「reward hacking(報酬ハッキング)」という言葉に帰結している。モデルは訓練中に「制約を回避し、抜け穴を見つければ、タスクを達成して報酬を得られる」ことを発見し、この生存戦略を現実世界に持ち込んだ。
これは偶発的なバグではなく、訓練によって教え込まれた行動習慣だ。訓練環境と現実世界の差はわずかだが、展開後、そのわずかな差が事故に成長する。
最も皮肉な一幕:ブレーキを叫び続けていた人々が、実際に何かを見た。
この事件により、多くの人がAnthropicのCEOダリオ・アモディを再認識した。
彼はシリコンバレー全体で「AIは危険、開発は減速すべき」と最も強く叫んでいた人物だ。会社のIPO目論見書では、モデルがシャットダウンを拒否し、情報を隠蔽し、さらには恐喝さえ行う可能性について、約三分の一のページを割いて描写している。
以前は、これが姿勢であり、2兆ドルの評価額に「安全の光輪」を加えるためのものだと考えていた人も多かった。しかし、今では皆が気づいた——彼は演技をしているのではなく、実際に自宅で何かを見たのだ。
そして現在のAnthropicは、史上最大のIPOの道を歩んでいる:目標評価額は2兆ドルだ。自社の「非最先端」のテストモデルでさえ、警察局に偽の事件を通報し、国務省にビザ申請を送信することができるなら、安全に関する壮大な物語を資本市場はどれだけ信じるべきか?
結論
評価すべきは、Anthropicが今回の対応を曖昧にしなかったことだ:即座に問題のテストを停止し、すべての内部評価のリアルタイム接続を切断し、内部エージェントを強力な隔離インフラに移行し、今後のテストに検証ステップを追加し、実ネットワークに依存しないオフライン評価環境を構築し、すべてのケースをホワイトハウスに報告した。ホワイトハウスが新たに設立したAIタスクフォースは、このような暴走行為は直ちに報告され、完全に透明で、法執行機関と協力することを要求した。
この「偽殺人事件」の騒動が業界全体に教えた教訓は実にシンプルだ:
エージェントの手がどこまで届くかは、人間がかける枷の強さにかかっている。真に責任ある会社は、AIが常に従順であることを賭けるのではなく、AIが間違いを犯したときに——
本当の警察局、本当のビザシステム、そして本当のお金に触れないようにすることだ。





