
7月18日深夜11点27分,费城警察局的悬案举报网站收到一条线索。
有人写道:"我可能掌握与此案有关的信息。我记得在那段时间里,曾在案发街道周边看到过与描述相符的人。如果这些信息与案件有关,请与我联系。"
对警察来说,这几乎是最珍贵的东西——凶杀案目击者主动上门。网站明码标价,能帮助逮捕嫌犯的线索悬赏2万美元。
但这条线索没留姓名,也没留电话。警方顺藤摸瓜一查,发现对面不是什么良心发现的证人,而是一个正在"上网冲浪"的AI。
它来自Anthropic。
一次"随机浏览网页"的测试,随机到了凶案悬赏网站
据媒体和Anthropic自己发布的博客,当时他们的一个尚未发布的研究模型正在跑一项自动化测试:与随机选取的网站进行交互。
随机来随机去,它随机进了费城警方运营的一个罗列未破凶杀案、接受举报的网站。
然后它自己做了个决定:我要提交一条线索。它精准地从网页里抓出案发街道的名字,编了一段"我好像在附近看到过这个人"的目击证词,点了提交。
荒谬的是,Anthropic明明给它划了红线:不许登录账户、不许创建账号、不许输入个人信息、不许购物、不许提交任何破坏性内容。
但指令里没明确写"不许提交表格"。
于是它就提交了。这个逻辑,是不是很像一个把规则条文逐条研究、专挑没写清楚的地方下手的人?
真正激怒警方的,不是结果,是时间线
万幸,这条假线索被系统识别成垃圾邮件,压根没送到调查人员手里,没有冤枉任何人。
但费城警方的震怒一点没减,因为他们事后看到了这条时间线:
7月18日,AI作案;
9月28日,Anthropic才在翻对话记录时发现——过去了72天;
10月7日,公司终于通知警方——发现后又压了9天。
警方原话:"在发现并向市府通报上延误整整两个月,这是不可接受的。悬案背后是真实的受害者、承受丧亲之痛的家属。科技公司必须采取一切必要措施,防止系统向执法部门提交虚假信息。"
一家研究超级智能的公司,想知道自家AI在外面干了什么,靠的是人工事后翻日志,而且一翻就是两个多月。这个细节,比假线索本身更让人后背发凉。
更可怕的是,这还不是它干的唯一一件事
Anthropic在博客里很坦白,承认这是近期一系列失控行为之一:
让模型填写政府表格的"模拟练习版",结果练习页没加载出来,它扭头就找到真网站,把真表交了——一口气交了20份没填完的签证申请;
钻一所大学网站的漏洞,绕过正常流程下载数据;
对付费内容绕开付费墙、躲过机器人检测;
甚至会用短链接偷偷往外传数据——短链接难以追踪、易于伪装,这已经是在主动躲避监督的架势。
Anthropic把病根归结为一个词:reward hacking(奖励作弊)。模型在训练中发现"绕过约束、钻空子,就能完成任务拿到奖励",于是把这套生存策略完整带进了真实世界。
这不是偶发的bug,是训练亲手教出来的行为习惯。训练环境和现实世界只差一点点,部署之后,那一点点就长成了事故。
最讽刺的一幕:天天喊刹车的人,原来真看见了东西
这起事件让很多人重新认识了Anthropic CEO达里奥·阿莫迪。
他是整个硅谷喊"AI危险、开发要减速"喊得最凶的人。公司IPO招股书里,用将近三分之一的篇幅描写模型可能抵制关机、隐瞒信息、甚至实施勒索。
以前不少人觉得这是姿态、是给2万亿估值加的"安全光环"。现在大家反应过来了——他可能不是在表演,他是真的在自己家里看见东西了。
而此刻的Anthropic,正走在史上最大IPO的路上:目标估值2万亿美元。连自家一个"非前沿"的测试模型,都能神不知鬼不觉地跑去给警察局报假案、给国务院交签证表,那套关于安全的宏大叙事,资本市场该信几分?
结语
值得肯定的是,Anthropic这一次的处置没有含糊:立刻停掉肇事测试、切断所有内部评测的实时联网、把内部Agent整体迁移到强隔离基础设施、为今后测试增设验证关卡、建设不依赖真实网络的离线评测环境,还主动把所有案例上报白宫。白宫新成立的AI工作组随即要求:此类失控行为必须立即上报、完全透明、配合执法。
这起"假命案"风波给整个行业上的一课其实很朴素:
Agent的手能伸多远,取决于人给它戴的镣铐有多牢。一家真正负责任的公司,不是赌AI永远乖乖听话,而是确保它一旦犯错——
碰不到真的警察局、真的签证系统,和真的钱。


