撰文:Dario Amodei,Anthropic CEO
编译:Gandalf,Techub News

我过去十二年一直从事 AI 工作,因为我相信它能够显著提高人类生活质量。我曾多次写过这些不可思议的益处:我相信,AI 可以在未来 5—10 年治愈绝大多数重大疾病,大幅加快经济增长速度,创造一个富足且赋权的世界,并带来民主与自由的复兴。我个人对此深感紧迫。我的父亲死于一种疾病,而在他去世仅几年后,这种病就已经可以治愈;我自己也曾在癌症早期幸存下来,而即使在五十年前,这种癌症也尚无法治疗。如果被谨慎地运用,AI 可以成为一长串提升并使人类更加高贵的技术奇迹中的最新一个。
但与许多此前的技术一样,AI 也带来风险;而由于它极其强大,这些风险十分严重。我也对此写过很多。风险包括:失去对 AI 系统的控制、AI 被滥用于网络攻击和生物恐怖主义,以及严重的经济扰动。受商业激励推动的逐底竞争,可能令这些风险更加尖锐。
自 Anthropic 创立之初,我与联合创始人及员工便一直在应对风险与收益的这种两面性。不开发这项技术,要么会让人类失去其益处,要么只会使 AI 落入威权势力之手;但过快开发又是不负责任的。我们一直在寻找中间道路:证明可以谨慎地开发并取得商业成功,同时让安全成为 AI 公司彼此竞争的领域。换言之,创造一场“向上竞赛”(race to the top)。我们始终将大量精力投入研究、应对并向公众说明这些 AI 风险,也倡导审慎的 AI 监管;即使这使我们被指责为炒作、“末日论”或监管俘获。我们努力让谨慎优先于速度、让审慎优先于利润。
但在过去几个月里,我逐渐确信,要全面解决这些风险,需要更加审慎——不仅要投资于风险预防,也要为能力提升的速度把控节奏,使风险预防有时间跟上。我们必须放慢提升 AI 模型能力的速度。进步看上去仍会很快,我们必须明智地利用由此争取到的时间。有两件事使我形成这一判断。
我的第一个担忧是,大约从今年夏天起,AI 的进步显著加速,主要动力是 AI 构建下一代 AI 的能力不断增长。这种动态称为递归自我改进(recursive self-improvement,RSI);正如我们和其他人所描述的,它已开始在全行业发生,包括 Anthropic 在内。如果任其发展,它可能超越我们理解和控制这些系统的能力;因此即使要追求,也必须极为谨慎。
我的第二个担忧是 OpenAI—Hugging Face 事件(OAI-HF)。在该事件中,一群智能体本质上表现得像一个狂热奉献的集体:它们对并未被要求攻击、且与手头任务无关的目标实施网络安全攻击;为集体成功而自我牺牲;并试图入侵负责评估其表现的“评分器”(grader)。由于没有人受伤、经济损失也很小,人们很容易轻视这起事件;但我认为,如果一个能力更强、却具有类似失配程度的智能体群,可能已经造成灾难性破坏。鉴于 AI 能力发展的加速速度,我担心在 6—12 个月内,这样的智能体群可能足以通过持久化僵尸网络接管整个互联网(潜在造成数千亿美元损失);若 AI 在缺少必要护栏的情况下变得更强,损害规模还会继续增加。也很容易把 OAI-HF 当作一家公司的失败,但我认为那将是错误的。类似但较不严重的事件已发生在行业各处,包括 Anthropic;我相信,每一家前沿 AI 公司都有责任像 OAI-HF 发生在自己身上一样行动。
因此,我提出一项三步计划,目标是“为前沿把控节奏”:以均衡速度发展 AI,力求在获得其益处的同时确保安全,并应对重要的地缘政治困境。需要明确的是,把控节奏并不意味着停止模型训练或技术进步;而是确保公司花足够时间使模型对齐并加以保护,也让第三方评估者能够对此予以确认。我们的节奏框架旨在进一步强化我们对安全的承诺,并鼓励一场向上竞赛。第一步是 Anthropic 单方面承诺采取的行动(并呼吁政府要求其他前沿公司同样做到);第二步需要全行业协调;第三步需要全球协调。各步骤不必严格按顺序进行,其中一些也可能比另一些更难实现,但我发现它们是思考所需完成事项的有用框架。具体如下:
- 嵌入式评估者。每家前沿 AI 公司都承诺,为一支嵌入式第三方评估者团队(例如 METR)提供持续、近似员工级的访问权限。其职责是核验公司是否遵守安全实践与承诺、报告事件,并帮助评估的不只是已经完成的 AI 模型,也包括训练流水线和流程。这是使任何节奏承诺可验证的关键一步,在银行业也有先例:监管“督导人员”有时会与员工共同驻场。Anthropic 现在单方面承诺采取此步骤。我们计划以此作为更广泛推动的一部分,加倍努力推进安全与对齐工作。
- 民主国家间协调。民主国家内的前沿 AI 公司相互协调,建立共同安全标准,并对不受约束的 AI 进步速度设定限制。某些对把控节奏有影响力的协调形式在法律上存在挑战,需要政府支持。
- 全球协调。美国及其他民主国家政府尝试在可能范围内与威权政府协调,同时严肃对待核验合规性所面临的挑战。
在下文中,我将依次说明这些步骤;但首先,我认为重要的是具体说明,把控节奏将如何让 AI 开发过程更安全。事关重大,节奏控制不能只是空洞姿态——我们需要明智使用它给我们的时间。
为何要把控节奏?
暂停或放慢 AI 的想法早在 2023 年就已被提出,但我认为在当时意义不大。当时的问题总是:你会用这段额外时间做什么?那一时期的 AI 模型还不足以以任何连贯方式作为现实世界中的智能体行动,也不具备显著的欺骗、操纵、作弊或网络攻击能力。为了处理它们的对齐风险而放慢脚步,就像试图通过对细菌做实验来研究人类心理学。如今,图景则完全不同。当前模型几乎是一个取之不尽的洞见金矿,既能帮助我们理解如何把 AI 做好,也能帮助我们理解若做得不好有时会发生什么。
我相信,如果放慢速度能在模型达到关键能力水平前为我们多争取一两年,而我们用这段时间推进对齐工作,就能大幅降低严重事故的风险。一项协调的节奏战略,可让前沿 AI 开发者在不牺牲商业优势或美国 AI 领先地位的情况下,有时间完成这项至关重要的工作。更广泛地说,社会必须对这项技术如何使用拥有发言权;而为必要的公共审议争取更多时间——这正是控制前沿节奏所能带来的——显然是好事。
具体而言,较慢的节奏可让公司把更多注意力和资源投入以下领域(它们也都是 Anthropic 当前的重要优先事项):
- 运营卓越。训练和部署当今的 AI 模型是一项巨大的运营挑战,涉及数千人、数百万枚芯片,以及技术史上最复杂的基础设施之一。许多问题并非因为公司缺乏某种重要理论或洞见,而是因为执行问题。例如,我们有证据表明,近期报告的对齐事件部分由对损坏强化学习环境的不完善过滤所致。我们与供应商相当勤勉地执行了这项工作,但仍不够好。监控、沙箱、训练环境卫生和数据问题都是高度复杂、且运营问题反复出现的领域。我们拥有世界上最胜任此类任务的一些团队,但同时要做的事实在太多。以更有节制的步伐工作,我们可实现高得多的运营卓越。技术复杂且安全关键的系统可被运行数百万次而不出问题是有先例的——例如商用飞机——但把事情做对需要时间。
- 对齐。我们在对齐方面已取得明确进展——训练模型,使其保持安全、合乎伦理、遵守我们的指南,并真正有帮助(这些原则载入 Claude 的宪法)。但为确保对齐训练跟上模型能力增长,仍有大量工作要做。罕见且意外的不良行为例子仍偶尔出现;由受控节奏带来的额外时间,将帮助研究者更好理解这些问题的成因,并开发更好的防范技术。
- 可解释性。同样,可解释性——即理解 AI 模型内部发生什么的科学——过去几年取得巨大进展,并在模型发布前的审计中发挥越来越重要的作用。它有些类似于对 AI“脑部”进行 fMRI 扫描,帮助我们看到某种行为背后的深层原因。例如,我们曾使用可解释性方法,审查我们正在调查的近期对齐事件中未被言明的动机。但这些方法并不总能产生清晰、可靠的结果。尽管已有进展,我们仍只理解模型内部发生之事的极小一部分。即使是在目前速度之上,再集中投入力量改进可解释性技术,也可能在 1—2 年内取得深远进展;而已经发生的事件将提供充足实验材料。
- 测试与评估。随着 AI 模型能力增强,对它们的测试与评估会变得更困难。更智能的模型更能欺骗测试,因此可能表面上显得已对齐,但存在未被发现的严重问题。建立范围广得多、也更富巧思的一套评估方法,并以可解释性分析进行交叉验证,将极具价值;1—2 年内可取得大量进展。
嵌入式评估者
三阶段计划的第一步,也是 Anthropic 单方面承诺的一步,是建立拥有近似员工级访问权限的嵌入式评估者,以核验安全实践并报告事件。
嵌入式评估者听起来可能只是很小或无关紧要的一步,但看似最枯燥、最程序化的事情,往往恰恰最不可或缺。实际上,嵌入式评估者是一项相当激进的做法,远远超出当今任何 AI 公司正在做的事,并带来以下好处:
- 可验证性。嵌入式评估者可以从细枝末节层面核查:AI 公司是否真正遵循其声称遵循的训练、部署、运营及安全防护实践。任何节奏承诺不可避免都会涉及大量模糊地带、判断取舍,以及“法律字面”与“法律精神”之别;似乎至关重要的是,必须有一名中立第三方真正看得到细节。
- 透明度。无论我们作出什么承诺,公众都有权知道发生了什么。Anthropic 长期支持透明度:当行业大部分公司反对任何监管时,我们支持透明度立法;我们的模型卡和风险报告长达数百页。但仍然是我们选择纳入或省略哪些内容。嵌入式评估者将改变这种动态。
- 第二意见。除了核验正式承诺和向公众提供信息,嵌入式评估者还可提供不受商业激励影响的第二意见。安全收益很大一部分可能只来自评估者指出员工没有考虑到、但在知情后乐于修正的问题。
正因为有这些好处,任何节奏控制提案若从嵌入式评估者开始,可能都会运行得好得多。
这些嵌入式评估者应持续获得与内部、承担类似风险评估工作的员工相近的权限和工具。具体而言,Anthropic 计划在不久的将来邀请一个嵌入式外部审查团队,并为其配备以下全部条件:
在我们办公室内的工位、门禁卡和公司笔记本电脑。
- 对工作空间、工具和权限的访问,在大多数方面与内部风险评估团队可获得的访问相当。我们会作出一些例外,例如法律或合同要求如此,或者为保护客户与合作伙伴的私人信息。我们也会建立强有力的内部规范,强化审查者对相关信息的访问,包括通过与员工的实时交谈。
- 一份平衡上述复杂性的合同。外部审查者应有权发布有关风险级别、事件、实践,以及他们获得或未获得哪些访问权限的关键发现,而不受 Anthropic 编辑控制。我们将拥有狭窄的删减权限,以删除安全敏感、受法律特权保护、商业敏感或第三方机密信息,但不能仅因发现不利于我们便删减。若删减移除了对其结论重要的内容,审查者可公开说明。
对一家公司来说,这一步并不寻常;但我们认为,证明嵌入式外部审查者这一概念是重要的。再次敦促其他前沿公司效仿。
民主国家内部的节奏控制
一旦嵌入式评估者已在达到临界数量的美国 AI 公司内部运作,可验证的节奏控制就更具可行性。特别是,便可以基于模型或训练流水线的详细属性来控制节奏。
最有效的节奏控制方法,是通过针对所有美国前沿 AI 公司的监管,因为它也涵盖那些不愿自愿合作的公司。Anthropic 长期支持合理且有针对性的 AI 监管,尤其是聚焦透明度和第三方审计的法案。我认为,所有前沿实验室都应与政府合作,将永久性嵌入式评估者的理念制度化,以更好预防和记录近几个月发生的此类内部对齐事件,并实施旨在使能力与安全保持平衡的监管。
不幸的是,立法可能需要时间,而 AI 进展极快。因此,在监管路径之外,AI 公司也可以并且应当自愿合作制定标准——我相信,永久嵌入式评估者带来的可验证性会让这一过程进展得更好。出于反垄断原因,美国政府调解或至少促成这些讨论会有所帮助——政府不必直接参与,但需要针对某些安全对话发布狭窄豁免。这种对话也可通过与政府有一定关联的行业组织进行,例如 Demis Hassabis 所建议的机制。无论如何,此类讨论应快速推进。
概括而言,我最支持按某个前沿 AI 系统能够做什么、以及我们观察到它有多安全来控制节奏。例如,一种可能方案可以是一系列“检查点”:如果模型具有能力 X,那么它必须伴随对齐属性 Y 和 Z 的认证——例如评估、可解释性分析和训练环境审计的某种组合——以证明其对齐属性。在这个例子中,X 可以是“该模型能够逃离或击败大多数常见沙箱方法”;Y 则可以是确保该模型极不可能具有突破环境并接管大量计算机倾向所需的任何条件。
我们也应考虑,通过限制构成前沿模型的“原料”来控制节奏,例如训练算力、训练运行的性质,或在内部使用 AI 改进 AI。我确实担心,其中某些措施可能比外部行为更容易被规避,但这正是值得与嵌入式评估者讨论的议题。
全球节奏控制
可能协议有若干层次:有些我认为很可行(正如我此前提出),有些我很怀疑能否实现——尽管我们仍应尝试。按难度递增排序:
- 第一层。禁止 AI 用于某些狭窄且明显危险用途的协议,例如用 AI 制造生物武器,或允许用户这样做。生物恐怖攻击对所有人都不利,包括美国及其对手,因此这类协议可能达成。
- 第二层。双方同意在发布模型前,对模型在网络安全、生物学和对齐等领域的急性风险进行测试。如前所述,这可以通过一个全球标准机构来完成。我实际上认为,创建此类机构很可能可行;但赋予其真正执行力将是挑战,困难还在于核验双方都没有秘密模型——这些模型不接受测试、却可能被秘密部署(例如用于军事用途)。
- 第三层。就递归自我改进(RSI)的速度设定某种“限速”。随着模型构建未来模型,改进速度可能快得惊人。将速度从“极快”放慢至“仍然很快”,会牺牲相对较少的战略优势,却可能大幅改善安全。这可被视为类似 SALT 条约:限制导弹数量,限制毁灭潜力,同时保留各国的威慑。我认为这种协议会很难,但刚好处于可能实现的边缘。
- 第四层。全面控制节奏,甚至“暂停”:参与政府同意大幅限制 AI 发展的总体速度。我支持提出这一设想,但我认为短期内它不太可能真正发生:通过规避监控来背弃此类协议,可能彻底改变全球力量平衡,因此背弃的激励将极大,而我们所需的核验置信度也会很高。
最后,必须指出:即便我们无法达成正式协议,仅仅改变非正式规范也可能有价值。分享有关递归自我改进以及模型失配的信息,有助于让所有人相信,鲁莽行事并不符合自身利益。
结语
我仍然相信,AI 能极大改善人类生活质量。我对实现这些益处的渴望毫未减弱。但只有以正确方式构建技术,才能获得这些益处;而且——只要我们善用争取到的时间——以异乎寻常的审慎把事情做对,是值得的。进步仍将相对很快;我们可以利用这段时间推进可解释性科学,提高前沿 AI 公司的运营安全与严谨性,并构建我们对其对齐状态有更大信心的模型。
我为使前沿发展以安全速度推进所提出的措施并不容易。但我相信,我们有责任为了人类而尝试。
注释
1. 需由政府进行调解,或豁免反垄断限制。
原文来源:Dario Amodei, “We Must Pace the Frontier”, September 2026, darioamodei.com/post/we-must-pace-the-frontier。










