好文章2026-04-21 18:40

当安全路线图开始像产品路线图一样更新,Anthropic 想把前沿模型治理做成可迭代系统

导读

Anthropic 的 `Responsible Scaling Policy` 已经不是第一次更新了。

Anthropic 当前生效的 Responsible Scaling Policy Version 3.1,看上去像一次文档更新,真正更重要的却是:前沿模型公司的“治理”正在从原则承诺,变成带阈值、流程和问责链路的持续运营系统。

Anthropic Responsible Scaling Policy 官方页面页首
图注:Anthropic 在 Responsible Scaling Policy 页面展示的当前政策页首。图中可见该页在 2026 年 4 月 2 日更新,并将前沿模型治理写成持续迭代的公开页面。来源:Anthropic。

但当前生效的 Version 3.1 仍然值得单独写一篇稿子,因为它暴露出来的不是某一条条文的变化,而是一种越来越清晰的趋势:前沿模型公司的治理机制,正在越来越像产品机制,而不只是企业价值观文本。

这听上去像一句抽象判断,实际上却非常具体。

Anthropic 这套政策现在已经不只是告诉外界“我们重视安全”,而是在持续细化几个更硬的东西:不同 AI Safety Level 的触发条件是什么,训练和部署前需要什么样的证据,内部如何升级报告,出现分歧时谁有权介入,员工如何在不担心报复的情况下提出安全担忧,以及公司在什么情况下必须提高保障等级。

换句话说,它已经在从原则语言,走向可执行的运营语言。

这份文件真正重要的地方,不是“更谨慎”,而是“更系统”

人们谈 AI 安全时,经常容易把公司分成两类:口头承诺多的,和真正认真做的。问题是,光靠态度描述,并不能看出一家公司的治理能力到底成熟到什么程度。

Anthropic 的这套 RSP 之所以重要,恰恰在于它让外界第一次更清楚地看到:所谓“认真做安全”,其实要被拆解成一套能持续运转的系统。

这个系统至少包括几个层次。

第一层是阈值。也就是公司如何判断模型能力已经跨过了什么风险边界,什么时候要进入更高等级的保障。第二层是保障。也就是一旦到达更高风险区域,公司要拿出哪些技术、组织和运营措施。第三层是升级路径。也就是内部意见如何被上报、谁有责任拍板、不同部门的判断如何汇合。第四层则是问责和文化,即员工如果发现问题,是否真的有一条不会被压下去的渠道。

这些事情看起来“不像产品”,但其实非常像产品。

因为它们都需要版本更新、运行反馈、组织维护和真实执行。

为什么这件事在 2026 年变得更重要

前沿模型公司过去也谈治理,但 2026 年这件事的语境已经不同了。

模型能力越来越强,系统的部署节奏也越来越快。过去一家公司可以把安全文件更多当作对外说明,用来建立信任;现在不太行了。因为问题已经不是“你是不是说了正确的话”,而是“当能力真的上升、上线真的变快、商业压力真的变大时,你的组织是否还能按既定机制运转”。

这也是为什么 RSP 3.1 值得看。它所传递出来的感觉,不像一份静态宣言,而更像一份正在被持续调试的运行手册。

Anthropic 甚至把反报复条款、内部报告和升级链条都写得更明确,这其实是在承认一件很多公司不愿明说的事实:前沿模型治理最脆弱的地方,常常不在外部,而在内部。安全问题能不能真的被提出来、不同判断能不能被认真处理、商业与安全出现冲突时谁能踩刹车,这些都属于组织工程,而不只是技术工程。

治理正在变成前沿模型公司的“产品能力”

如果顺着这个角度往下看,会发现 Anthropic 这套更新真正有意思的地方,是它在悄悄重定义“治理”的位置。

过去人们会把治理理解成技术之外的附属层,像是公司必须有、但不直接构成产品竞争力的那一部分。现在越来越像不是这样了。对前沿模型公司来说,治理本身可能已经变成一种核心能力。

原因很简单。模型越强,部署越广,系统就越不可能只靠研究团队单点判断去管理。你需要制度化地判断能力阈值、制度化地配置保护措施、制度化地处理内部异议、制度化地向外部解释自己为什么可以继续推进。谁能把这些事做得更像一个持续系统,谁就更有可能在更长时间里保持可控扩张。

从这个意义上说,Anthropic 现在做的事,很像是把“治理”推进成产品基础设施。

它不直接生成文本、不直接服务用户,却决定了前沿模型能以什么方式被训练、部署和扩展。

真正的难点,是这套系统能否在压力下工作

当然,写得更系统,并不自动等于做得更好。

AI 安全文件最容易面对的质疑,恰恰是“纸面很好看,关键时刻会不会真的执行”。这也是 RSP 3.1 的真正考题。因为前沿模型公司的现实环境非常复杂:投资人在看增长,市场在看节奏,用户在看体验,研究团队在追能力曲线。治理文件只有在这些力量真正撞到一起的时候,才会显示出它到底是不是系统。

这也是为什么反报复、升级报告、清晰阈值这些条款特别重要。

它们并不是锦上添花的道德装饰,而是在为系统最脆弱的时刻做准备。真正成熟的治理,不是平时大家都同意时看起来井井有条,而是出现强烈分歧时,仍然有机制把风险判断顶上来。

如果说模型是解决问题的机器,那么治理其实是在解决“机器什么时候不该被推得更快”的问题。

这类文件会不会成为行业的新基础设施

Anthropic 并不是唯一谈治理的公司,但它这次更新更能说明行业正在往哪里走。

未来,前沿模型公司的竞争很可能不会只在模型指标、部署速度和客户规模上展开,还会包括谁能建立一套更可信、也更可维护的治理系统。对于外部合作伙伴、监管者、大客户和高风险行业来说,这些东西的意义会越来越大。因为他们最终要判断的不只是“这家公司技术好不好”,而是“它在出问题前能不能先看见问题,在出问题时能不能真的停下来”。

从这个角度看,RSP 3.1 这样的文件未必会直接决定市场份额,但它很可能会慢慢决定另一件更深的事:谁会被视为更能长期承载前沿模型风险的公司。

Anthropic 这次真正提醒人的,是治理的时间尺度变了

所以,Anthropic 这次最值得写的,不是它把哪条规则又改细了一点,而是它释放出一种更底层的信号:前沿模型治理已经不再适合被理解成一锤子定音的原则文件。

它越来越像一个会更新、会迭代、会与产品节奏一起变化的系统。

这意味着,未来人们看 AI 安全,也许不能只问“你有没有政策”,而要问另一层问题:这套政策是不是有版本、有没有阈值、能不能升级、谁来维护、谁来承担代价。因为只有当这些问题被放进组织运行里,治理才真正从态度,变成能力。

如果 2024 和 2025 年是前沿模型公司把“安全”说得更清楚的阶段,那么到了 2026 年,像 Anthropic 这样的公司正在尝试回答另一个更现实的问题:怎么把它做成一个真的会运转的系统。

把互动收束在正文之后

第一版正式上线会把点赞、收藏和评论放在正文之后,保留杂志式留白,同时让登录用户能留下真实反馈。

互动

评论区

评论会在审核通过后公开显示。

0/500· ⌘/Ctrl + Enter 提交

当前环境尚未配置 Supabase,互动功能暂时不可用。

想参与互动?前往登录

  • 还没有公开评论 — 欢迎成为第一位留言的人。累计历史互动 0,新评论将从这里重新开始。

相关阅读