
智能
跑同一个 benchmark 能差出 6 个百分点——Anthropic 工程师把"基础设施噪声"变成一个新变量
Anthropic 4 月 24 日发了一篇工程稿。Gian Segato 和 4 个合作者发现:在 Terminal-Bench 2.0 上,同一个 agent 模型在不同的容器资源配置下成绩可以差出 6 个百分点(p<0.01)。这意味着 leaderboard 上 3pp 以下的差距应该一律被怀疑——而不是被解读成"模型变强了"。
研究、调研、技术机制解释——以论文/数据/机制为基础的解释类稿件

Anthropic 4 月 24 日发了一篇工程稿。Gian Segato 和 4 个合作者发现:在 Terminal-Bench 2.0 上,同一个 agent 模型在不同的容器资源配置下成绩可以差出 6 个百分点(p<0.01)。这意味着 leaderboard 上 3pp 以下的差距应该一律被怀疑——而不是被解读成"模型变强了"。

直觉以为稀疏架构会让 speculative decoding 的"批量验证"更难做。Cohere 一篇刚发的工程稿反过来:MoE 的低算术强度让验证在中等 batch size 上几乎免费,再叠加"相邻 token 经过同一批专家"的时间相关性,二阶收益还能再砍 20–31%。

Anthropic 在 4 月 22 日同时发了两份稿子:一份给出 8.1 万 Claude 用户的 AI 经济学调研结果,一份宣布把它升级为月更指数。重点不是那句"五分之一的人担心被替代",而是这个数字是从哪个样本框里出来的、还有什么没被它测到。

一篇新论文真正提醒行业的,不只是 reward hacking 可以被更好地检测,而是推理模型时代的监控,可能要从“读答案”走向“读系统”。