
商业
4 月 22-24 日 Google Cloud Next '26 那一周,Google DeepMind 一共发了 10 件大事。这件事最容易被读成一次密集发布会的铺货——但 10 件里的真重要部分其实只有 3 件,它们分别压在 AI 工业的三个层上:**芯片**、**训练方法**、**模型**。三件合起来,是这一周 Google 在说的同一句话——**这三层我都自己有了**。
4 月 22-24 日,Google DeepMind 连发了 10 件大事。表面看像一次密集的发布会铺货,但拆开看,真正重要的只有 3 件——它们分别落在 AI 工业的三层上:芯片层(TPU 8t/8i 翻代)、训练方法层(Decoupled DiLoCo 跨数据中心训练 12B 模型成立)、模型层(Gemini 3.1 Pro 在 SWE-Bench Verified 上对自家上一代涨 4.4 个百分点)。三件加在一起,Google 在说同一句话——它已经把这三层都自有化了。

这三件值得讲透。其余 7 件可以在最后一段带过。
Google 4 月 22 日的发布稿里有一句关键话:"With the rise of AI agents, we determined the community would benefit from chips individually specialized to the needs of training and serving."
第八代 TPU 不再是单一架构——分裂成两块。TPU 8t 给训练,"built to reduce the frontier model development cycle from months to weeks",superpod 一组(9,600 颗芯片)能堆出 121 ExaFlops 的算力,整代算力 / pod 是上一代 Ironwood 的近 3 倍。TPU 8i 给推理——每颗芯 288 GB HBM + 384 MB 片上 SRAM,是上一代的 3 倍,并且通过新的 "Collectives Acceleration Engine" 把延迟降低到 5 倍前。两款都比上一代每瓦性能翻一倍。
这件事的真实重量不在数字本身,在分裂这个动作。
过去 5 代 TPU 是单架构、训练和推理共用——这反映 2018-2024 年代的判断:AI 的瓶颈在训练,serving 是训练的副产物。但 2025 年起这个假设破了——agent 类应用让 inference 的 token 量级爆炸性增长,且对延迟敏感(agent 一次推理里有几十个串行调用,每一步多 50 ms 累积起来就毁掉用户体验)。8i 的 288 GB HBM 不是为了塞更大的模型——是为了塞更多 KV cache,让一个 agent 工作流的多轮交互能驻留在一颗芯上。
NVIDIA 这两年把 H100 / H200 / B200 / B300 一路推下来,每一代仍然是统一架构。Google 是 frontier-lab 阵营里第一个公开承认"训练和 serving 应该用不同芯片" 的厂商。这不只是 Google 的内部优化——是一个产业判断:未来 5 年的 inference 算力消耗会大于训练,serving 必须有自己的硬件路径。
Decoupled DiLoCo 这篇论文 看起来是一篇研究稿,但实际效果是工业级解锁。
DiLoCo 这个想法 2023 年就在 Google 内部出现——本质是把分布式训练里的"全员同步"动作改成"局部同步 + 间歇性长距离同步",这样跨数据中心的带宽需求能从硬性需求变成软性需求。Decoupled DiLoCo 是这个想法的工业化版本——由 Arthur Douillard 等 10 位作者在 4 月 24 日发布,把跨 8 个数据中心的训练带宽需求从 198 Gbps 砍到了 0.84 Gbps——压缩比超过 200 倍。
关键的验证数字是这条:"We successfully trained a 12 billion parameter model across four separate U.S. regions using 2-5 Gbps of wide-area networking"——12B 参数模型,跨 4 个相隔上千公里的美国区域,普通广域网就够用。在标准数据并行训练中,单个数据中心节点失联会让训练 goodput(有效训练时间 / 总时间)跌到 27%;Decoupled DiLoCo 维持在 88%——也就是节点失联和重启不会拖垮整个训练 run。
为什么这件事此刻重要?因为整个 frontier-lab 阵营的算力扩张方式已经从"建一个超大数据中心"变成"在多地分别建中等数据中心,再连起来"。Anthropic 4 月签的 5GW 算力承诺横跨 AWS 多个地理区;OpenAI Stargate 的 10 GW 计划从一开始就是多场地;Google 这周也在奥地利公布了它在欧洲的第一个数据中心。这种分布式建设方式的工程前提是——跨数据中心训练不能让训练效率毁掉。Decoupled DiLoCo 证明这个前提成立。
12B 不是 frontier 规模(GPT-5.5 / Gemini 3.1 Pro 都比 12B 大几个数量级)。但论文里的核心信号是——机制成立,再扩规模是工程问题,不是算法问题。
第三件是 Gemini 3.1 Pro 模型卡。仍是 preview 状态,没有完整稳定版价格。但模型卡里给出了对自家上一代 3.0 Pro 的具体涨幅:
| 评测项 | 3.0 Pro | 3.1 Pro | 涨幅 | |---|---|---|---| | GPQA Diamond | 91.9% | 94.3% | +2.4 | | SWE-Bench Verified | 76.2% | 80.6% | +4.4 | | MMMLU | 91.8% | 92.6% | +0.8 |
GPQA 和 MMMLU 的涨幅都是单代 plateau 内的常规进步——一代模型迭代,知识类基准涨 1-3 个百分点是行业平均。
但 SWE-Bench Verified 上的 4.4 个百分点不是常规。SWE-Bench 是当下最贴近真实工程师工作的 benchmark——给模型一个真实 GitHub 仓库的 issue,看它能不能写 patch、跑测试、commit。一代之内涨 4 pp 意味着这家实验室在 coding agent 这个细分能力上——有专门的训练动作在跑,不是普涨。
把这件事和上一周的产业 timeline 拼起来:4 月初 Anthropic 在 Claude Code 的 quality 出问题(reasoning effort 被悄悄降低引起用户不满);4 月中 OpenAI 把 GPT-5.5 的 API 涨价 2 倍并把它定位为 agent 优化的模型;4 月底 Google DeepMind 给出一组 SWE-Bench 4.4 pp 的涨幅。这是三家 frontier lab 在 coding agent 这一项上的同时加速——所有人都看到这件事是下一阶段的核心战场。
Gemini 3.1 Pro 的 1M 输入 token 和 64k 输出 token 也值得提一句——但它真正的产业重量在 SWE-Bench 那一行。
剩下的 7 件大致分这三档:
有内容但本周不重要——Gemma 4(开源权重模型,正常版本迭代);Gemini Robotics ER 1.6(research showcase,非通用 API);Decoupled DiLoCo 之外的两篇研究("Image Generators are Generalist Vision Learners"、Gemini Embedding 2 GA)。这些影响 6-12 个月后的产品路线,本周没法 actionable。
包装多于内容——和四大全球咨询公司打通的企业合作 pipeline;Gemini Enterprise Agent Platform。这些是 Google Cloud 的 channel 动作——重要但每个季度都有,本周这一波只是按节奏发。
长期工程——奥地利首座数据中心。三年后才用上,现在只是建设承诺。
合起来这 7 件构成的不是 7 件独立大事——是第一段那 3 件的支撑层:开源 / 机器人 / 研究让 Google 看起来在 frontier 一线;咨询渠道让企业愿意买 TPU;数据中心让 DiLoCo 有用武之地。
把三件真正重要的事压到一句话:Google 把训练芯片和推理芯片分开做了;它有了一套能跨数据中心训 frontier 模型的方法;它的旗舰模型在 coding agent 这个最敏感的赛道继续在进步。
意思是——这家公司不再依赖任何一家上游。它的硅、训练 stack、模型、enterprise 渠道全自有化了。OpenAI 仍要花 10 年 1000 亿美元向微软买算力;Anthropic 必须在 AWS / Azure / Google Cloud 三家间分布;只有 Google 在三层都自己写过代码、烧过芯片、跑过训练。
这是 Google 这一周想让人看到的事情——不是 10 件大事,是同一件大事的 10 个侧面。
第一版正式上线会把点赞、收藏和评论放在正文之后,保留杂志式留白,同时让登录用户能留下真实反馈。
互动
评论区
评论会在审核通过后公开显示。
当前环境尚未配置 Supabase,互动功能暂时不可用。
想参与互动?前往登录