好家伙2026-04-24 12:00

自己卖 TPU,又替 Thinking Machines Lab 租下 NVIDIA——Google 在 4 月 22 日做了两件看起来矛盾的事

导读

Google 在 2026 年 4 月 22 日的 Cloud Next 上做了两件看起来不协调的事。

一家既卖 AI 芯片、又帮别人把模型跑在 NVIDIA 上的公司,想同时占住基础设施的两端。

Google Cloud 展区入口霓虹标识
图注:Google Cloud 展区入口的霓虹灯标识。它对应的是这篇稿子的主线:Google 想同时占住 AI 芯片供应商和 AI 基础设施房东这两个位置。来源:Joan Cros / NurPhoto / Getty Images via TechCrunch。

第一件:发布了第八代 TPU——训练用的 TPU 8t 和推理用的 TPU 8i。TPU 8t 的单一 superpod 可扩展到 9600 颗芯片、2 PB 高带宽共享内存,训练性能相较上代 Ironwood 提升约 2.8 倍;TPU 8i 在推理侧把片上 SRAM 提升到 3 倍,能同时跑起数百万个 agent 而不出现延迟瓶颈。Sundar Pichai 在主题演讲里同时宣布:今年 Google 在 AI 基础设施上的资本开支区间是 1750 亿到 1850 亿美元。

这是对 NVIDIA 的一次正面出击。过去十年,Frontier 级 AI 训练的默认选项是 NVIDIA 的 GPU;Google 现在把 TPU 8t 直接贴着 NVIDIA 的最新一代旗舰对比,说我自己做的芯片做同一件事更便宜、更省电、也更适合 agent 时代。

TPU 8t 与 TPU 8i 芯片
图注:Google Cloud 官方发布的 TPU 8t(训练)与 TPU 8i(推理)主视觉。它对应的是这篇稿子的第一条线:Google 自研芯片开始按训练 / 推理分体走,直接对标 NVIDIA 的 H100 / GB200 阵型。来源:Google Cloud blog。

第二件事发生在同一天稍晚一点。

TechCrunch 率先披露:Mira Murati 创办的 Thinking Machines Lab 与 Google Cloud 签下了一份金额达数十亿美元的多年基础设施合同,其中核心算力底座不是 Google 自己的 TPU,而是 NVIDIA 最新一代的 GB300 GPU。

这两件事放在一起看,第一眼是矛盾的。既然 TPU 8t 能把训练性能拉到 Ironwood 的 2.8 倍,那为什么当一个 OpenAI 级别的 Frontier Lab 落地到 Google Cloud 时,底层不是 TPU 而是 NVIDIA GB300?

但这里没有矛盾。这是一个战略,分两条线同时推进。

两条线在同时推进

第一条线是"芯片供应商"。TPU 8t/8i 瞄准的是能把自家模型和工作流深度绑定到 Google 自有芯片上的那批客户——主要是 Google DeepMind 自己的 Gemini 系列,以及愿意为云侧性价比做 porting 的中长尾客户。这条线的对手是 NVIDIA。

第二条线是"基础设施房东"。Google Cloud 要对标的是 Microsoft Azure 对 OpenAI 的绑定。Azure 的底层是 NVIDIA 的大量 GPU 集群,OpenAI 在上面做训练和推理;Google 要从 Azure 手里抢 Frontier Lab 级别的客户,做法就是——不再强迫这些客户必须迁到 TPU。Thinking Machines Lab 不想离开它已经熟悉的 CUDA / GPU 工程栈,Google Cloud 就把 GB300 直接端上去。这条线的对手是 Azure。

换句话说,Google 在同一天里把自己同时放到了"NVIDIA 的竞争对手"和"NVIDIA 的超大客户"两个位置上。它不认为这是自相矛盾——因为在 2026 年这个时间点,AI 算力的需求大到没有一家公司能只靠一条腿吃下整个市场。

按层分工的时代结束了

这件事最值得记一下的,是它倒过来说明了 AI 基础设施已经进入的一个新阶段。

过去几年,外界讨论 AI 竞争时,习惯把公司按层划分:芯片层(NVIDIA、AMD、Google、AWS、博通)、云层(AWS、Azure、Google Cloud、Oracle)、模型层(OpenAI、Anthropic、Google DeepMind、Mistral)、产品层(ChatGPT、Copilot、Gemini)。每家公司选一层做主业,再零散涉足相邻层。

但 Google 的 4 月 22 日等于明说:这种按层分工的理解方式已经不适用了。它同时做芯片、做云、做模型、做产品,而且在芯片和云这两层里,它愿意同时当供应商和 NVIDIA 的分销商。这种姿态在硬件行业的历史上并不常见——它更接近于 2000 年代的 IBM 试图"同时做 CPU、做服务器、做咨询、做软件"。

这么做当然有成本。Google 要为两条线维护两套工程栈:TPU 的软件生态,和对 NVIDIA CUDA 客户的一级支持。它也要容忍内部这两条线之间的张力——Google Cloud 卖 GB300 带来的收入,会让 TPU 部门的进步显得没那么紧迫,反过来也一样。

但相比之下,只当供应商(像 NVIDIA)或只当房东(像 Azure)的风险反而更大。前者要担心客户自研芯片;后者要担心芯片厂商直接跟客户谈。两条腿走路的 Google,至少把这两个风险对冲进了自己内部。

一个季度之内就能看出对错

Sundar Pichai 在发布会上没有用"对冲"这个词,他用的词是"选择"——"客户应该有选择"。这几乎是这条路线最干净的口径。

接下来几个季度会很快说明这条路线走不走得通。如果 Thinking Machines Lab 之后真的有模型进入生产部署——并且稳定跑在 Google Cloud 的 GB300 上——那意味着 Google 已经从 Azure 手里挖到了第一块肉。如果 Google 自家的 Gemini 接下来的训练效率曲线能明显被 TPU 8t 拉动,那 TPU 线也会被越来越多的外部 Frontier 客户严肃考虑。

两条线都赢,这条战略就是对的。

哪怕只有一条线赢,在 1750 亿到 1850 亿美元的年度 Capex 背景下,也算回本。

把互动收束在正文之后

第一版正式上线会把点赞、收藏和评论放在正文之后,保留杂志式留白,同时让登录用户能留下真实反馈。

互动

评论区

评论会在审核通过后公开显示。

0/500· ⌘/Ctrl + Enter 提交

当前环境尚未配置 Supabase,互动功能暂时不可用。

想参与互动?前往登录

  • 还没有公开评论 — 欢迎成为第一位留言的人。累计历史互动 0,新评论将从这里重新开始。

相关阅读