
智能
Google 在 2026 年 4 月 22 日的 Cloud Next 上做了两件看起来不协调的事。
一家既卖 AI 芯片、又帮别人把模型跑在 NVIDIA 上的公司,想同时占住基础设施的两端。

第一件:发布了第八代 TPU——训练用的 TPU 8t 和推理用的 TPU 8i。TPU 8t 的单一 superpod 可扩展到 9600 颗芯片、2 PB 高带宽共享内存,训练性能相较上代 Ironwood 提升约 2.8 倍;TPU 8i 在推理侧把片上 SRAM 提升到 3 倍,能同时跑起数百万个 agent 而不出现延迟瓶颈。Sundar Pichai 在主题演讲里同时宣布:今年 Google 在 AI 基础设施上的资本开支区间是 1750 亿到 1850 亿美元。
这是对 NVIDIA 的一次正面出击。过去十年,Frontier 级 AI 训练的默认选项是 NVIDIA 的 GPU;Google 现在把 TPU 8t 直接贴着 NVIDIA 的最新一代旗舰对比,说我自己做的芯片做同一件事更便宜、更省电、也更适合 agent 时代。

第二件事发生在同一天稍晚一点。
TechCrunch 率先披露:Mira Murati 创办的 Thinking Machines Lab 与 Google Cloud 签下了一份金额达数十亿美元的多年基础设施合同,其中核心算力底座不是 Google 自己的 TPU,而是 NVIDIA 最新一代的 GB300 GPU。
这两件事放在一起看,第一眼是矛盾的。既然 TPU 8t 能把训练性能拉到 Ironwood 的 2.8 倍,那为什么当一个 OpenAI 级别的 Frontier Lab 落地到 Google Cloud 时,底层不是 TPU 而是 NVIDIA GB300?
但这里没有矛盾。这是一个战略,分两条线同时推进。
第一条线是"芯片供应商"。TPU 8t/8i 瞄准的是能把自家模型和工作流深度绑定到 Google 自有芯片上的那批客户——主要是 Google DeepMind 自己的 Gemini 系列,以及愿意为云侧性价比做 porting 的中长尾客户。这条线的对手是 NVIDIA。
第二条线是"基础设施房东"。Google Cloud 要对标的是 Microsoft Azure 对 OpenAI 的绑定。Azure 的底层是 NVIDIA 的大量 GPU 集群,OpenAI 在上面做训练和推理;Google 要从 Azure 手里抢 Frontier Lab 级别的客户,做法就是——不再强迫这些客户必须迁到 TPU。Thinking Machines Lab 不想离开它已经熟悉的 CUDA / GPU 工程栈,Google Cloud 就把 GB300 直接端上去。这条线的对手是 Azure。
换句话说,Google 在同一天里把自己同时放到了"NVIDIA 的竞争对手"和"NVIDIA 的超大客户"两个位置上。它不认为这是自相矛盾——因为在 2026 年这个时间点,AI 算力的需求大到没有一家公司能只靠一条腿吃下整个市场。
这件事最值得记一下的,是它倒过来说明了 AI 基础设施已经进入的一个新阶段。
过去几年,外界讨论 AI 竞争时,习惯把公司按层划分:芯片层(NVIDIA、AMD、Google、AWS、博通)、云层(AWS、Azure、Google Cloud、Oracle)、模型层(OpenAI、Anthropic、Google DeepMind、Mistral)、产品层(ChatGPT、Copilot、Gemini)。每家公司选一层做主业,再零散涉足相邻层。
但 Google 的 4 月 22 日等于明说:这种按层分工的理解方式已经不适用了。它同时做芯片、做云、做模型、做产品,而且在芯片和云这两层里,它愿意同时当供应商和 NVIDIA 的分销商。这种姿态在硬件行业的历史上并不常见——它更接近于 2000 年代的 IBM 试图"同时做 CPU、做服务器、做咨询、做软件"。
这么做当然有成本。Google 要为两条线维护两套工程栈:TPU 的软件生态,和对 NVIDIA CUDA 客户的一级支持。它也要容忍内部这两条线之间的张力——Google Cloud 卖 GB300 带来的收入,会让 TPU 部门的进步显得没那么紧迫,反过来也一样。
但相比之下,只当供应商(像 NVIDIA)或只当房东(像 Azure)的风险反而更大。前者要担心客户自研芯片;后者要担心芯片厂商直接跟客户谈。两条腿走路的 Google,至少把这两个风险对冲进了自己内部。
Sundar Pichai 在发布会上没有用"对冲"这个词,他用的词是"选择"——"客户应该有选择"。这几乎是这条路线最干净的口径。
接下来几个季度会很快说明这条路线走不走得通。如果 Thinking Machines Lab 之后真的有模型进入生产部署——并且稳定跑在 Google Cloud 的 GB300 上——那意味着 Google 已经从 Azure 手里挖到了第一块肉。如果 Google 自家的 Gemini 接下来的训练效率曲线能明显被 TPU 8t 拉动,那 TPU 线也会被越来越多的外部 Frontier 客户严肃考虑。
两条线都赢,这条战略就是对的。
哪怕只有一条线赢,在 1750 亿到 1850 亿美元的年度 Capex 背景下,也算回本。
第一版正式上线会把点赞、收藏和评论放在正文之后,保留杂志式留白,同时让登录用户能留下真实反馈。
互动
评论区
评论会在审核通过后公开显示。
当前环境尚未配置 Supabase,互动功能暂时不可用。
想参与互动?前往登录