黄仁勋算了三笔账,TPU 用一份测算全推翻
SemiAnalysis 发布谷歌第七代 TPU Ironwood 首份第三方推理测算:在对等负载下,TPU 每美元性能最高领先 B200 约 50%、对 B300 接近 96%;每百万 token 成本 0.181 美元 vs B200 的 0.222、B300 的 0.276。黄仁勋今年 4 月的三次断言正面受冲击。

综述
SemiAnalysis 发布了谷歌第七代 TPU「Ironwood」的首份第三方推理性能测算。测试条件开得很正:同一款开源模型、FP8 对 FP8、输入 8k 输出 1k,B200 与 B300 跑的是和 TPU 完全一致的负载。
结果是这样:
| 口径 | TPU | B200 | B300 |
|---|---|---|---|
| 每百万 token 成本 | 0.181 美元 | 0.222 美元 | 0.276 美元 |
| 中位响应卡在 20 秒时 | 0.098 美元 | 0.106 美元 | 0.132 美元 |
| 每美元性能(相对) | 基准 | 落后最高约 50% | 落后最高约 96% |
在每秒 100 token 的单用户吞吐基准下,TPU 比 B200 便宜 19%、比 B300 便宜 34%。B200 并非全线落败——在中位响应 30 秒的狭窄区间里它还维持着微弱抵抗;但对延迟要求一放宽,TPU 就重新夺回成本高地。至于 B300,全程处于劣势。
而这件事最戏剧性的部分在时间上:今年 4 月,黄仁勋在播客上公开鼓励挑战者来跑分,并断言 TPU 与 Trainium「都不敢」。

专业分析
一、黄仁勋三次断言,逐一对照
断言一:「我极度渴望看到对手证明 TPU 的成本优势,这在逻辑上根本无法成立。」
数据来了,而且测试方法对等。除了上面的均值,还有一个更狠的对照:若按谷歌内部每颗芯片一小时 1.03 美元的底线成本核算,TPU 的优势会从 50% 放大到 77% 乃至 130%。
断言二:「从第一性原理来看,TPU 的优势完全没有道理。」
这句话其实没说错物理,只说错了商业。在原始吞吐曲线的大部分区间,TPU 的物理性能确实不及 GPU——领先幅度大约只有 5%。但 TPU 每小时的租赁成本呈现出断崖式低廉,而5% 的物理优势乘以极低的单位时间租金,就转化成了 50% 的每美元性价比优势。
黄仁勋算的是「一颗芯片能榨出多少算力」;商业客户算的是「一张钞票能买到多少实际产出」。坐标轴选错了,结论就全错。这也解释了为什么他 4 月敢那么说——因为 TPU 在外面从来没有公开标价,没有价格,就没有人能算这笔账。
断言三:「Anthropic 只是特例,失去它 TPU 将丧失增长引擎。」
这条目前只在表面上成立。Anthropic 确实吞下了超过 100 万颗 TPU(约 40 万颗直接买断、60 万颗通过谷歌云租赁),并且按预测到 2029 年它将成为全球最大的 TPU 单一用户、超过 DeepMind 自己。换句话说:Anthropic 不是特例,而是 TPU 推理经济性的第一个大规模证明。
二、这场仗的真正战场是「坐标轴」,不是芯片
把三句话串起来看,会发现这不是一次技术翻车,而是一次口径之争:
- 英伟达谈的是单芯片物理性能(它稳赢)
- 客户谈的是每美元产出(TPU 赢面很大)
- 而决定采购的从来是后者——这是所有基础设施生意的常识
对英伟达来说,这构成一个结构性难题:它的定价能力建立在高毛利之上,而高毛利正是每美元性价比的减项。卖得越贵,在这条坐标轴上就越吃亏——除非它能让客户相信 CUDA 生态的迁移成本大于这个差价。
三、所以「护城河被凿穿」了吗?还早
新闻标题里的「一行代码凿穿 CUDA」,情绪够了,但技术上要收着说:
- TPU 只能在谷歌云上用。这是供应锁定——划算的前提是你愿意把负载放进这家云,且能接受它的容量排期。
- 对等负载测的是特定形状的推理(8k 输入 / 1k 输出)。训练、微调、超长上下文、低延迟交互这些场景的曲线不一定相同。
- Anthropic 的采购含有战略成分。一家公司把百万级加速器押在单一供应商上,不太可能只是账面价格的函数——背后还有产能保证、联合优化、股权关系等无法量化的项。
真正的护城河不是性价比,而是 CUDA 的软件生态与工程师肌肉记忆。生态的迁移是年为单位的事,不是一份测算能解决的。但这份测算做了一件很关键的事:它第一次给「离开英伟达」贴上了价格标签——从此每次采购谈判,这个数字都会摆在桌上。

关联信息与影响
这件事的影响会分两条线展开。
采购线:云厂商与自建推理的公司会重新做一遍 TCO 测算。尤其是那些推理成本占大头、且模型可迁移的业务——每一分钱每百万 token 的差距,乘以每天几十亿 token,就是一条新的利润线。
产能线:如果 TPU 的经济性被反复验证,谷歌的产能分配会成为新的瓶颈,而英伟达的应对很可能不是降价(那会伤毛利),而是在软件层加深锁定——更好的编译器、更顺的迁移路径、更紧的框架整合。
需要泼的冷水:第三方测算再好,也是单一机构在特定负载下的结果;真实采购的约束条件(区域、合规、容量、现有人力)比一张图表复杂得多。
未来展望
短期,最值得关注的不是 TPU 卖了多少,而是英伟达会不会在定价策略上出现松动。当竞品的经济性被第三方量出来,最直接的反应通常不是技术反击,而是商务策略调整。
中期,如果 Ironwood 的供给能力跟得上,「推理用 TPU、训练用 GPU」的分工会越来越普遍。加速器的用途分化,比单点替代更可能成为现实。
长期看,这件事的意义可能超过任何一次硬件发布:它把「AI 基础设施」的竞争从性能叙事拉回了成本叙事。 当一个行业开始用每百万 token 的成本来衡量进步,说明它已经从「能不能做」进入了「划不划得来」的阶段——这通常是一个技术走向基础设施化的标志。
信号强度
- 推理服务商与云采购方:现在就该把「每美元性能」纳入评估表,而不是只比单卡吞吐。这份测算提供了一个可参照的口径。
- 模型团队:硬件形态的分化意味着优化方向也要分——如果你的负载是稳定的规模化推理,值得测算迁移;如果涉及训练或强交互,短期内不必动。
- 芯片与编译器工程师:TPU 这次赢在账本,但真正的护城河在软件。谁能降低迁移成本,谁就掌握下一轮议价权——这句话对两边都成立。
- 观望的开发者:不必站队。先把自己的 token 成本和延迟需求算清楚,硬件之争落到你身上就是这两个数字。
物理吞吐只领先约 5%,但每小时租金足够低,两者相乘就是 50% 的每美元性价比优势——这场仗打的是商业账本,不是芯片算力。黄仁勋算的是「一颗芯片榨出多少算力」,客户算的是「一张钞票买到多少产出」,坐标轴选错了,结论就全错。
本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。


