每美元性能领先50%?谷歌TPU铁三角逼近英伟达腹地
独立研究机构SemiAnalysis发布首份针对谷歌第七代TPU(Ironwood,TPUv7)的第三方推理实测:以Qwen3.5 397B的FP8模型为基准,在每用户每秒20个token的交互速度下,Ironwood单芯片总吞吐量9,364 token/s,高于B200的8,903与B300的8,925;把每小时芯片成本计入后,其每美元可产出的token比B200多50.4%,比B300多96.0%。在每用户每秒100个token的低并发场景下,Ironwood每百万token推理成本约0.181美元,低于B200的0.222美元和B300的0.276美元,分别便宜约19%和34%。该评测2026年9月8日由华尔街见闻转载披露。
单看这一组数字,尚不足以推翻什么。真正值得关注的是同一时期摆在桌面上的另外三张牌:客户侧,Anthropic已官宣计划把最多100万颗TPU纳入自身算力体系,交易规模达数百亿美元;软件侧,谷歌的原生PyTorch后端TorchTPU预计今年10月开源;供给侧,谷歌同时宣布将成为首家提供英伟达Vera Rubin NVL72整机的云厂商。自研芯片、开放软件、代售对手旗舰——这三件事同时发生,指向同一个问题:TPU能否真正撼动英伟达在AI推理市场的统治地位?
一次有边界的领先,不是一边倒的胜利
把这份评测拆开看,优势是有条件的。Ironwood领先最明显的区间,是低并发、高交互性的推理负载——也就是把每个用户的响应速度控制得较低的场景。在20秒中位响应时间下,Ironwood每百万token成本约0.098美元,B200为0.106美元,B300为0.132美元,差距收窄到约8%和25%。
一旦换到约30秒中位响应时间的局部区间,B200的每美元性能可以反超Ironwood。精度换成FP4后,英伟达同样占优,因为Ironwood没有原生FP4硬件支持,只能在FP8上跑。而当比较条件不再对等——GB300 NVL72使用分离式服务、TPUv7仍用聚合服务时,GB300在中等端到端延迟区间还能拿到约30%的每美元性能优势。
50.4%这个数字还依赖成本口径的选择。按评测方的说法,在更高并发场景下若改用谷歌内部总拥有成本(TCO)核算,Ironwood相对B200的优势会扩大到76.7%,相对B300达130.2%。内部TCO与云上的实际成交价不是一回事,这类差异足以改变结论的量级。
必须记在前面的边界条件只有一条:这是一家第三方机构对一个模型的测试,不是两家公司官方白皮书的对照。多模型、多精度、多延迟区间下的泛化表现,SemiAnalysis并未公开完整集群拓扑与压测脚本,外部也无从复算。
Ironwood的筹码:6倍HBM与9216颗互联
第三方实测之外的硬件口径,可以回到谷歌自己的披露。谷歌2025年4月在Cloud Next 25上发布Ironwood,明确它是首款专为AI推理设计的TPU:单颗芯片HBM容量192GB,是上一代Trillium的6倍;HBM带宽7.2 Tbps,为其4.5倍;单芯片峰值算力4,614 TFLOPs;单个Pod可扩至9,216颗液冷芯片,总峰值算力42.5 exaflops,能效为Trillium的2倍。
推理与训练对硬件的要求并不相同。训练要的是峰值算力和长周期扩展能力,推理要的是并发吞吐和内存带宽——大量时间花在把KV缓存读进读出上,而不是矩阵乘法本身。谷歌官方博客称Ironwood为“推理时代”设计,6倍HBM容量正落在这个点上:单芯片能装下更大的模型活跃工作集,减少跨芯片搬运数据的次数。
评测还披露了软件层的配套。谷歌为Ironwood的推理内核做了针对性优化:针对Qwen3.5注意力层查询头与KV头分布不均的问题,新增8路注意力数据并行与8路专家并行的组合,规避不必要的All-to-All通信;并把专家ID与路由权重合并为单次All-Gather。这是自研芯片常见的打法——硬件与软件由同一批人协同迭代,代价则是通用性。
百万颗TPU与一份原生PyTorch后端
Anthropic的算力策略变化,是本轮叙事中最有分量的商业信号。其2025年10月23日官方公告写明:计划扩大使用Google Cloud技术,包括最多100万颗TPU,这一扩张价值数百亿美元,预计在2026年带来超过1吉瓦的容量上线。Google Cloud CEO Thomas Kurian在同一份公告中把Ironwood列入了产品序列。2026年4月6日,Anthropic再宣布与谷歌和博通签署新协议,获取多吉瓦的下一代TPU容量,预计2027年起上线。
驱动这笔钱的是需求侧。Anthropic在公告中称,其年化收入运行率已超过300亿美元,而2025年底约为90亿美元;年化支出超过100万美元的企业客户数量,从2026年2月的500多家增至同年4月的超过1000家。
但Anthropic并没有转向单一供应商。同一份公告强调,其算力战略是在TPU、亚马逊Trainium与英伟达GPU三个平台上按负载分工,亚马逊仍是其主要云服务商与训练伙伴。SemiAnalysis关于“2029年Anthropic的TPU使用量将超过DeepMind自身”的说法,属于该机构的推断而非当事方披露,Anthropic官方口径中亦无“超百万颗”的确定合同表述,“最多100万颗”更接近产能与额度上限。
真正的门槛在软件。外部开发者此前要把PyTorch模型经TorchAX转译成JAX执行,在低级优化、分页注意力机制与vLLM适配上处处受限。评测描述的TorchTPU方案,通过PyTorch的PrivateUse1后端扩展点把TPU直接暴露为原生设备,开发者可以调用.to("tpu"),并保留DDP、FSDP2、DTensor等熟悉的分布式接口;编译链路由TorchDynamo与AOTAutograd生成计算图,降为StableHLO后交给XLA生成TPU可执行代码。实际意义是:vLLM和SGLang能复用更多上游模型代码与调度器,不必跨越框架边界重建一套。
评测称Inferact、RadixArk与红帽均在与谷歌合作推进此项,TorchTPU目前仍处私有测试阶段,预计10月PyTorch大会期间开源。这一时间表尚未见谷歌官方确认。
卖对手旗舰的云厂商,与尚未合拢的缺口
谷歌2026年4月发布第八代TPU,首次将训练与推理拆分为两款独立芯片TPU 8t与TPU 8i;同一场合,Ironwood宣布正式向云客户开放。也是在这批披露中,谷歌称将在2026年下半年成为首家提供英伟达Vera Rubin NVL72超级计算机的云服务商。谷歌一边卖对手的旗舰整机,一边把自研推理芯片推向外部客户,两条线并不矛盾——它在争夺的是算力总包商的位置,而不是芯片阵营的忠诚。
英伟达的护城河也不在一颗芯片的每美元表现上。其官方口径中,DGX B300较DGX B200的密集FP4性能提升1.5倍、注意力性能提升2倍,整机FP4算力144 petaFLOPS。CUDA生态的适配成本、遍布全球的渠道与二手流通性、以年为单位的产品迭代节奏,都仍是TPU没有替代的部分。Ironwood缺失的原生FP4,要等TPUv8i补上,而据媒体报道该系列采用2nm工艺、目标在2027年底量产。
接下来值得盯住的,是四个可验证的节点:TorchTPU能否按期在10月开源并进入vLLM、SGLang的首日支持名单;Ironwood PD分离式服务优化落地后,GB300那约30%的非对等优势是否真被填平;Anthropic上线容量与谷歌收入结构中的TPU占比,能否在其自研芯片折旧后形成可观察的推理毛利差;以及云厂商在2026—2027年招标中,是否把TPU纳入与GPU同等的默认比价表。这四项决定50.4%是一次性的技术新闻,还是成本曲线上的持续变化。


