快科技9月11日消息,据SemiAnalysis发布的最新报告,谷歌第七代TPU Ironwood每美元推理性能最高领先英伟达B200达50%,对B300领先96%。
今年4月,黄仁勋在播客中公开质疑TPU不敢参加公开跑分,称“TPU不来,Trainium不来”。五个月后,谷歌带着实测数据如约而至。

测试采用Qwen3.5 397B FP8模型,FP8对FP8公平对比,输入8000 token、输出1000 token。在每秒100 token单用户吞吐基准下,TPU每百万token成本仅0.181美元。

B200每百万token成本0.222美元,B300高达0.276美元。TPU分别便宜19%和34%。若将中位响应时间限制在20秒,TPU成本降至0.098美元。
TPU的成本优势并非来自峰值算力。实测中TPU物理吞吐仅领先约5%,但每小时租赁成本远低于GPU,叠加价格差后放大为50%的每美元性能领先。
价格优势只是第一层冲击,更令英伟达忌惮的是软件生态的松动。谷歌推出TorchTPU,利用PyTorch的PrivateUse1后端接口,让TPU直接成为原生Torch运算设备。
开发者只需将一行代码device = torch.device('cuda')改为device = tpu.get_device(),无需重写训练循环或修改模型架构,即可在TPU上运行。
此外,Ironwood单芯片配备192GB HBM,是上代Trillium的6倍,可容纳更大KV Cache。矩阵单元采用256×256脉动阵列,原生支持FP8运算。
硬件实力的提升,也让谷歌在销售策略上更加主动。谷歌自去年起开放TPU直接销售,不再只依赖云端租赁。据悉,Anthropic已采购超100万颗TPU,到2029年将超越DeepMind成为全球最大TPU单一用户。
TorchTPU预计10月PyTorch大会期间开源,届时TPU对开发者的迁移门槛将降至一行代码。



