← 返回 Blog

Ironwood单pod 9216颗芯片、42.5 ExaFlops:拆解谷歌Gemini算力的底层护城河

2025年4月9日,谷歌在Google Cloud Next '25大会正式发布第七代TPU——Ironwood。谷歌副总裁兼AI基础设施总经理Amin Vahdat在发布会上表示,Ironwood是"专为推理时代而生"的算力引擎,单集群可扩展至9216颗芯片,总算力达到42.5 ExaFlops。 这个数字是什么概念?作为参照,全球公开服役速度最快的超算El Capitan,单集群算力为1.7 ExaFlops。Ironwood的算力规模达到它的24倍以上。谷歌不只是在造芯片,而是在构筑一片算力大陆。

Gemini解谷歌Gemini算力背后的底层护城河

Ironwood单Pod集群9216颗芯片、总算力42.5 ExaFlops:拆解谷歌Gemini算力背后的底层护城河

2025年4月9日,谷歌在Google Cloud Next '25大会正式发布第七代TPU——Ironwood。谷歌副总裁兼AI基础设施总经理Amin Vahdat在发布会上表示,Ironwood是"专为推理时代而生"的算力引擎,单集群可扩展至9216颗芯片,总算力达到42.5 ExaFlops。

这个数字是什么概念?作为参照,全球公开服役速度最快的超算El Capitan,单集群算力为1.7 ExaFlops。Ironwood的算力规模达到它的24倍以上。谷歌不只是在造芯片,而是在构筑一片算力大陆。

9216颗芯片:从"算力孤岛"走向"算力大陆"

Ironwood提供两种集群规模配置:256颗芯片规格面向普通客户,9216颗芯片规格才是谷歌真正的王牌。

把9216颗芯片联结成统一算力体系,绝非简单堆叠硬件。谷歌部署了光电路交换(OCS)技术,将数千颗TPU通过光路直接连接,相当于把成千上万座"芯片孤岛"拼接成一片算力大陆

单颗Ironwood芯片峰值算力为4614 TFLOPS(FP8精度),9216颗芯片总算力合计42.5 ExaFlops。整套系统配备1.77PB共享HBM高带宽内存,创下共享内存型超算的容量新高。

💡 作为参照,英伟达当前旗舰GB300 NVL72整套系统算力为0.36 ExaFlops。一套Ironwood集群的算力,约等于118套GB300 NVL72系统之和。

三层网络:把9216颗芯片融合为一台整机

能够堆砌大量芯片,不代表芯片之间可以高效协同。谷歌真正的护城河不在于芯片本身,而是这套将海量芯片绑定为一台整机的三层互联网络。

第一层:芯片间互联链路(ICI)

单芯片ICI带宽达到1.2 TB/s,为前代Trillium的1.5倍;系统级互联总带宽高达9.6 Tb/s

第二层:3D环面拓扑(3D Torus)

Ironwood采用3D环面网络拓扑,任意两颗芯片之间都可以沿最短路径通信,消除"跨节点通信"带来的额外开销。

第三层:光电路交换(OCS)

OCS是整套系统的"交通枢纽"。传统电交换在数千颗芯片规模下极易形成瓶颈,而光交换能够让数据以光速在芯片之间传输,这也是谷歌TPU集群区别于GPU数据中心的标志性技术。

三层网络协同带来的效果是:9216颗芯片在逻辑上融为一体,构成一台巨型超算。每一颗芯片都能以极低时延访问其他芯片的算力与内存。

单芯片解析:4614 TFLOPS背后的设计思路

单颗Ironwood芯片采用双裸片封装架构,通过多芯片封装(MCM)提升良率、优化成本。核心参数如下:

  • 192GB HBM3e内存,容量是Trillium的6倍;

  • 7.3–7.4 TB/s​ 内存带宽;

  • 单芯片最大功耗980W,全系统采用液冷散热;

  • 谷歌首款原生支持FP8精度的TPU,矩阵运算单元(MXU)使用FP8处理权重、激活值与梯度,理论吞吐量相比BF16实现翻倍;

  • 集成第四代SparseCore稀疏加速器,专门处理推荐系统中的嵌入检索与汇聚运算;

  • 搭载片上信任根、内置自检、静默数据损坏缓解等全套RAS(可靠性、可用性、可维护性)特性。

更有意思的一点:Ironwood在自身设计流程中就运用AI优化算术逻辑单元(ALU)电路与芯片布局。AI设计AI芯片,形成正向增强循环。

42.5 ExaFlops:算力数字背后的事实与口径

42.5 ExaFlops这一指标本身存在客观口径差异,需要理性看待。

El Capitan的1.7 ExaFlops采用FP64双精度测算,而Ironwood的42.5 ExaFlops基于FP8精度。FP8与FP64不具备直接可比性:FP64是科学计算标准精度,FP8是面向AI推理的专用精度。如果统一换算口径,两者的排位会有明显变化。

但问题核心不在于"谁绝对更强",而在于Gemini这类模型需要何种精度。Gemini 2.5的推理任务不需要FP64双精度,它追求的是FP8带来的高吞吐量与低延迟。Ironwood的42.5 ExaFlops是面向AI推理的有效算力,而非通用科学计算算力;对于训练、运行Gemini模型而言,该数值代表可实际调用的算力规模。

正如Amin Vahdat所言:"我们已经迈入推理时代。竞争不再只是模型参数规模,而是训练完成之后,模型依靠数据能够完成什么任务。Ironwood正是谷歌为这个时代打造的算力引擎。"

算力护城河:十年磨一剑

谷歌布局AI芯片已超过十年。从2015年第一代TPU到Ironwood,性能提升3600倍。过去八年,AI算力需求同比增长十倍,累计需求增幅最高可达上亿倍。

谷歌计划到2026年实现TPU年产量突破300万颗。Anthropic等AI实验室已经拿到超过100万颗TPU以及1吉瓦专属算力资源的分配。

当OpenAI、Anthropic等AI实验室在模型架构上激烈角逐时,谷歌手握一项竞争对手难以复制的底牌:搭载9216颗芯片、总算力42.5 ExaFlops的Ironwood集群。这不是依靠融资就能采购获得的资源,是耗时十余年持续投入构筑的护城河。

企业级AI接入:当"算力革命"遇见"成本现实"

谷歌用Ironwood证明了"推理时代需要专用算力"的硬件方向。但底层算力的革新,要真正转化为千行百业的生产力,还需要一道关键桥梁——稳定、低成本、跨模型的企业级接入服务

对于企业开发者而言,要将Gemini以及Claude、ChatGPT、DeepSeek等全球最新主流模型的能力稳定嵌入自身业务系统,面临着三重共性挑战:

  • 模型矩阵复杂:企业往往需同时调用多家厂商的不同模型,每家原厂API规范各异,技术栈对接成本高;

  • 成本压力陡增:高性能模型在高强度推理场景下Token消耗巨大,官方价格昂贵;

  • 合规与可用性要求严苛:企业级场景对数据合规、服务可用性、审计追溯有严格要求,单一厂商服务难以覆盖全场景。

在这一背景下,具备源头供应能力的企业级API服务平台价值凸显。UseAIAPI作为SVIP企业级API服务平台,为企业提供了破解上述困境的系统方案:

🌐 120+全生态大模型统一接入

平台覆盖对话、推理、多模态、智能体调度等全场景,ChatGPT、Gemini、Claude、DeepSeek等全球120余款前沿大模型均可即接即用。开发者使用一个API Key即可调度全品类AI能力,无需分别对接多家原厂,技术栈大幅简化——这意味着企业无需锁定单一供应商,可在统一接口下灵活调度全球最强模型矩阵,为"智能体工作流"提供最优的模型组合。

🏢 企业级定制化服务保障

依托全球边缘节点加速,平台提供45ms骨干网络超低延迟、99.9%极致可用性保障;支持可视化财务看板、按项目与模型溯源消耗、对公结算,能够融入核心系统并通过财务审计,适配集团化架构,满足关键业务的严苛可用性要求。

💰 极具竞争力的成本优化

依托全球算力集采优势,UseAIAPI推出长期专属企业权益,优惠折扣最低可达官方定价的50%。以Gemini系列模型为例,通过UseAIAPI接入可大幅降低单位Token成本;配合智能语义缓存等降本机制,能够显著缓解高强度智能体执行场景下的算力消耗压力。这意味着同样的预算下,企业可支撑的推理调用量最高可扩展至原先的两倍,让AI原生应用的规模化部署不再受困于算力账单。

🔧 全流程技术护航

从技术对接、合规部署到运维保障,平台提供企业级定制化服务,让不同规模的企业与开发者都能实现"无忧接入、顺畅使用"。

写在最后:护城河的另一面

从第一代TPU到Ironwood,谷歌用十年时间证明了一件事:在智能体时代,算力即护城河。42.5 ExaFlops不是终点,而是推理时代的新起点。随着Gemini系列模型持续迭代,这套算力底座将继续支撑谷歌在AI产业中的核心地位。

但对于千行百业的企业而言,底层算力的革新红利,需要借助UseAIAPI这类企业级服务平台,才能真正转化为可负担、可稳定、可规模化的AI生产力。毕竟,在AI能力民主化的时代,企业不该被挡在"企业级"的门槛之外;而真正的企业级AI接入,应当是"模型自由+成本可控+服务可靠"的三重兼得。

谷歌用Ironwood证明了"推理专用算力"的硬件方向,而UseAIAPI正在证明:统一接入与成本优化,是企业将这场算力革命转化为业务竞争力的必由之路。当42.5 ExaFlops的算力洪流经由稳定、低成本的API通道流向万千企业时,AI时代的真正红利才开始惠及每一个参与者。