
谷歌第八代TPU拆分成"双芯":AI算力告别"通用芯片时代"
2026年4月22日,在Google Cloud Next大会上,谷歌宣布了一项颠覆自研AI芯片传统设计理念的重大决策:第八代TPU不再是一颗"通吃"的通用芯片,而是拆分为两款物理架构完全独立的专用芯片——面向训练的TPU 8t与面向推理的TPU 8i。
这是谷歌史上首次将训练与推理任务拆分至独立芯片,标志着其AI硬件策略的重大转向。
为何拆分?训练与推理已是两类截然不同的负载
谷歌AI与基础设施高级副总裁兼首席技术官Amin Vahdat在官方博客中指出:"随着人工智能代理的兴起,我们认为,如果芯片能够根据训练和服务的需求进行个性化定制,那么整个社区将会受益。"
这一判断背后,是AI工作负载的日益分化。预训练、后训练与实时推理在计算特性上已显著分化:
训练任务追求极致吞吐量与规模扩展,需要处理海量数据、堆砌算力,将前沿模型的开发周期从数月缩短至数周;
推理任务则对延迟和并发更为敏感,尤其是智能体时代,主智能体将目标拆解为子任务分发给一众子智能体,每一次访问片外内存产生的延迟,经过多轮推理会被不断放大。
单颗芯片无法同时将两类负载做到极致。通用芯片看似万能,但在各类场景下都不得不做出取舍。谷歌最终选择:与其让一颗芯片两头妥协,不如打造专用芯片,各自冲向性能顶峰。
TPU 8t:把训练周期从"数月"压缩到"数周"
TPU 8t是专为大规模预训练打造的动力引擎。其核心参数令人瞩目:
规模:单个超级计算节点(Superpod)最多可集成9600颗芯片,配备2PB共享高带宽内存,总算力达121 ExaFlops;
性能:整体计算性能是上一代Ironwood的近3倍;同等价格下性能提升2.7至2.8倍;
扩展:依托Virgo网络架构与Pathways软件框架,单一逻辑集群能够横向扩展至百万级芯片规模。
为支撑如此庞大的训练集群,TPU 8t在架构层面做了三项关键创新:
SparseCore专用加速器——将嵌入查找带来的不规则内存访问负载从主计算单元剥离,防止通用芯片普遍存在的零操作瓶颈;
原生FP4精度支持——矩阵运算单元吞吐量直接翻倍,在保持大模型准确性的同时克服内存带宽瓶颈;
VPU/MXU重叠与平衡扩展——量化、softmax、层归一化等向量操作与矩阵乘法更好地重叠执行,芯片保持持续满载。
存储层面,TPUDirect技术绕过CPU,实现HBM、网卡与存储之间直传数据,存储访问速度相比上代提升10倍。多重技术叠加带来的效果是:TPU 8t能够将前沿模型开发周期从数月缩短至数周,训练性价比提升2.7倍。
TPU 8i:彻底突破"内存墙"瓶颈
如果说TPU 8t追求规模上限,那么TPU 8i的目标就是做到极致低延迟。它的设计初衷十分清晰:智能体推理属于内存密集型任务,而非计算密集型任务。
TPU 8i的核心突破在于:
384MB片上SRAM,容量达到上代产品的3倍;
288GB HBM高带宽内存,足以将长上下文推理模型的KV缓存完整驻留芯片内;
ICI互联带宽翻倍至19.2Tb/s;
全新Boardfly分层拓扑,最大网络直径缩短超过50%;
片上集体加速引擎(CAE),将片上延迟减少最多5倍。
💡 这套设计的精妙之处:通过把模型的活跃工作集完全保留在片上,TPU 8i彻底消除了推理过程中的"等待室效应"——片上延迟减少最多5倍,最小化高并发请求期间的延迟,提供同时运行数百万个智能体所需的巨大吞吐量和低延迟。
最终成果:推理性价比提升80%,同等成本下服务承载能力近乎翻倍。
不止芯片:整套系统架构全面重构
两款芯片均搭载谷歌自研Arm架构Axion CPU作为主控处理器,以解决传统x86 CPU在数据预处理环节的瓶颈,保障TPU计算单元持续满负载运行。
在能效方面,两款芯片均采用第四代液冷方案,单位功耗性能相比上代实现翻倍以上提升:TPU 8t能效提升124%,TPU 8i能效提升117%。
Vahdat指出,对于当今的数据中心来说,制约因素不仅是芯片供应,还有电力瓶颈。为此,谷歌在芯片的整个技术栈上对效率进行了优化,并引入了集成电源管理系统,可根据实时需求动态调节功耗。
谷歌云CEO托马斯·库里安透露,外部AI实验室对TPU的需求已经远超现有产能上限。理由十分直白:"倘若我们的成本没有优势,他们根本不会选择采购TPU。"
企业级AI接入:当"算力革命"遇上"成本现实"
谷歌用两款专用芯片回答了一个根本性问题:在智能体时代,最优算力方案不是"什么活都能干",而是"把一件事做到极致"。但底层算力的革新,要真正转化为千行百业的生产力,还需要一道关键桥梁——稳定、低成本、跨模型的企业级接入服务。
对于企业开发者而言,要将Gemini以及Claude、ChatGPT、DeepSeek等全球最新主流模型的能力稳定嵌入自身业务系统,面临着三重共性挑战:
模型矩阵复杂:企业往往需同时调用多家厂商的不同模型,每家原厂API规范各异,技术栈对接成本高;
成本压力陡增:高性能模型在高强度推理场景下Token消耗巨大,官方价格昂贵;
合规与可用性要求严苛:企业级场景对数据合规、服务可用性、审计追溯有严格要求,单一厂商服务难以覆盖全场景。
在这一背景下,具备源头供应能力的企业级API服务平台价值凸显。UseAIAPI作为SVIP企业级API服务平台,为企业提供了破解上述困境的系统方案:
🌐 120+全生态大模型统一接入
平台覆盖对话、推理、多模态、智能体调度等全场景,ChatGPT、Gemini、Claude、DeepSeek等全球120余款前沿大模型均可即接即用。开发者使用一个API Key即可调度全品类AI能力,无需分别对接多家原厂,技术栈大幅简化——这意味着企业无需锁定单一供应商,可在统一接口下灵活调度全球最强模型矩阵,为"智能体工作流"提供最优的模型组合。
🏢 企业级定制化服务保障
依托全球边缘节点加速,平台提供45ms骨干网络超低延迟、99.9%极致可用性保障;支持可视化财务看板、按项目与模型溯源消耗、对公结算,能够融入核心系统并通过财务审计,适配集团化架构,满足关键业务的严苛可用性要求。
💰 极具竞争力的成本优化
依托全球算力集采优势,UseAIAPI推出长期专属企业权益,优惠折扣最低可达官方定价的50%。以Gemini系列模型为例,通过UseAIAPI接入可大幅降低单位Token成本;配合智能语义缓存等降本机制,能够显著缓解高强度智能体执行场景下的算力消耗压力。这意味着同样的预算下,企业可支撑的推理调用量最高可扩展至原先的两倍,让AI原生应用的规模化部署不再受困于算力账单。
🔧 全流程技术护航
从技术对接、合规部署到运维保障,平台提供企业级定制化服务,让不同规模的企业与开发者都能实现"无忧接入、顺畅使用"。
写在最后:一个时代的转折点
从第一代到第七代Ironwood,TPU始终遵循"单芯片通用"设计范式。第八代TPU采用训练、推理双芯架构,表面看是芯片架构拆分,本质上重新定义了AI算力的核心价值。
随着AI从"问答对话"进化为"自主解决问题"——从单次查询走向多步骤链式推理、从简单闲聊走向复杂任务执行,通用芯片与生俱来的短板被持续放大。谷歌用两款专用芯片给出的答案是:在智能体时代,最优算力方案不是"什么活都能干",而是"把一件事做到极致"。
TPU 8t和TPU 8i将于2026年晚些时候向谷歌云客户开放。届时,Gemini系列模型运行成本将显著下降,而这场由"训推分离"引发的算力革命,才刚刚拉开序幕。
对于千行百业的企业而言,底层算力的革新红利,需要借助UseAIAPI这类企业级服务平台,才能真正转化为可负担、可稳定、可规模化的AI生产力。毕竟,在AI能力民主化的时代,企业不该被挡在"企业级"的门槛之外;而真正的企业级AI接入,应当是"模型自由+成本可控+服务可靠"的三重兼得。谷歌用第八代TPU证明了"训推分离"的硬件方向,而UseAIAPI正在证明:统一接入与成本优化,是企业将这场算力革命转化为业务竞争力的必由之路。