← 返回 Blog

GPT-4 是 1.8 万亿,GPT-6 传 10 万亿:五年五倍跃升,Scaling Law 回来了?

2026 年 8 月,两条爆料消息搅动整个 AI 行业。 8 月 10 日,X 平台 AI 圈内爆料记者 ChrisGPT 放出消息:即便面临政府监管审查压力,OpenAI 代号为 Astra 的下一代模型——外界普遍称之为 GPT-6——仍计划于 8 月强行发布,参数规模或将达到 10 万亿。而四年前的 8 月 8 日,GPT-4 刚刚完成训练,业界估算其参数量大约为 1.8 万亿

OpenAIGPT-6 参数跃升背后

从 1.8 万亿到网传 10 万亿:GPT-6 参数跃升背后,Scaling Law 回来了吗?

2026 年 8 月,两条爆料消息搅动整个 AI 行业。

8 月 10 日,X 平台 AI 圈内爆料记者 ChrisGPT 放出消息:即便面临政府监管审查压力,OpenAI 代号为 Astra 的下一代模型——外界普遍称之为 GPT-6——仍计划于 8 月强行发布,参数规模或将达到 10 万亿。而四年前的 8 月 8 日,GPT-4 刚刚完成训练,业界估算其参数量大约为 1.8 万亿。

从 1.8 万亿到 10 万亿,五年时间,规模提升五倍以上

这个数字迫使全行业重新思考一个被反复争论的核心问题:Scaling Law(缩放定律),究竟失效没有?

1.8 万亿的真相:从来不是大众理解的概念

首先厘清关键事实:1.8 万亿这个数字本身存在信息偏差。

OpenAI 从未官方公布 GPT-4 的架构细节。根据微软联合 OpenAI 在 arXiv 发布的论文线索,GPT-4 采用混合专家模型(MoE),一共包含 16 个专家网络,单个专家约 1110 亿参数,合计总量约 1.76 万亿,四舍五入即为 1.8 万亿。但模型每一轮前向推理,只会激活其中 2 个专家。

换句话说,1.8 万亿指的是总参数量,而每次推理真正参与运算的参数大约仅有 3600 亿,激活比例约 2%。

这不能简单理解为"参数越大能力越强"。MoE 架构的精妙之处在于:依靠稀疏激活机制实现总参数量线性扩张,同时把单次推理算力开销控制在可接受区间。这是多重约束下做出的工程取舍——在 GPU 显存带宽、HBM 显存吞吐、令牌级动态路由等条件限制下,不得已选择的落地路线。

10 万亿参数:跨越式突破,还是重蹈旧覆辙?

倘若 Astra 真的做到 10 万亿总参数,规模将达到 GPT-4 的五倍以上。但"五倍规模"价值高低,完全取决于它采用何种架构。

业内人士分析,如果 10 万亿参数的传闻属实,意味着 OpenAI 在 MoE 路线上走得更远:总参数量大幅膨胀,但单次推理的实际计算成本只会有限上升。

这也引出一个长期被忽略的认知:Scaling Law 绝不等于单纯堆砌总参数

真正的 Scaling Law,研究的是有效计算开销模型性能之间的幂律关系。MoE 架构直接将"总参数"和"有效运算参数"解耦:你可以做到总参数 10 万亿,但每一次推理只启用其中一小部分模块参与计算。

Scaling Law 真的消亡了吗?

2026 年,围绕 Scaling Law 的争论进入白热化阶段。

业界反思,2020 年初代 Scaling Law 论文存在实验局限:在固定训练令牌总量、搭配特定学习率衰减方案下,推导出"参数越大效果越好"的结论。但 DeepMind 早在 2022 年就通过 Chinchilla 论文提出知名的令牌/参数 20:1 最优配比法则,修正了单一追求参数的方向。

Scaling Law 从来不是牛顿三大定律那样牢不可破的物理公理。它仅仅是基于实验拟合得到的经验曲线,会随着训练方法、数据质量、架构创新而不断被重新诠释。

真正转折点:底层基座引擎终于迎来换代

这场博弈里,真正值得重点关注的棋子是 Doug。

自 2024 年 5 月 GPT-4o 发布之后,OpenAI 长达两年没有完成新一代旗舰模型完整预训练。o1、o3、GPT-5 直至 GPT-5.5,本质上全部基于 GPT-4o 基座开展后训练与强化学习微调——GPT 的底层基础引擎两年未曾更新。Orion 等多个项目因为效果不及预期遭到降级搁置。

直到 2025 年末至 2026 年初,SemiAnalysis 等机构观察到 OpenAI 悄然推进代号为 Garlic 的验证性项目,随后在 2026 年 7 月的付费备忘录中明确提出:"OpenAI 已经克服了预训练问题,一个代号为 Doug、规模大得多的模型正在积极推进"。

Doug 的重大意义在于:这代表 OpenAI 很可能攻克了性能衰减、十万卡算力集群稳定性瓶颈,证明 Scaling Law 在预训练层面依旧成立

前沿信息大 V Pankaj Kumar 指出,Doug 大概率使用英伟达尚未全面铺开的下一代 Vera Rubin 芯片进行训练,芯片预计不晚于 11 月面世。ChrisGPT 预计,Doug 最迟在 11 月之前会发布。

从"堆砌参数"迈向"智能密度"

回到最初的问题:Scaling Law 回来了吗?

答案或许不能简单用"回来了"或者"失效了"概括——它从未消失,只是演化出新的实现方式。

2026 年语境下的 Scaling Law,早已不再是 2020 年那种粗暴的"一味做大模型"公式,演变为一套更加复杂的多维优化命题:预训练缩放、后训练缩放、推理时缩放三条路线同步推进

无论最终规模是 5 万亿还是 10 万亿,决定模型上限的从来不是 PPT 上标注的总参数量,而是有效算力开销如何转化为智能能力。从这个角度看,Scaling Law 非但没有消亡,还正在经历一场深刻变革:发展主线由"暴力堆砌参数"转向追求智能密度

五年五倍的数字只是表层现象,真正的棋局藏在 MoE 路由策略、Doug 十万卡集群稳定性,以及时隔两年终于迎来迭代的新一代底层模型引擎之中。

当模型迭代进入"周"级竞赛,工程落地更需稳定底座

Astra 与 Doug 的接连曝光,折射出全球大模型竞争已进入"预训练规模 + 发布节奏"双线博弈的新阶段。但对于国内开发者与企业而言,比起追逐每一个爆款模型的风口,更稳定、更经济的 API 接入能力,才是将 AI 真正转化为生产力的关键基础设施。

UseAIAPI​ 一站式聚合 Gemini、Claude、ChatGPT、DeepSeek 等全球主流大模型的最新版本,支持企业级定制化部署,让开发者无需为每个大模型分别注册海外账号、配置支付方式,一套 API Key 即可打通多模型调用

在具体权益上,平台的优势体现为三个层面:

显著的价格优惠。UseAIAPI 平台折扣最低可达官方价格的 50%

企业级定制能力。平台支持按需定制并发、配额与路由策略,满足高强度内容生成、自动化智能体、大规模文档处理等重消耗场景。无论是面对 Astra 级别的前沿模型,还是 Gemini 3.5 Flash 这类高性价比主力,企业用户均可根据业务特征灵活配置,将长上下文、高并发、持续运行的智能体工作流的单位成本压到更低。

合规的基础设施。通过海外合规节点接入官方 API,提供企业级 SLA 保障,规避个人开发者难以解决的地区可用性门槛与数据中心 IP 风控风险。平台层面可对接 Gemini API 原生的项目支出上限与使用分层机制,让开发者同样享受到谷歌 2026 年推出的预算管控能力,实现成本精细化管控。

💡 当 OpenAI 与 Anthropic 以"周"为单位刷新模型迭代纪录,真正决定企业竞争力的,是能否以经济高效的方式,把每一次迭代的红利稳定地用起来。通过 UseAIAPI 接入,叠加最低官方价 5 折的优惠权益,真正实现"无忧接入、按需扩展",不再为高频调用的成本压力而担忧。

从 Astra 的安全博弈到 Doug 的预训练豪赌,全球大模型竞赛的车轮滚滚向前。而当这套能力真正触达每一位开发者时,"前沿智能触手可及"才不再是一句口号,而是每一次 API 调用中真实发生的故事。