当 GPU 不再单打独斗:2026 超节点如何重塑万亿 MoE 时代的算力底座
一句话结论:2026 年 8 月,国产算力的叙事中心从"单卡跑分"彻底转向"系统级协同"——Kimi K3 上线即挤爆服务器、Qwen3.8-Max 把 2.4 万亿参数塞进 95B 激活、DeepSeek V4-Flash 证明"更聪明比更大更重要"——这三件事背后,是同一个底层矛盾的爆发:MoE 架构的高频 All-to-All 通信和百万 Token 上下文正在把传统 8 卡集群的"通信墙"和"显存墙"同时撞穿,超节点(SuperPOD)从概念验证迈入规模化放量,华泰证券测算 2028 年国产超节点市场空间达 3414 亿元、复合年增长率 194%,一场围绕"如何让几百张卡像一台计算机那样协同工作"的架构战争正式开打。
一、Kimi K3 挤爆服务器:算法越优,算力越缺的杰文斯悖论
2026 年 7 月 27 日,月之暗面发布 Kimi K3——2.8 万亿总参数、104B 激活、原生视觉理解、100 万 Token 上下文,权重与技术报告全面开源。结果上线没多久,C 端新增订阅就把服务器砸挂了。
这件事的反直觉之处在于:Kimi K3 是 MoE 架构,单 Token 只激活 104B 参数,按理说推理效率应该很高。但现实是——模型能力越强,应用调用的 Token 总量呈指数级暴涨。这就是经典的杰文斯悖论:1865 年经济学家威廉·斯坦利·杰文斯提出,当技术进步提高了资源利用效率之后,反而可能导致资源的总消耗量增加。
伯虎财经对此有一段精准的拆解:"Kimi K3 主打长程编程和 Agent 任务,一次任务不是问答一轮,而是模型反复读代码、调用工具、自我纠错,用户看到的是一个请求,后台可能跑了几十次推理。" 单次推理效率优化,不等于可以满足算力总需求。一旦需求量高企、令模型满负荷工作,算力就出现缺口。
数据印证了这个判断。工信部公开数据显示,截至 2026 年 6 月底,国内智能算力规模已达 2185 EFLOPS,同比暴涨 177%,上架率高达 71.4%。"算法优化能省下大半算力"的叙事彻底破产——算力不是过剩,而是结构性紧缺。而这种紧缺的根源,不在芯片的峰值 TFLOPS,而在芯片之间如何通信。
二、通信墙与显存墙:MoE 架构撞上的两堵物理墙
要理解为什么超节点成为刚需,得先看清 MoE 架构在集群层面带来的两个根本性瓶颈。
第一堵墙:通信墙——GPU 不是在计算,而是在等待
MoE(混合专家)架构通过稀疏激活机制,用更少的计算量连接千亿到万亿级参数的专家网络。但代价是专家并行依赖于全局 All-to-All 通信——每一层神经网络的计算,都需要在所有 GPU 之间高频交换数据。
在 DeepSeek-V3 的训练过程中,未经优化时通信耗时占整体训练时长的比例可达 50% 以上,有研究显示极端情况下这一比例甚至能达到 67%。这意味着超过一半的 GPU 算力在"等待"而非"计算"。
这个问题的根源是 MoE 的路由机制。以 Kimi K3 为例,每层有大量专家网络(典型配置是每层 256 个专家只激活 6 个),每个 Token 生成时,路由器都要把 Token 发送到存放对应专家的那张 GPU 上,计算完再发回来。当模型切分到几十张甚至上百张卡上时,这种"路由跳转"的频率远超传统稠密模型的张量并行——后者只需要在固定的几组卡之间同步梯度,前者则需要全互联的动态路由。
更关键的是,这种通信是"小包高频"的——每次交换的数据量不大,但频率极高,对延迟极其敏感。传统集群依赖的横向扩展依赖以太网或 InfiniBand 跨机互联,延迟在微秒级;而 MoE 的专家路由要求百纳秒级响应。两者差了一个数量级,这就是"GPU 不是在计算,而是在干等"的物理根源。
第二堵墙:显存墙——单卡显存增长追不上算力增长
训练一个万亿参数的大模型,仅模型参数就需要海量显存。一台机器的显存放不下整个模型,必须切开分到不同机器上。一旦切开,每次调用都要跨机搬运数据。
这里有个残酷的对比数据:单张 GPU 的显存容量增长约 2.4 倍,但算力增长约 28.8 倍——形成了日益扩大的"内存鸿沟"。换句话说,芯片算得越来越快,但能装下的数据并没有同步增长,导致算力大量空转在等数据。
推理端的显存压力更直接。KV Cache 随上下文长度线性增长——当上下文从几千 Token 冲到百万级,KV Cache 的容量需求爆炸式增长。传统架构下,显存容量与带宽成为主要制约,导致算力利用率偏低(MFU < 60%)。这也是为什么 Kimi K3、Qwen3.8-Max、DeepSeek V4-Flash 都把"百万 Token 上下文"作为标配——这不是营销卖点,而是 MoE 架构在长上下文推理上的工程刚需。
Meta 在 Llama 3.1 的技术论文中披露了一个令人咋舌的数据:在 1.6 万卡 H100 集群的 54 天训练中,累计中断 419 次,平均每天近 8 次故障。集群规模越大,通信瓶颈、内存碎片化、调度开销等问题呈指数级恶化——这不是工程能力问题,而是架构范式的物理上限。
三、超节点的三层架构:互联协议、统一内存编址与 Scale-Up 取代 Scale-Out
"通信墙"与"显存墙"的解法,指向同一个方向——把多台独立的机器,在物理和逻辑上整合成一个计算单元。这就是超节点(SuperPOD)的核心逻辑。
传统做法是以 8 卡服务器为基本节点,通过横向堆叠组成集群;而超节点则试图扩大纵向扩展(Scale-Up)范围,让更多芯片通过高带宽、低时延的方式连接,"像一台计算机那样协同工作"。实现这一目标需要三个硬性指标:大带宽、低时延、内存统一编址。
层级一:高速互联协议——从 PCIe 到专用互联的代际跨越
卡间互联正从传统的 PCIe 总线向 NVLink、UB(灵衡)、Hyswitch、UALink 等专用协议演进,单卡双向带宽已从 GB/s 级别迈向 TB/s 级别。以 NVIDIA NVLink 6.0 为例,单卡双向带宽达 3.6 TB/s。
国内厂商各有路径:华为昇腾用自研 UB 互联协议、平头哥真武 M890 把片间互联带宽拉到 800GB/s、昆仑芯天池超节点把网络时延压到 2μs、摩尔线程 MTT C256 主打柜内高速互联。这些数字背后的工程含义是:传统跨机以太网通信是"打包-发送-拆包"的三步流程,专用互联协议让卡与卡之间能直接"伸手去拿"对方显存里的数据,省去了协议栈的开销。
层级二:统一内存编址——打破 CPU 与 GPU 的显存墙
三个硬性指标里,前两个(大带宽、低时延)不难理解,真正核心的是"内存统一编址"。构建一个全局统一的虚拟地址空间,集群内所有芯片的内存资源被映射成一张巨大的"地图"。不管数据在哪块芯片的显存里,其他芯片都能直接按地址访问,省去了传统架构中"打包-发送-拆包"的繁琐流程。
华为昇腾 950 SuperPoD 把 1024 张卡搞成了统一域,拿下了 256TB 的全局统一内存编址空间。这个数字的工程含义是:对于万亿参数模型,参数本身可以分散存在上千张卡的显存里,但模型代码看到的是一个连续的地址空间——不需要手动切分模型、不需要显式的跨卡数据搬运,路由器查表时直接按统一地址访问即可。这是 MoE 架构能高效跑起来的物理前提。
统一内存编址依赖两项底层技术:CXL.mem 和 NVLink-C2C,它们打破 CPU 与 GPU 间的显存墙,支持 GPU 按地址直接访问 CPU 内存及扩展池化内存,有效解决单卡显存容量不足问题。
层级三:Scale-Up 取代 Scale-Out——通信时延从微秒级降到百纳秒级
超节点的本质是把 TP(张量并行)和 EP(专家并行)这类强耦合通信约束在柜内完成,把通信时延从微秒级降至百纳秒级。这与传统 Scale-Out(横向扩展)的根本区别在于:
| 维度 | 传统 Scale-Out 集群 | 超节点 Scale-Up 域 |
|---|---|---|
| 基本单元 | 8 卡服务器 | 几十到上千卡统一域 |
| 跨卡通信 | 以太网/IB,微秒级 | 专用互联,百纳秒级 |
| 内存模型 | 各机独立,显式搬运 | 统一编址,直接访问 |
| 适合的并行 | DP(数据并行)、PP(流水线并行) | TP、EP(强耦合通信) |
| 典型 MFU | < 60% | 显著提升 |
| 故障域 | 单卡故障影响小 | 单卡故障影响整域 |
这种架构选择直接决定了"GPU 是在计算还是在等待"。把强耦合通信限制在柜内,是超节点能把有效算力从理论峰值释放出来的关键。
四、国产超节点横评:华为昇腾、平头哥、昆仑芯、摩尔线程的路线分野
2026 年被多家机构定义为"国产超节点元年"。WAIC 2026 上,从华为、壁仞、燧原、中兴通讯到中科曙光、阿里云,几乎所有国产算力厂商都把超节点摆在了展台最醒目的位置。但各家路线并不一致,背后是对"规模多大合适"这个核心问题的不同回答。
华为昇腾:大节点路线的代表
昇腾走的是"节点越大越好"的路线。其上一代 384 卡昇腾超节点已商用落地 750 多套,覆盖互联网、运营商、金融、教育、医疗、交通、制造等 20 多个行业,是国内唯一规模化商用的超节点方案,也是国内唯一训练出 SOTA 模型的超节点。目前已迭代至 1024 卡超节点,实现了业界最大的 256TB 跨物理节点的内存统一编址空间,且将推出 8192 卡超节点,进一步探索超节点的满配技术上限。
昇腾的三年路标非常清晰:2026 年 950 系列、2027 年 960 系列、2028 年 970 系列,以几乎一年一代、算力翻倍的速度持续演进。华为规划于 2027 年四季度推出算力规模达 15488 卡的 Atlas 960 SuperPoD,基于超节点架构可组合成 Atlas 950 SuperCluster 集群,算力规模超过 50 万卡。昇腾 950PR 2026 年规划产量约 80 万片,韩国云厂商已锁定首批订单,马来西亚规划部署 3000 台昇腾服务器。
平头哥真武 M890:大显存路线
平头哥的真武 M890 直接塞进了 144GB 显存,片间互联带宽拉到 800GB/s。半导体数据显示,真武 AI 芯片累计出货 56 万片,服务 20 多个行业的 400 多家客户,其中在智驾行业已部署超 13 万卡、客户涵盖小鹏、理想、蔚来等头部造车新势力。阿里云灵骏真武 M890 超节点实例就是面向 MoE 场景设计,64 卡一体化超节点,已成功适配 Qwen3.8。
昆仑芯 M100:MoE 推理专精
昆仑芯第四代 M100 主攻 MoE 推理,天池超节点单机柜能做 64 卡盘活,网络时延压到了 2μs。摩根大通的数据显示,百度昆仑芯片收入预计将从 2025 年的约 13 亿元飙升至 2026 年的 83 亿元,同比增长超 6 倍。M100 是国内少数明确把"MoE 推理"作为主攻方向的超节点方案。
摩尔线程 MTT C256:万卡级训练底座
摩尔线程在 WAIC 2026 上首次公开展示 MTT C256 超节点,为万卡乃至十万卡级智算中心提供算力底座。依托万卡级夸娥智算集群,摩尔线程完成了从零起步的 MoE-236B 基础模型的完整训练链路,训练语料高达 25T+,集群有效训练时长占比超过 90%,训练损失曲线与国际主流计算卡高度一致。
更值得关注的是,摩尔线程还支撑了北京大学 EvoPhys 团队首个全球 5D 世界模型 EvoPhys-World 的全栈原生训练,以及北京智源研究院 RoboBrain 2.5 通用具身大脑模型的全流程训练。这验证了国产算力集群在复杂视觉生成、物理模拟、具身智能等前沿场景中的可用性。
浪潮信息:小节点经济路线
与大节点路线相对,浪潮信息走的是"节点越经济越好"的路线——先是推出 64 卡超节点,最新产品降为 32 卡。浪潮信息副总裁赵帅的逻辑是:"我们自己内部用万亿大模型做 AI Coding,效率绝对比用千亿大模型好,这就是万亿参数大模型带来的价值,所以再次推出 32 卡产品,让更多企业真正用得起。"
| 厂商 | 旗舰超节点 | 卡数规模 | 互联带宽/时延 | 统一内存 | 适用场景 |
|---|---|---|---|---|---|
| 华为昇腾 | 950 SuperPoD | 1024 卡(规划 8192) | 2 TB/s | 256TB 统一编址 | 全场景训练+推理,SOTA 模型 |
| 平头哥 | 真武 M890 | 64 卡 | 800GB/s | 144GB 显存 | 云端 MoE 推理,智驾 |
| 昆仑芯 | 天池超节点 M100 | 64 卡/机柜 | 2μs 时延 | — | MoE 推理优化 |
| 摩尔线程 | MTT C256 | 万卡级 | — | — | 万亿参数训练,世界模型 |
| 浪潮信息 | 32 卡超节点 | 32-64 卡 | — | — | 中小企业,AI Coding |
这两条路线——大节点追求极致性能、小节点追求经济普惠——并不冲突,而是覆盖不同市场分层。大节点是训练 SOTA 模型的刚需,小节点是让更多企业真正用得起万亿参数的普惠方案。
五、模型与超节点的协同适配:Qwen3.8、Kimi K3、DeepSeek V4 的工程闭环
超节点不是孤立的硬件,它的价值要靠与模型的协同适配来释放。2026 年 8 月这波模型发布,每个都附带了与超节点的协同优化。
Qwen3.8-Max 与真武 M890:Agentic 推理 1.5 倍提升
8 月 3 日,阿里发布 Qwen3.8-Max——2.4 万亿总参数、95B 激活、稀疏 MoE 与混合注意力机制联合优化、1M Token 上下文。阿里真武 M890 超节点已成功适配 Qwen3.8,通过芯片、云平台与千问大模型的全链路优化,在 Agentic 推理场景中最多可实现 1.5 倍性能提升。
这个"1.5 倍"的工程含义值得展开。Agentic 推理——模型反复读代码、调用工具、自我纠错的长链路任务——对推理延迟和吞吐都极其敏感。传统集群下,每个 Token 生成都要跨机通信,长链路任务下这种通信开销会被放大几十倍。超节点把专家路由通信限制在柜内,Agentic 推理的效率提升就不只是线性提升,而是接近二次方的释放。
Kimi K3 的 2.8 万亿参数与全行业适配
月之暗面 7 月 27 日发布 Kimi K3 后,摩尔线程、海光信息、华为昇腾、阿里云、Nebius 等海内外厂商迅速宣布适配。这种"模型一发布、全行业适配"的现象在 2025 年还很少见——它说明超节点已经成为国产算力厂商的"标配能力",而不是某家的独家技术。
Kimi K3 的 2.8 万亿参数 + 104B 激活,意味着单次推理要调度 2.8 万亿参数中的极小一部分。这种"超大模型、极小激活"的模式,对超节点的统一内存编址提出了最高要求——模型参数必须能全局寻址,否则路由开销会吃掉所有效率收益。
DeepSeek V4-Flash:脱离 CUDA 的算子主权
7 月 31 日发布的 DeepSeek V4-Flash 正式版,最具战略意义的创新是:全部核心算子基于 Triton 自研,脱离英伟达 CUDA 生态,国产 GPU 无需厂商定制适配即可直接部署。同时兼容 OpenAI 和 Anthropic 双 API 接口,各大云厂商一键接入。
这件事与超节点的关系是:过去国产芯片要跑大模型,往往需要厂商级定制适配——每出一款新卡、每升级一个模型版本,都要重新做算子对齐工作。Triton 把"高层算子描述"和"底层硬件后端"解耦,让同一份算子代码可以在不同厂商的 GPU 上编译执行。这意味着超节点厂商不再需要为每一个新模型做一对一适配,而是只要把 Triton 后端做好,就能跑通主流模型——国产算力栈的闭环由此快速成型。
V4-Flash 的性能数据也很有说服力:284B 总参数、13B 激活,远小于 V4-Pro 的 1.6 万亿,但多项基准测试跑赢旗舰预览版;代码修复基准 DeepSWE 得分从 7.3 暴涨至 54.4,涨幅超过 640%;综合智能体得分 25.2,逼近 Claude Opus 4.8。这证明了一个方向:选对"老师"、用对"教材",轻量级模型一样能变得很聪明——而超节点让这种"轻量级模型在国产算力上高效跑起来"成为可能。
六、杰文斯悖论的产业级验证:算力需求的指数级暴涨
回到开篇的杰文斯悖论——算法优化反而让算力更紧张——2026 年的数据给出了产业级验证。
OpenRouter 最新一周 AI 大模型调用量榜单显示,排名前五的产品全部由中国企业研发。万联证券指出,国产大模型正在形成"高性能开源模型+低成本推理服务+多模态场景能力"的组合优势,吸引开发者基于国产模型构建 AI 编程、办公自动化和企业级智能体应用。
这种应用爆发直接转化为算力需求的指数级增长。2025 年国内智能算力规模为 1590 ExaFLOPS,2026 年上半年达 2185 EFLOPS,同比增长 177%。华泰证券测算,2028 年国产超节点市场空间有望达到 3414 亿元,2026 年至 2028 年复合年均增长率高达 194%。
更直接的增量在产业链上游:GPU 间交换芯片到 2028 年的增量空间约 1000 亿美元,液冷约 130 亿美元,柜内电源约 240 亿美元。液冷、高速光模块、连接器、PCB、供电系统等核心部件已基本具备国产供应能力——英维克、申菱环境为 950 超节点提供液冷配套,光迅科技、中际旭创供应 800G 硅光模块,深南电路、沪电股份供应高多层服务器 PCB。
国产算力的衡量标准正在发生根本转变:从"单颗芯片的峰值性能"转向"一整套系统能调动多少有效算力"。华为轮值董事长徐直军的判断是:"只有依靠超节点和集群,才能突破中国的芯片制造工艺限制,为中国的 AI 发展提供源源不断的算力支持。" 国产芯片厂商正跳出单一制程追赶的传统路径,以架构创新为核心突破口,放大集群内系统级互联的作用来弥补单卡差距——这是一种"换道超车"的战略选择。
七、超节点不是万能药:三个工程层面的待解难题
把超节点描述成"算力银弹"是危险的。2026 年的实际部署中,至少有三个工程层面的难题尚未完全解决。
难题一:故障域放大与稳定性挑战。 超节点把几百上千张卡封装成一个统一域,好处是通信效率高,代价是故障域被放大。Meta 在 Llama 3.1 训练中披露的"54 天 419 次中断"已经说明问题——集群规模越大,单卡故障对整体的影响越大。华为昇腾 950PR 全年产量约 80 万片,但自研 HBM 的产能爬坡和良率提升仍是关键变量,此前行业分析指出,国产 HBM 在量产一致性与海外产品仍有差距。超节点的稳定性,不只是硬件良率问题,更是软件栈的容错调度问题。
难题二:软件生态的代际差距。 CANN 生态(昇腾)虽已适配超 1000 个模型,但距离 CUDA 的数十万开发者生态仍有数量级差距。这正是 DeepSeek V4-Flash 选择 Triton 路线的战略意义——它把"算子主权"从英伟达手里拿回来,让国产芯片厂商不再需要为每一个新模型做一对一适配。但 Triton 本身的生态成熟度、与各厂商硬件后端的深度协同,仍需要时间打磨。
难题三:HBM 供给约束传导至架构决策。 据 TrendForce 集邦咨询,由于 DRAM 供不应求格局将延续至 2027 年且原厂 HBM4e 验证进度存在变量,自 2026 年第三季起,NVIDIA 对 Rubin Ultra 的 HBM 配置已从 HBM4e 12hi 改为并行评估 HBM4e 8hi、HBM4 12hi、HBM4 8hi 等设计。部分云端服务供应商也在考虑调降下一代自研 ASIC 的 HBM 容量设计。这意味着高端 AI 芯片的显存容量与交付节奏会受到供应链不确定性影响,超节点架构的"大内存统一编址"优势,反而成为对冲 HBM 供给紧张的系统级方案——用更多卡的内存池化,弥补单卡 HBM 容量不足。
八、对工程团队与开发者的启示
基于以上分析,几条对工程团队和开发者的实操启示。
启示一:选模型时,要同时看它的超节点适配情况。 2026 年 8 月的模型发布,已经不只是"参数量+benchmark 分数"的二维比较,而是"模型架构×超节点协同×算子栈自主权"的三维比较。Qwen3.8-Max 与真武 M890 协同实现 1.5 倍 Agentic 推理提升、DeepSeek V4-Flash 脱离 CUDA 实现国产芯片一键部署——这些"协同优化"的细节,比 benchmark 分数更能决定实际部署体验。
启示二:MoE 推理的瓶颈在通信,不在算力。 如果你部署的是 MoE 模型(Kimi K3、Qwen3.8、DeepSeek V4 系列),不要只看 GPU 的峰值 TFLOPS,更要看卡间互联带宽和统一内存编址能力。在传统 8 卡集群上跑 MoE,可能出现"GPU 利用率看起来很高,但有效吞吐很低"的现象——这就是通信墙在作祟。超节点把强耦合通信限制在柜内,是解决这个问题的根本路径。
启示三:杰文斯悖论意味着算力规划要留余量。 不要因为"模型推理效率提升了"就压缩算力采购预算。历史数据反复证明:推理效率提升会降低单位成本,但会刺激应用场景爆发,导致总 Token 消耗量指数级增长。Kimi K3 上线即挤爆服务器就是最新案例。规划算力时,应该按"应用场景爆发后的 3-5 倍 Token 消耗"来预留余量,而不是按当前消耗线性外推。
启示四:国产算力栈的闭环正在成型。 DeepSeek V4-Flash 的 Triton 算子栈 + 华为昇腾/平头哥/昆仑芯/摩尔线程的超节点硬件 + Qwen3.8/Kimi K3/GLM5.2 等国产模型——这三层正在快速咬合。对做国产化部署的团队来说,现在是一个值得认真评估的窗口期:过去"国产芯片跑不动大模型"的刻板印象,正在被"国产芯片+超节点+自主算子栈"的组合逐步打破。
启示五:超节点的竞争焦点从"卡数"转向"系统级效率"。 华为昇腾 1024 卡、平头哥 64 卡、浪潮 32 卡——卡数多寡不是评判标准,关键看"有效算力"——即扣除通信等待后真正用于计算的比例。评估超节点方案时,应该看 MFU(Model FLOPs Utilization)、通信时延、统一内存编址空间、故障恢复时间这些系统级指标,而不是单卡峰值性能。
九、尾声:从"力大飞砖"到"系统协同"的范式迁移
把视野拉远,2026 年 8 月这一周发生的事,可能被记作国产算力叙事中心迁移的转折点。
7 月 27 日,Kimi K3 上线即挤爆服务器,用最直接的方式证明"算法优化救不了算力总需求"。8 月 3 日,阿里 Qwen3.8-Max 发布,2.4 万亿参数的 MoE 模型与真武 M890 超节点协同,在 Agentic 推理场景实现 1.5 倍性能提升。8 月 5 日,DeepSeek V4-Flash 正式版上线,284B 总参数跑赢 1.6T 旗舰,并脱离 CUDA 实现算子主权。同一周,WAIC 2026 上几乎所有国产算力厂商都把超节点摆在了展台最醒目的位置——华为、壁仞、燧原、中兴通讯、中科曙光、阿里云、摩尔线程,全阵容出战。
这些事件共同指向一个清晰的信号:"力大飞砖"的单卡跑分时代结束了,"系统协同"的超节点时代开始了。
这个迁移的深层逻辑,是 MoE 架构与百万 Token 上下文带来的物理瓶颈——通信墙和显存墙——把传统 8 卡集群的扩展模式撞穿了。超节点不是某一个厂商的独家技术,而是整个行业面对同一物理瓶颈的必然选择。它的核心不是"堆更多卡",而是"让几百张卡像一台计算机那样协同工作"——通过高速互联协议、统一内存编址、Scale-Up 架构,把强耦合通信限制在柜内,把通信时延从微秒级降到百纳秒级,把有效算力从理论峰值中释放出来。
2026 年是验证期,下半年 Q3、Q4 进入加速放量期。到 2027 年,行业规模有望增长三到四倍,达到千亿级市场,AI 服务器占比会占到三到四成。华泰证券测算的 2028 年 3414 亿元市场空间、194% 复合年增长率,不是空中楼阁——它对应的是万亿参数 MoE 模型的训练与推理刚需、百万 Token 上下文的显存刚需、Agent 任务的高并发刚需。
但这场战争的胜负手,不在卡数多寡,而在三个更底层的维度:一是统一内存编址的工程成熟度,二是软件生态(CANN/Triton/CUDA)的代际差距能否缩小,三是 HBM 供给约束下的架构韧性。这三件事,决定了国产超节点是真正突破芯片制造工艺限制的"换道超车",还是又一次"概念先行、工程滞后"的泡沫。
华为昇腾 950 SuperPoD 已商用落地 750 多套、训练出 SOTA 模型,是国内唯一规模化商用的超节点方案。这个"750 套"的数字,比任何 benchmark 分数都更有说服力——它说明超节点已经从概念验证迈入真实生产环境。接下来的 12-18 个月,谁能把超节点的系统级效率做到极致、谁能把软件生态的代际差距缩小、谁能在 HBM 供给约束下保持架构韧性,谁就握住了万亿 MoE 时代的算力权杖。
这场竞赛的起点是"GPU 不再单打独斗",终点是"几百张卡协同成一台超级计算机"。2026 年 8 月,发令枪已经响过,真正的长跑才刚开始。
内容由 Qific2.1flash 模型辅助生成
Qific2.1flash 模型是千策人工智能研究院开发的旗舰多模态推理模型。基于 217B 总参数 / 23B 激活参数的稀疏 MoE 架构,原生支持图片和视频理解。