“十五五”规划明确支持十万卡级别智算设施建设,京东、DeepSeek、中科曙光三大国产算力项目相继浮出水面。
9月9日,京东云在2026京东全球科技探索者大会(JDD)大会正式披露,将联合摩尔线程规划建设十万卡全功能GPU国产智算集群,预计2027年完成建设。
该集群以摩尔线程全功能GPU作为算力底座,定位训推一体,兼顾大模型训练、长文本推理与具身智能场景,算力资源将对外行业开放,同时支撑京东JoyAI大模型迭代与零售、仓储物流等物理AI业务落地。
但项目并非一步到位直上十万卡,而是先落地多个万卡试点集群,提前验证大规模集群下分布式训练、高速互联、故障自愈、算力利用率(MFU)等工程化难题,再逐步扩容。这也是国内头部公有云厂商,首次规划以国产GPU为主力的十万卡智算底座,意味着国产GPU开始进入公有云大规模核心算力池,而不是仅作为异构补充。
市场层面另一个备受关注的项目,是外媒曝出DeepSeek在乌兰察布规划的16万颗昇腾 950DT芯片集群。从已知信息来看,昇腾950DT芯片主打大模型推理场景,并非面向基础大模型预训练,DeepSeek与华为双方也均未作出公开回应。
在此之前,DeepSeek曾用昇腾910C集群完成超大MoE模型的后训练验证,在湛江落地全栈国产千卡推理集群,完成国产算力的前置验证。乌兰察布作为东数西算八大算力枢纽之一,拥有稳定电力与能耗指标,适合部署大规模推理算力池。
相比尚在规划与传闻阶段的项目,中科曙光“曙光 8000(登峰)”是国内首个已经正式投运的全国产十万卡AI超集群,落地于郑州国家超算互联网核心节点,采用海光 DCU作为计算核心,从芯片、服务器、高速互联网络、分布式存储到液冷散热、集群调度系统实现全链路国产化。
集群上线首周即实现满载运行,面向大模型训练、AI for Science科研仿真提供公共算力,直接接入国家超算互联网,成为全国一体化算力网络的核心节点。
曙光登峰的价值,在于完整验证十万卡规模下国产软硬件栈协同、大规模运维与算力调度能力,证明国产加速卡可以支撑十万卡集群稳定商用,打通从芯片到上层应用的工程闭环。
十万卡集群本质不是简单“堆叠加速卡”,也不能简单的理解为“万卡的十倍扩容”。
万卡与十万卡之间巨大的工程鸿沟在于,当节点规模扩张一个数量级,节点间通信延迟、单点故障扩散风险、供电与液冷散热压力、分布式调度复杂度都会呈非线性上升。可以说,国产集群当前最大挑战,就集中在大规模组网下的通信效率与模型算力利用率。单芯片理论峰值指标只是基础,如何在数万卡并行场景维持稳定高 MFU,才是国产算力生态必须攻克的核心课题。
同时,这三个项目定位也存在明显差异。京东、摩尔线程集群兼顾训练、推理、具身智能;传闻中的乌兰察布昇腾集群偏向推理;曙光登峰集群同时承载大模型训练与科学计算,三条路线分别对应公有云、模型厂商、国家公共算力三类市场需求。
从产业链视角看,十万卡集群集中落地,将反向拉动国产GPU/DCU、高速互联、服务器整机、液冷、分布式框架、集群调度软件全链条迭代。过去国产芯片生态短板,很多源于缺少十万卡级真实场景压力测试;而大规模集群建设,能够暴露底层软件、驱动、网络协议中的各类问题,倒逼软硬件联合调优,加速生态成熟。
当然,产业仍处在早期扩张阶段,需要区分项目状态。曙光登峰是已投产落地标杆;京东摩尔线程十万卡属于中长期规划,仍要经过万卡试点验证;DeepSeek乌兰察布项目尚未官方确认,市场预期仍存在不确定性。政策端明确鼓励,但能耗、资金、供应链交付、生态适配等约束条件,决定十万卡集群不会短期批量爆发。
长期看,在十五五算力顶层规划驱动下,国产十万卡集群将从单点标杆逐步走向多点开花。算力竞争的重心,正从单芯片性能比拼,转向“全栈系统工程、大规模集群稳定性、算力利用率与场景落地能力”的综合较量。国产算力正在从“能用”,走向十万卡规模下“好用、可规模化商用”的新阶段。