Huawei Ascend 960 (昇腾 960)
产品概述
Huawei Ascend 960 是昇腾第五代 AI 芯片,2026 年 9 月 17 日华为全联接大会(HUAWEI CONNECT 2026,上海)由轮值董事长汪涛正式官宣。与上代最大不同:960 不再是单纯的路线图预告,而是双版本(960DT 训练 / 960PR 推理)+ 双超节点(Atlas 860 风冷 / Atlas 960 液冷)的完整商用组合,且两款芯片均提前就绪——960DT 较原计划提前三个季度,960PR 提前一个季度。
同时官宣的还有全球首个采用 NPO(近封装光学)技术的超节点——昇腾 960 超节点:单节点 4096 卡互联、8 EFLOPS FP8、1PB HBM,基于「灵衢 UnifiedBus + Hi-ONE 光引擎」打造。华为同步确认一年一代迭代节奏:2028 年昇腾 970、2029 年昇腾 980。
⚠️ 信息口径说明:本卡单芯片规格以 HC2026 官方披露为准。2026 年 8 月数字中国建设峰会曾披露「Atlas 960 SuperPoD 支持 15488 张昇腾卡」,9 月官方口径为单超节点 4096 卡(约为此前 15488 说法的修订,本文以官方新闻稿为准)。
核心规格
以下为 昇腾 960DT(训练版,官方披露值):
项目参数架构Da Vinci v6(昇腾第六代)FP8 算力2 PFLOPSFP4 算力4 PFLOPS显存288 GB(自研 HBM,最高配置)显存带宽9.6 TB/sTDP700 W(推测,官方未披露)首发2027 Q2
📌 相比 950 系列(FP8 1 PFLOPS / FP4 2 PFLOPS),960 各核心指标翻倍:FP8 2→×2、FP4 4→×2、显存 288GB vs 144GB(950DT)、带宽 9.6TB/s vs 4TB/s。华为称这一持续翻倍路径为「韬定律」。
⚠️ TDP 为第三方推测值,官方未公布;风冷版本(Atlas 860)的存在意味着单卡功耗需控制在风冷散热可承受范围内。
960DT vs 960PR 双版本
维度960DT(训练)960PR(推理)FP8 算力2 PFLOPS未单独披露就绪时间2027 Q1(提前 3 个季度)2027 Q3(提前 1 个季度)上市时间2027 Q22027 Q3配套超节点Atlas 860(风冷)Atlas 960(液冷)定位十万亿参数模型训练 + 高并发推理大规模推理部署
昇腾 960 超节点(全球首个 NPO 超节点)
指标昇腾 950 超节点昇腾 960 超节点单节点卡数1024 卡(WAIC 2026 展出)4096 卡FP8 算力8 EFLOPS(8192 卡满配)8 EFLOPS(单节点)FP4 算力16 EFLOPS(8192 卡满配)16 EFLOPS(单节点)HBM 总容量1152 TB(8192 卡满配)1 PB(4096 卡)互联 RTT3 μs2 μs(全域 D2D)光互联灵衢 2.0 总线NPO 光引擎 Hi-ONE(业界首个量产)
NPO(近封装光学)关键数据
Hi-ONE 光引擎:单引擎传输容量 7.2T,业界首个量产 NPO 产品、当前传输能力最大、唯一内置光源
5500 个 Hi-ONE 替代 48000 颗 800G 光模块,功耗降低超 550 kW
系统无故障运行时间提升一倍,整体可用度达 99.8%
为什么选 NPO 而非 CPO:NPO 在保留光引擎独立性的同时实现光电近距离握手,规避 CPO 的可靠性、可制造性、可维护性难题,延续现有光模块产业生态
MFU 收益(华为马尔科夫实验室仿真):4K 超节点组成的 10 万卡集群,相比 8 卡服务器组网,MFU 提升 2.75 倍——传统架构下集群内通信占训练时间超过 40%
集群扩展路径
多个 960 超节点经灵衢网络或 RoCE 互联:最大 51.2 万卡(二层 CLOS 四平面组网)
叠加多轨道拓扑:最大 100 万卡昇腾超节点集群
鲲鹏超节点同步升级:全光组网最大 4096 节点、256TB 统一内存池
一年一代路线图(韬定律)
年份芯片状态2026昇腾 950DT / 950PR已规模商用2027昇腾 960DT / 960PR提前就绪,Q2 / Q3 上市2028昇腾 970官宣,算力规格继续翻倍2029昇腾 980官宣,访存带宽 / 容量 / 互联带宽同步大幅提升
生态与部署现状
部署底盘:昇腾 910C 超节点已部署超 1000 套,昇腾 950 超节点已规模商用——960 是踩着两级台阶向上
CANN 生态跨越拐点:外部开发者占比升至 61%(首次超越内部团队),月活跃开发者突破 5200 人,CANN 全面开源并进入常态化社区运营
鲲鹏 + 昇腾:已汇聚 780 余万开发者,孵化 2 万多个行业解决方案
存储配套:OceanStor M900 集群(灵衢总线一跳直连 PB 级 KV 缓存)同步发布
与竞品对比
指标昇腾 960DTNVIDIA B200NVIDIA Rubin R200AMD MI455XFP8 算力2 PFLOPS4.5 PFLOPS12.5 PFLOPS2.3 PFLOPSFP4 算力4 PFLOPS9 PFLOPS50 PFLOPS4.6 PFLOPSHBM 容量288 GB192 GB288 GB288 GBHBM 带宽9.6 TB/s8 TB/s16 TB/s12 TB/s制程SMIC 国产化(未官宣)TSMC 4NPTSMC 4NPTSMC 3NM上市2027 Q2已上市已上市已上市
960 单卡绝对性能仍落后 NVIDIA 旗舰一代(Rubin R200 FP8 约为其 6 倍),华为的策略是以超节点系统级能力(统一内存编址、MFU 提升 2.75 倍、NPO 光互联)弥补单卡差距——评估国产算力不能只比单芯片 PFLOPS。
适用场景
✅ 十万亿参数级大模型训练(4096 卡超节点 + 统一内存编址)
✅ 高并发推理(推理时延较前代降低约 70%,训练吞吐提升约 2.3 倍,官方口径)
✅ 常规机房部署(Atlas 860 风冷超节点,无需液冷改造)
❌ 单卡采购(以超节点 / 集群形态交付)
❌ 2026 年内落地(芯片 2027 年上市)
厂商信息
项目内容制造商华为技术有限公司(海思半导体)官网https://www.hiascend.com官宣2026-09-17(华为全联接大会 2026,上海)960DT 上市2027 Q2960PR 上市2027 Q3
参考资料
华为官网:发布全球首个采用 NPO 的超节点(昇腾 960 超节点)
电子工程专辑:华为昇腾960芯片将提前发布
环球网:华为发布昇腾960超节点 加速十万亿级大模型训练推理
相关产品
Huawei Ascend 950 - 前代超节点(8192 卡规划)
Huawei Ascend 950DT - 前代训练卡(FP8 1 PFLOPS)
Huawei Ascend 950PR - 前代推理卡
Huawei Ascend 970 - 下一代(2028 官宣)
完整对比表