华为开放openPangu-2.0-Pro:5050亿参数、512K上下文,权重与昇腾推理代码同步上线

2026年7月31日,华为正式开放 openPangu-2.0-Pro模型权重、技术报告及基础推理代码。

image.png

openPangu-2.0-Pro是一款基于昇腾NPU完成训练的大规模混合专家语言模型,总参数约505B,即5050亿参数,每个Token实际激活约18B参数,并支持512K上下文。模型预训练数据规模约为34T Tokens。

模型目前已经上线GitCode和华为官方Hugging Face组织,同时提供原始版本与INT8量化版本。企业和开发者也可以通过华为云ModelArts Studio直接在线体验文本生成、深度思考与Function Call能力。

模型权重入口:

openPangu-2.0-Pro官方GitCode页面

华为云体验入口:

华为云ModelArts Studio

openPangu-2.0-Pro是什么?

openPangu是华为推出的开放AI模型品牌,重点围绕昇腾硬件建立原生训练、推理、算子和部署实践。

openPangu-2.0系列主要包含两个版本:

模型 总参数 每Token激活参数 上下文 定位
openPangu-2.0-Flash 92B 6B 512K 低成本、高吞吐、轻量部署
openPangu-2.0-Pro 505B 18B 512K 复杂推理、Agent、代码及专业任务

openPangu-2.0-Flash已于2026年6月30日先行开放模型权重、基础推理代码和训推算子;华为当时宣布,Pro版本的模型权重及推理代码将在7月上线。

Pro版本此次按计划开放,使openPangu-2.0系列形成了“Flash负责效率、Pro负责能力”的双模型组合。

openPangu-2.0-Pro核心参数

项目 openPangu-2.0-Pro
模型类型 大规模MoE语言模型
训练硬件 华为昇腾NPU
总参数量 约505B
激活参数量 每Token约18B
上下文长度 512K
训练数据规模 约34T Tokens
注意力结构 MLA+DSA+SWA
残差拓扑 四分支mHC
推理加速 三头MTP自投机
训练优化器 Muon
思考模式 Thinking与Non-Thinking
Agent能力 Function Call、工具调用及长任务
推理框架 omni-infer
推理硬件方向 Ascend 910C
量化版本 openPangu-2.0-Pro-Int8

以上规格来自openPangu官方模型卡。

5050亿参数并不代表每次都计算5050亿参数

openPangu-2.0-Pro采用混合专家架构。

模型虽然拥有约5050亿总参数,但在处理每个Token时,只激活约180亿参数,相当于每次调用约3.6%的模型参数参与计算。

MoE架构的主要目的,是在扩大模型总容量的同时,控制每次推理实际需要的计算量。

可以把它理解为模型内部包含大量不同领域的专家。当输入一段代码、数学题或办公任务时,路由系统会选择更适合当前Token的部分专家,而不是让所有专家同时运行。

这种方式能够同时获得:

更大的知识和能力容量
相对可控的单Token计算量
更适合并行部署的模型结构
更高的推理吞吐潜力

不过,18B激活参数并不代表完整模型可以按普通18B模型部署。完整权重仍然包含505B参数,对存储、内存和多卡通信的要求依然很高。

512K上下文可以处理什么?

openPangu-2.0-Pro原生支持512K上下文,可用于容纳更长的代码、文档和Agent执行记录。

适合的应用场景包括:

大型代码仓库分析
多份行业报告综合研究
长篇合同与制度文档
企业知识库问答
长时间Agent工具调用
多轮项目规划
复杂数据分析任务
数百页材料整理
跨文档信息对照

但512K上下文并不意味着应用应该把所有文件一次性全部提交给模型。

正式系统仍需要结合:

文档检索
向量数据库
上下文压缩
历史对话摘要
文件分块
权限管理
缓存策略

否则,大量无关内容会增加推理费用,也可能干扰模型判断。

MLA+DSA+SWA如何处理长上下文?

openPangu-2.0-Pro沿用了高效率的MLA注意力结构,同时采用DSA与SWA独立分层混合方案。

两类注意力层按照约1:2的比例排列:

SWA负责局部窗口建模
DSA负责稀疏的全局信息聚合

SWA负责局部上下文

Sliding Window Attention只关注当前Token附近的一段内容。

在语言、代码和文档中,大量关系都发生在局部范围内,例如:

当前句子中的语法关系
相邻代码行
当前函数内部变量
表格附近的数据
同一段落中的指代

只处理局部窗口,可以减少长上下文中的计算和显存消耗。

DSA负责全局信息

长文档中仍然存在跨越很远距离的重要关系,例如:

文档开头定义的规则
代码仓库中的公共接口
合同前后条款
Agent早期确定的任务目标
不同报告中的相同指标

DSA负责从长上下文中筛选和聚合这些稀疏但重要的全局信息。

两种结构组合后,模型不必让所有Token之间都进行完整计算,而是把更多算力集中在真正需要建立关联的位置。

四分支mHC残差结构是什么?

openPangu-2.0-Pro将传统残差连接升级为四分支mHC架构。

官方模型卡表示,这项设计用于提高模型内部表征的多样性和泛化能力。

传统Transformer通常沿着一条主要残差路径传递信息。随着模型层数增加,不同层的特征可能不断混合,部分早期信息也可能被弱化。

多分支结构可以让不同特征沿多条路径传播,使模型更容易保留和组合不同层级的信息。

这种结构的实际价值需要结合技术报告和社区复现进一步判断,但从产品定位看,它主要服务于复杂推理、专业任务和长上下文理解。

三头MTP一次额外预测3个Token

openPangu-2.0-Pro内置三头MTP自投机模块。

普通自回归模型每执行一次前向计算,通常只生成一个新Token。

MTP会同时预测多个未来位置。openPangu-2.0-Pro的三头MTP可以一次额外预测3个Token,再对候选结果进行验证,从而减少逐Token解码产生的等待时间。

这类能力对以下任务尤其重要:

长篇内容生成
代码编写
数学推理
Agent连续执行
高并发API服务
长思考过程

MTP能够提高多少实际速度,还取决于候选Token接受率、推理框架、并发量和昇腾集群配置,不能只根据“预测3个Token”直接推算为3倍加速。

Muon优化器用于提高训练收敛效率

openPangu-2.0-Pro在训练中采用Muon优化器。

华为称,该优化器能够帮助模型获得更快的训练收敛速度。

对于505B规模的MoE模型而言,训练效率不仅取决于模型结构,还取决于:

优化器状态占用
专家负载均衡
多节点通信
长序列训练
梯度稳定性
昇腾算子效率

Muon与MLA、DSA+SWA、mHC和MTP共同组成openPangu-2.0-Pro的主要架构升级。

34T Tokens训练与后训练流程

openPangu-2.0-Pro的预训练数据规模约为34T Tokens。

在预训练完成后,模型继续经历了三类主要后训练过程:

1.快慢思考合一的监督微调
2.多专项强化学习
3.在线蒸馏

快慢思考合一

模型同时提供Thinking和Non-Thinking两种使用方式。

需要复杂推理时,可以使用思考模式进行更长的分析;面对简单问答和高频任务时,则可以使用非思考模式降低等待时间与推理成本。

多专项强化学习

不同强化学习阶段可以分别加强:

数学推理
代码任务
指令遵循
工具调用
Agent执行
专业知识任务

在线蒸馏

在线蒸馏用于将不同专项训练阶段获得的能力重新整合,让模型在统一版本中兼顾多个任务,而不是只在某一个评测方向表现突出。

官方测试表现

openPangu官方模型卡公布了Thinking与Non-Thinking两种模式的测试结果。

推理能力

测试项目 Thinking Non-Thinking
AIME 2026 95.4 87.3
AIME 2026+Python 97.9
HMMT 2026年2月 86.2 63.3
HMMT+Python 93.2
IMO-AnswerBench 84.3 60.8
GPQA-Diamond 87.9 81.1
HLE 27.1 9.0

Agent能力

测试项目 Thinking Non-Thinking
TAU2-Bench 81.1 71.6
MCP-Atlas 61.3 48.8
SkillsBench 48.9 47.5
WildClawBench 46.5 43.1
Claw-Eval 61.7 49.4
GDPVal 74.9 51.2
BrowseComp 65.7

代码能力

测试项目 Thinking Non-Thinking
LiveCodeBench V6 85.7 74.5
DeepCodeBench 74.2 72.6
SWE-bench Verified 68.5 66.8
FeatBench 47.1 48.4

以上结果来自华为官方模型卡,并非独立第三方统一盲测。不同模型的系统提示词、推理预算、工具环境和测试次数可能不同,因此不应直接用单项数字判断综合排名。

思考模式并非所有项目都更高

从官方数据看,Thinking模式在数学、深度推理和多数Agent任务上领先较明显。

但Non-Thinking模式也并非所有项目都更弱:

Chinese-SimpleQA中Non-Thinking为75.7,高于Thinking的74.2
PinchBench中Non-Thinking为88.9,高于Thinking的84.0
FeatBench中Non-Thinking为48.4,略高于Thinking的47.1

这说明更长的思考过程不一定适合所有任务。

实际应用可以按照任务难度进行路由:

使用Non-Thinking

简单知识问答
信息提取
内容改写
分类和标签
高频客服
基础代码补全
结构化数据转换

使用Thinking

数学推理
复杂代码修复
Agent规划
多约束决策
深度研究
长文档分析
工具调用任务

openPangu-2.0-Pro与Flash如何选择?

对比方向 openPangu-2.0-Flash openPangu-2.0-Pro
总参数 92B 505B
激活参数 6B 18B
上下文 512K 512K
训练数据 34T Tokens 34T Tokens
部署门槛 相对较低 很高
推理成本 更低 更高
复杂推理 适合常规任务 更适合高难度任务
Agent能力 高频执行 复杂规划与执行
私有化部署 中型集群 大规模昇腾集群

两款模型使用相近的核心架构和后训练方向,但通过不同参数规模覆盖不同企业需求。

企业可以采用分层调用:

Flash处理大部分日常请求
Pro处理复杂推理与Agent任务
简单任务使用非思考模式
高难度任务切换到思考模式

权重、推理代码和INT8版本已经开放

此次开放内容主要包括:

openPangu-2.0-Pro原始模型权重
openPangu-2.0-Pro-Int8量化权重
openPangu-2.0技术报告
基础推理代码
模型配置
部署说明
评测数据

官方推理代码仓库为openPangu-2.0-Infer,面向Ascend 910C部署,并采用Apache 2.0许可证。

INT8量化版本也已同步上线。量化能够减少权重存储和推理内存占用,但具体精度变化、硬件规模和性能数据需要参考部署文档及实际业务测试。

“开源”需要区分模型权重与代码许可证

华为将openPangu定位为开源AI模型品牌,并在官方发布中使用“开源上线”的表述。

从严格许可证角度看,需要分别理解:

模型权重:OPENPANGU MODEL LICENSE AGREEMENT VERSION 2.0
基础推理代码:Apache License 2.0

因此,“华为开放模型权重与推理代码”是较准确的技术表述。

模型权重并非直接采用Apache 2.0或MIT等标准软件开源许可证。企业计划修改、分发、托管或用于商业服务前,应完整阅读OpenPangu Model License 2.0,而不能只根据“开源”两个字判断使用范围。

可以在普通电脑运行吗?

openPangu-2.0-Pro不适合普通个人电脑直接运行。

虽然每个Token只激活18B参数,但部署时仍需要存放和管理完整的505B模型权重。

其主要部署对象包括:

昇腾算力集群
云计算平台
高校和研究机构
大型企业AI团队
推理服务商
行业模型开发团队

官方基础推理项目面向Ascend 910C,并使用omni-infer框架。

个人开发者更适合:

通过华为云MaaS调用
使用92B的openPangu-2.0-Flash
等待社区进一步量化
在云端租用昇腾计算资源

华为云ModelArts Studio已经可以在线体验

openPangu-2.0-Pro已经上线华为云ModelArts Studio,提供:

文本生成
深度思考
Function Call
在线体验
API调用

华为云页面当前显示的参考价格为:

输入长度 缓存命中 普通输入 输出
低于32K 0.8元/百万Token 3.2元/百万Token 14.5元/百万Token
32K及以上 1.2元/百万Token 4.8元/百万Token 17.6元/百万Token

价格、活动与上下文分段规则可能继续调整,正式接入前应以华为云控制台中的实时计费页面为准。

openPangu-2.0-Pro适合哪些场景?

企业Agent

支持Function Call和深度思考,可以用于任务规划、工具调用和企业工作流。

代码开发

官方在LiveCodeBench、DeepCodeBench和SWE-bench Verified中公布了相应成绩,可用于代码生成、仓库修改和Bug修复。

深度研究

512K上下文可以处理较多网页、报告和企业资料,并结合搜索工具生成研究结果。

金融与行业分析

可用于处理年报、政策、行业数据和企业知识库,但高风险结论必须经过专业人员审核。

企业知识库

支持长文档输入,可用于制度查询、技术资料检索和内部问答。

数学与科学计算

Thinking模式在AIME、HMMT、GPQA-Diamond等官方测试中表现突出,也支持通过Python工具辅助计算。

国产算力私有化部署

对已经建设昇腾集群的企业而言,openPangu提供了从模型权重到推理代码的原生技术路线。

openPangu推动的不只是一个模型

openPangu-2.0-Pro的意义不仅是开放一个505B模型。

华为希望通过openPangu逐步开放和完善:

模型权重
基础推理代码
预训练代码
后训练代码
训练与推理算子
昇腾集群部署方案
量化版本
云端MaaS服务

华为在6月30日的官方公告中表示,openPangu-2.0相关组件将分阶段开放,更多组件将在2026年下半年继续上线。

这套路径的主要目标,是让开发者不仅可以下载模型,也能研究如何在昇腾硬件上完成训练、推理、量化和行业部署。

当前仍有哪些限制?

部署硬件门槛较高

505B总参数决定了完整模型仍然需要大规模计算和存储资源。

主要面向昇腾生态

官方推理代码以Ascend 910C为主要目标。CUDA、llama.cpp及其他GPU推理框架的兼容情况,需要社区继续适配。

官方测试不等于第三方排名

当前成绩主要由华为模型卡公布,需要更多独立榜单和实际业务测试验证。

512K不代表所有信息都能被准确利用

长上下文中的信息检索、位置偏差和无关内容干扰仍然需要应用层解决。

模型许可证为自定义协议

商业部署、二次发布和托管服务前,应单独审查OpenPangu Model License 2.0。

当前是纯语言模型

openPangu-2.0-Pro模型卡将其定位为语言模型,输入输出重点为文本,不应直接视为图片、音频或视频全模态模型。

总结

2026年7月31日,华为正式开放openPangu-2.0-Pro模型权重、技术报告及基础推理代码。

模型采用505B总参数、18B激活参数的MoE架构,支持512K上下文,并使用约34T Tokens完成预训练。后训练阶段融合快慢思考SFT、多专项强化学习和在线蒸馏。

在架构方面,openPangu-2.0-Pro引入:

MLA注意力
DSA+SWA分层混合结构
四分支mHC拓扑
三头MTP自投机模块
Muon优化器

这些技术主要用于降低长上下文计算成本、增强模型表征能力,并提高推理吞吐。

权重已经同步上线GitCode与华为官方Hugging Face组织,INT8量化版本和基于Ascend 910C的openPangu-2.0-Infer推理项目也已提供。

普通开发者可以通过华为云ModelArts Studio在线体验;已经部署昇腾集群的企业,则可以下载权重和推理代码进行私有化测试。

需要注意的是,模型权重使用OpenPangu Model License 2.0,推理代码则采用Apache 2.0许可证。企业在商业使用前仍需分别核对许可证和部署成本。

openPangu-2.0-Pro真正值得关注的地方,不只是5050亿参数,而是华为正在尝试提供一套从模型架构、权重、量化、推理代码到昇腾云服务的完整开放实践。

相关链接

© 版权声明

相关文章

暂无评论

none
暂无评论...