2026年8月3日,阿里正式发布新一代旗舰模型 Qwen3.8-Max。
这是目前千问系列规模最大、综合能力最强的旗舰模型,采用2.4万亿总参数、950亿激活参数的稀疏混合专家架构,支持100万Token上下文,以及文本、图片和视频输入。模型重点提升编程、真实办公、专业研究、视觉理解和长程任务执行能力。
Qwen3.8-Max已经通过以下渠道开放:
开发者可以使用qwen3.8-max模型ID,通过OpenAI兼容、Anthropic兼容或DashScope接口调用。
阿里还宣布,将在下一周发布Qwen3.8-Max模型权重。这将是千问团队首次开放Max级旗舰模型的权重。按照8月3日公告时间计算,开放时间预计位于 2026年8月10日至16日,但官方尚未公布具体日期、许可证和下载地址。
Qwen3.8-Max是什么?
Qwen3.8-Max是基于Qwen3.5架构继续扩展的新一代多模态旗舰基础模型。
它并不只面向聊天问答,而是围绕能够持续数小时甚至数天工作的AI Agent进行训练,让模型可以自主规划、调用工具、读取文件、修改代码、检查结果,并根据执行反馈继续迭代。
阿里对Qwen3.8-Max的官方定位主要包括:
阿里云模型文档称,Qwen3.8-Max可以承担法律、金融、设计等数百种专业任务,并尝试在一次对话中完成从需求理解到生产级成果交付的完整流程。
Qwen3.8-Max核心规格
| 项目 | Qwen3.8-Max |
|---|---|
| 模型架构 | 稀疏混合专家模型,MoE |
| 总参数量 | 2.4T,约2.4万亿 |
| 激活参数量 | 95B,约950亿 |
| 上下文窗口 | 1,000,000 Token |
| 最大输入长度 | 991,808 Token |
| 最大输出长度 | 131,072 Token |
| 最大思维链长度 | 262,144 Token |
| 输入模态 | 文本、图片、视频 |
| 输出模态 | 文本 |
| Function Calling | 支持 |
| 结构化输出 | 支持 |
| 上下文缓存 | 支持 |
| 推理强度 | low、medium、xhigh |
| API模型ID | qwen3.8-max |
| 权重状态 | 计划下周开放 |
以上规格来自阿里云Qwen3.8-Max模型文档和阿里官方发布信息。
2.4万亿参数并非全部同时参与推理
Qwen3.8-Max采用稀疏MoE架构。
模型总参数达到2.4万亿,但处理每个Token时只激活约950亿参数,约占全部参数的4%。模型会根据当前输入,将Token路由给更适合处理该内容的部分专家。
这种设计的主要目标是同时获得:
但“950亿激活参数”并不意味着开放权重后可以把它当作普通95B模型部署。完整权重仍然包含2.4万亿参数,存储、显存和跨卡通信门槛预计都非常高。这是根据其参数规模作出的工程判断,具体硬件要求仍需等待官方部署文档。
混合注意力兼顾长上下文和推理效率
Qwen3.8-Max在稀疏MoE之外,还采用混合注意力机制。
阿里称,这套架构用于平衡超大参数规模、长上下文理解和实际推理效率,使模型在处理大型代码仓库、长篇文档、图片和视频内容时,不必让所有Token之间都执行同等规模的完整计算。
Qwen3.8-Max支持100万Token上下文,大致可以容纳:
官方表示,模型可以理解百页文档、完整电视剧集或长达100小时的直播内容,并将其整理为可搜索、可交互的知识结构。
不过,100万Token窗口不等于模型能够同等准确地使用其中每一条信息。实际应用仍然需要文件检索、上下文压缩、任务分段和历史摘要,避免无关资料占用窗口。
从Preview升级为正式版
Qwen3.8-Max-Preview于2026年7月19日率先进入Token Plan、Qoder和QoderWork,主要用于收集真实代码、办公和长程任务反馈。
预览版已经重点展示:
Qoder曾将预览版描述为相比Qwen3.7-Max在编程、专业生产力和复杂长任务中取得全面提升。
8月3日上线的Qwen3.8-Max正式版已经替代预览版成为当前主力模型,并在Qoder全平台和阿里云百炼中正式提供。
“真实办公”指的是什么?
过去的大模型办公能力,通常集中在总结文章、生成邮件和制作PPT文案。
Qwen3.8-Max所强调的“真实办公”,更接近读取工作资料、调用工具并直接完成最终成果。
官方展示的任务覆盖:
例如,用户可以将合同、业务数据、邮件和会议记录交给模型,再要求它:
模型需要在同一个任务中保持目标、调用不同工具,并交付可以继续编辑和审核的成果。
这与只在聊天框中返回一段建议存在明显区别。
支持图片、视频和文本统一理解
Qwen3.8-Max原生支持:
同时支持Function Calling、结构化输出、前缀续写和上下文缓存。
视觉能力可以参与Agent执行的不同阶段:
阿里称,Qwen3.8-Max可以从一张UI截图重建完整前端项目,将二维户型图转换为三维室内可视化,也可以根据自然语言生成交互式游戏。
从个人视频素材生成完整Vlog
官方列出的多模态任务还包括读取个人原始视频素材,并完成专业Vlog剪辑。
在这类任务中,模型需要理解:
Qwen3.8-Max本身输出的是文本,因此实际视频剪辑仍需通过Agent调用剪辑工具、代码或外部服务完成,而不是模型直接输出最终视频文件。
16天自主完成软件工程项目
阿里在Qwen3.8-Max正式发布时展示了一项长程代码实验。
模型从零开始构建一个名为 oh-my-cli的自进化代码Agent框架,并连续执行了16天。任务过程中,模型持续读取用户反馈、社区实践和自测数据,再反复完成代码生成、测试、预览和日志分析。
最终生成的oh-my-cli已经完整开放在GitHub,项目采用TypeScript和Node.js构建,支持文件、Shell、会话恢复、上下文压缩、任务状态和安全审批等能力。
项目地址:
https://github.com/qwen-code-dev-bot/oh-my-cli
这项实验说明,Qwen3.8-Max可以在具有明确环境和治理规则的情况下,持续执行远超普通聊天会话长度的软件工程任务。
不过,16天自主运行属于阿里内部实验,并非第三方统一测试。实际效果仍取决于:
不能仅根据一次厂商案例,认定模型可以在所有代码仓库中连续运行16天且不需要人工干预。
什么是“闭环迭代”?
普通代码模型的工作流程通常是:
接收需求
↓
生成代码
↓
任务结束
长程Agent更完整的流程是:
理解目标
↓
制定计划
↓
编写代码
↓
运行程序
↓
观察输出
↓
读取错误
↓
修复问题
↓
重新测试
↓
继续完成后续任务
Qwen3.8-Max强化的不是单次代码输出,而是模型能否根据实际运行结果重新判断下一步行动。
这种能力对于复杂任务非常重要,因为真实工作很少可以一次完成。代码会报错,数据会缺失,网页效果可能不符合要求,工具也可能执行失败。
RecreationBench测试黑盒应用复刻
阿里还推出了RecreationBench,用于测试模型在完全黑盒环境中重建应用的能力。
测试时,模型无法访问互联网,也看不到目标应用的源代码,只能通过实际操作、观察界面和获取反馈,重新建立一个功能相近的应用。
这类任务需要模型同时完成:
它更接近真实产品开发中的“观察—实现—验证”流程,而不是根据一张静态截图生成HTML。
Arena文本榜排名第五
根据Arena.ai在2026年8月1日的榜单快照,Qwen3.8-Max在Text Arena综合榜中获得1496±10分,排名第五,是当时得分最高的中国模型。
排名在它之前的四款模型均来自Anthropic。Qwen3.8-Max当前仍被标记为Preliminary,说明分数和排名可能随着新增盲测投票继续变化。
| 排名 | 模型 | 得分 |
| 1 | Claude Fable 5 | 1509±6 |
| 2 | Claude Opus 4.6 Thinking | 1505±4 |
| 3 | Claude Opus 4.7 Thinking | 1502±4 |
| 4 | Claude Opus 4.6 | 1497±4 |
| 5 | Qwen3.8-Max | 1496±10 |
Qwen3.8-Max与第四名只相差1分,但其置信区间较宽,因此不能根据单一分数断言模型已经稳定超过或追平某款Claude模型。
Vision Arena排名第二
在Vision Arena中,Qwen3.8-Max以1305±9分排名第二,仅次于Claude Fable 5的1318±9分。
这项成绩反映了模型在以下任务中的用户偏好:
但Vision Arena是动态真人盲测,排名不能代替OCR准确率、视频理解、空间推理或企业文档测试等具体能力评估。
前端代码榜排名第四
在Arena Code WebDev综合榜中,Qwen3.8-Max以约1668分排名第四,仅落后于Claude Opus 5 Max、Kimi K3 Max和Claude Opus 5 High,领先GPT-5.6 Sol xHigh、GLM-5.2 Max和DeepSeek-V4-Flash。
该榜单重点衡量:
需要注意,Qwen3.8-Max在该榜中的投票和置信区间仍处于初步阶段,后续名次可能变化。
参数规模仅次于Kimi K3
Qwen3.8-Max总参数为2.4万亿,略小于Kimi K3的2.8万亿。
两款模型都采用MoE架构、支持原生视觉理解和100万Token上下文,但它们的激活参数分别约为:
| 模型 | 总参数 | 激活参数 |
| Kimi K3 | 2.8T | 104B |
| Qwen3.8-Max | 2.4T | 95B |
参数数量并不能直接决定模型能力。训练数据、模型架构、后训练、Agent框架和工具环境都会影响最终表现。
从当前公开榜单看:
API已经正式开放
Qwen3.8-Max已经上线阿里云百炼,模型ID为:
qwen3.8-max
官方支持三种主要接口形式:
服务已经覆盖北京、新加坡、东京、法兰克福和美国弗吉尼亚等地域。
一个OpenAI兼容的基础调用示例:
from openai import OpenAI
client = OpenAI(
api_key="<你的阿里云百炼API Key>",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "分析这份项目资料,并制定可执行的交付计划。",
}
],
)
print(response.choices[0].message.content)
具体Base URL需要根据所使用的阿里云地域和Workspace配置调整。
支持三档推理强度
Qwen3.8-Max支持通过reasoning_effort控制思考深度:
lowmediumxhigh默认档位为xhigh。官方映射的思考预算分别约为4096、16384和262144 Token。
适合使用low的任务:
适合使用medium的任务:
适合使用xhigh的任务:
推理档位越高,通常意味着等待时间和思考Token消耗越多,不应对所有任务默认使用最高档。
多轮Agent需要完整回传思考历史
阿里云文档显示,Qwen3.8-Max默认开启preserve_thinking。
在多轮对话中,客户端需要完整回传历史消息中的reasoning_content。这些历史思考内容也会计入输入Token并产生费用。
这对Agent开发者提出了几个要求:
如果客户端只保存最终回答,而丢失历史推理和工具状态,后续长任务表现可能受到影响。
Qwen3.8-Max的API价格
阿里云百炼中国区原价为:
| 计费项目 | 价格 |
| 输入 | 12元/百万Token |
| 输出 | 36元/百万Token |
| 输入缓存命中 | 1.5元/百万Token |
| 显式缓存创建 | 15元/百万Token |
| 显式缓存命中 | 1元/百万Token |
QwenCloud国际价格为:
| 计费项目 | 价格 |
| 输入 | 2美元/百万Token |
| 输出 | 6美元/百万Token |
对于长程Agent,缓存能力非常重要。
大型代码仓库、系统规则和项目文档会在每一轮请求中重复出现。如果能够命中上下文缓存,可以明显降低重复输入成本。
当前限流能力
阿里云百炼在北京、东京、法兰克福和弗吉尼亚区域提供的默认限流为:
新加坡国际区域则为:
这些额度更适合企业级和高并发Agent应用,但具体账户可能受到开通状态、套餐或风控规则影响,应以控制台显示为准。
可以在Qoder中直接使用
Qwen3.8-Max已于8月3日正式上线Qoder,覆盖:
开发者更新到最新版本后,可以在模型选择器中直接切换至Qwen3.8-Max。
Qoder还在正式发布期间提供模型调用奖励和夜间Credits折扣。活动时间、可领取次数和适用套餐可能调整,应以Qoder活动页面为准。
可以在千问办公中使用
Qwen3.8-Max也已接入千问办公QwenWork。
千问办公围绕文档、Excel、PPT、网页、数据分析和企业工作流提供任务交付能力,Qwen3.8-Max可以作为底层模型处理复杂办公和多步骤任务。
这使模型能够进入更完整的办公流程,例如:
权重开放后意味着什么?
官方表示,Qwen3.8-Max将成为首个开放权重的Qwen Max级模型。
权重开放后,开发者和企业理论上可以进行:
但目前尚未公布:
因此,现在只能确认“计划开放权重”,不能写成权重已经可以下载。
普通个人用户能够本地运行吗?
从2.4万亿总参数和950亿激活参数判断,即使模型提供低精度或量化权重,完整部署仍需要大型GPU集群。
开放权重的主要受益者可能包括:
普通开发者更现实的方式仍然是使用QwenCloud、阿里云百炼、Qoder或千问办公,而不是下载完整权重在个人电脑上运行。
“端到端交付”不能理解为完全无人审核
Qwen3.8-Max强调从任务输入到最终成果的端到端交付。
但生产级结果仍应经过人工检查,特别是:
长程任务运行时间越长,错误也越可能在后续步骤中被放大。
企业Agent应该设置:
Qwen3.8-Max适合哪些用户?
软件开发团队
适合大型仓库分析、跨文件修改、测试、调试和长时间代码Agent任务。
企业办公团队
可用于合同、报告、数据、PPT及复杂业务资料处理。
产品经理和设计师
可以从需求、设计稿或页面截图出发,生成产品原型和交互应用。
金融及研究人员
适合阅读大量资料、整理证据和建立研究框架,但投资结论仍需人工审核。
Agent开发者
可以测试长程规划、工具调用、视觉反馈和闭环执行能力。
云服务与模型平台
权重开放后,可研究托管推理、行业模型和企业私有化部署。
当前需要注意哪些限制?
Arena排名仍处于初步阶段
Qwen3.8-Max在多个Arena榜中标记为Preliminary,新增投票可能改变排名。
16天项目属于官方案例
该项目能够公开检查,但整体运行条件和管理方式仍由阿里团队设置。
输出仍以文本为主
模型可以理解图片和视频,但不会直接输出图片或视频文件,需要通过工具完成多媒体生成与编辑。
长上下文成本较高
100万Token窗口适合大型任务,但一次性输入大量资料会增加费用和延迟。
完整权重尚未发布
当前仍不能确定许可证、量化方式和部署成本。
2.4万亿参数不等于综合能力一定更强
模型实际能力取决于架构、数据、后训练、Agent框架和任务类型,而不是只看总参数。
总结
Qwen3.8-Max于2026年8月3日正式上线。
模型采用2.4万亿总参数、950亿激活参数的稀疏MoE架构,支持100万Token上下文,以及文本、图片和视频输入。它重点提升了编程、真实办公、专业研究、视觉理解和复杂长程任务能力。
在Arena.ai的8月1日榜单中,Qwen3.8-Max分别取得:
当前排名仍处于初步阶段,会随盲测投票变化。
在长程代码实验中,Qwen3.8-Max曾连续16天运行,自主构建并持续维护oh-my-cli代码Agent项目。阿里还通过RecreationBench测试模型在没有源码和互联网的情况下,通过操作和视觉反馈重建应用。
API目前已经上线阿里云百炼和QwenCloud,支持OpenAI、Anthropic和DashScope接口,国内价格为每百万Token输入12元、输出36元。
官方计划在下一周开放Qwen3.8-Max模型权重。这是千问团队首次计划开放Max级旗舰模型,但具体日期、许可证、量化版本和部署要求仍未公布。
Qwen3.8-Max展现出的方向已经很明确:
大模型正在从完成一次回答,走向在真实环境中持续工作、检查结果并交付完整成果。
真正决定它能否进入企业生产环境的,不只是2.4万亿参数和榜单成绩,而是长任务成功率、工具调用稳定性、成本、权限控制,以及权重开放后的实际部署能力。
相关链接
