Qwen3.8-Max正式上线:2.4万亿参数聚焦真实办公与长程任务,下周开放权重

2026年8月3日,阿里正式发布新一代旗舰模型 Qwen3.8-Max

image.png

这是目前千问系列规模最大、综合能力最强的旗舰模型,采用2.4万亿总参数、950亿激活参数的稀疏混合专家架构,支持100万Token上下文,以及文本、图片和视频输入。模型重点提升编程、真实办公、专业研究、视觉理解和长程任务执行能力。

Qwen3.8-Max已经通过以下渠道开放:

阿里云百炼Model Studio
QwenCloud
Qoder
千问办公QwenWork

开发者可以使用qwen3.8-max模型ID,通过OpenAI兼容、Anthropic兼容或DashScope接口调用。

阿里还宣布,将在下一周发布Qwen3.8-Max模型权重。这将是千问团队首次开放Max级旗舰模型的权重。按照8月3日公告时间计算,开放时间预计位于 2026年8月10日至16日,但官方尚未公布具体日期、许可证和下载地址。

Qwen3.8-Max是什么?

Qwen3.8-Max是基于Qwen3.5架构继续扩展的新一代多模态旗舰基础模型。

它并不只面向聊天问答,而是围绕能够持续数小时甚至数天工作的AI Agent进行训练,让模型可以自主规划、调用工具、读取文件、修改代码、检查结果,并根据执行反馈继续迭代。

阿里对Qwen3.8-Max的官方定位主要包括:

自主编程
真实办公
专业研究
长程任务
多模态理解
视觉智能体
端到端成果交付

阿里云模型文档称,Qwen3.8-Max可以承担法律、金融、设计等数百种专业任务,并尝试在一次对话中完成从需求理解到生产级成果交付的完整流程。

Qwen3.8-Max核心规格

项目 Qwen3.8-Max
模型架构 稀疏混合专家模型,MoE
总参数量 2.4T,约2.4万亿
激活参数量 95B,约950亿
上下文窗口 1,000,000 Token
最大输入长度 991,808 Token
最大输出长度 131,072 Token
最大思维链长度 262,144 Token
输入模态 文本、图片、视频
输出模态 文本
Function Calling 支持
结构化输出 支持
上下文缓存 支持
推理强度 low、medium、xhigh
API模型ID qwen3.8-max
权重状态 计划下周开放

以上规格来自阿里云Qwen3.8-Max模型文档和阿里官方发布信息。

2.4万亿参数并非全部同时参与推理

Qwen3.8-Max采用稀疏MoE架构。

模型总参数达到2.4万亿,但处理每个Token时只激活约950亿参数,约占全部参数的4%。模型会根据当前输入,将Token路由给更适合处理该内容的部分专家。

这种设计的主要目标是同时获得:

更大的知识和能力容量
更可控的单次计算量
更低的响应延迟
更适合长任务的推理成本
更高的服务并发能力

但“950亿激活参数”并不意味着开放权重后可以把它当作普通95B模型部署。完整权重仍然包含2.4万亿参数,存储、显存和跨卡通信门槛预计都非常高。这是根据其参数规模作出的工程判断,具体硬件要求仍需等待官方部署文档。

混合注意力兼顾长上下文和推理效率

Qwen3.8-Max在稀疏MoE之外,还采用混合注意力机制。

阿里称,这套架构用于平衡超大参数规模、长上下文理解和实际推理效率,使模型在处理大型代码仓库、长篇文档、图片和视频内容时,不必让所有Token之间都执行同等规模的完整计算。

Qwen3.8-Max支持100万Token上下文,大致可以容纳:

数百页专业文档
大型软件代码仓库
多份合同或行业报告
较长的视频内容描述
长时间Agent执行记录
大量工具调用结果

官方表示,模型可以理解百页文档、完整电视剧集或长达100小时的直播内容,并将其整理为可搜索、可交互的知识结构。

不过,100万Token窗口不等于模型能够同等准确地使用其中每一条信息。实际应用仍然需要文件检索、上下文压缩、任务分段和历史摘要,避免无关资料占用窗口。

从Preview升级为正式版

Qwen3.8-Max-Preview于2026年7月19日率先进入Token Plan、Qoder和QoderWork,主要用于收集真实代码、办公和长程任务反馈。

预览版已经重点展示:

全栈应用开发
数据分析
Office工作流
3D游戏生成
网页及视觉内容
长程Agent执行

Qoder曾将预览版描述为相比Qwen3.7-Max在编程、专业生产力和复杂长任务中取得全面提升。

8月3日上线的Qwen3.8-Max正式版已经替代预览版成为当前主力模型,并在Qoder全平台和阿里云百炼中正式提供。

“真实办公”指的是什么?

过去的大模型办公能力,通常集中在总结文章、生成邮件和制作PPT文案。

Qwen3.8-Max所强调的“真实办公”,更接近读取工作资料、调用工具并直接完成最终成果。

官方展示的任务覆盖:

法律文档审查
金融研究
数据分析
体育数据分析
产品及应用设计
建筑3D建模
康复进度可视化
专业报告制作
客服对话意图分析
餐饮产品概念设计

例如,用户可以将合同、业务数据、邮件和会议记录交给模型,再要求它:

1.找出风险条款
2.汇总不同部门意见
3.对比历史版本
4.制作修改建议
5.生成汇报文档
6.整理后续执行任务

模型需要在同一个任务中保持目标、调用不同工具,并交付可以继续编辑和审核的成果。

这与只在聊天框中返回一段建议存在明显区别。

支持图片、视频和文本统一理解

Qwen3.8-Max原生支持:

文本输入
图片输入
视频输入
文本输出

同时支持Function Calling、结构化输出、前缀续写和上下文缓存。

视觉能力可以参与Agent执行的不同阶段:

观察网页和软件界面
理解UI设计稿
检查生成页面截图
分析图表和报告
读取视频内容
根据视觉反馈继续修改
将平面设计转换成可运行应用

阿里称,Qwen3.8-Max可以从一张UI截图重建完整前端项目,将二维户型图转换为三维室内可视化,也可以根据自然语言生成交互式游戏。

从个人视频素材生成完整Vlog

官方列出的多模态任务还包括读取个人原始视频素材,并完成专业Vlog剪辑。

在这类任务中,模型需要理解:

视频中出现了哪些人物
哪些片段更有价值
内容应如何排序
哪些画面适合作为开头
字幕和旁白应该放在哪里
节奏如何配合内容
最终应该输出什么结构

Qwen3.8-Max本身输出的是文本,因此实际视频剪辑仍需通过Agent调用剪辑工具、代码或外部服务完成,而不是模型直接输出最终视频文件。

16天自主完成软件工程项目

阿里在Qwen3.8-Max正式发布时展示了一项长程代码实验。

模型从零开始构建一个名为 oh-my-cli的自进化代码Agent框架,并连续执行了16天。任务过程中,模型持续读取用户反馈、社区实践和自测数据,再反复完成代码生成、测试、预览和日志分析。

最终生成的oh-my-cli已经完整开放在GitHub,项目采用TypeScript和Node.js构建,支持文件、Shell、会话恢复、上下文压缩、任务状态和安全审批等能力。

项目地址:

https://github.com/qwen-code-dev-bot/oh-my-cli

这项实验说明,Qwen3.8-Max可以在具有明确环境和治理规则的情况下,持续执行远超普通聊天会话长度的软件工程任务。

不过,16天自主运行属于阿里内部实验,并非第三方统一测试。实际效果仍取决于:

Agent框架
运行环境
权限设置
自动测试
人工监督方式
失败恢复机制
上下文压缩策略

不能仅根据一次厂商案例,认定模型可以在所有代码仓库中连续运行16天且不需要人工干预。

什么是“闭环迭代”?

普通代码模型的工作流程通常是:

接收需求
↓
生成代码
↓
任务结束

长程Agent更完整的流程是:

理解目标
↓
制定计划
↓
编写代码
↓
运行程序
↓
观察输出
↓
读取错误
↓
修复问题
↓
重新测试
↓
继续完成后续任务

Qwen3.8-Max强化的不是单次代码输出,而是模型能否根据实际运行结果重新判断下一步行动。

这种能力对于复杂任务非常重要,因为真实工作很少可以一次完成。代码会报错,数据会缺失,网页效果可能不符合要求,工具也可能执行失败。

RecreationBench测试黑盒应用复刻

阿里还推出了RecreationBench,用于测试模型在完全黑盒环境中重建应用的能力。

测试时,模型无法访问互联网,也看不到目标应用的源代码,只能通过实际操作、观察界面和获取反馈,重新建立一个功能相近的应用。

这类任务需要模型同时完成:

理解页面结构
推测产品功能
操作目标应用
记录交互反馈
设计自己的实现方案
编写前端和后端代码
启动项目
比较运行结果
持续修正差异

它更接近真实产品开发中的“观察—实现—验证”流程,而不是根据一张静态截图生成HTML。

Arena文本榜排名第五

根据Arena.ai在2026年8月1日的榜单快照,Qwen3.8-Max在Text Arena综合榜中获得1496±10分,排名第五,是当时得分最高的中国模型。

排名在它之前的四款模型均来自Anthropic。Qwen3.8-Max当前仍被标记为Preliminary,说明分数和排名可能随着新增盲测投票继续变化。

排名 模型 得分
1 Claude Fable 5 1509±6
2 Claude Opus 4.6 Thinking 1505±4
3 Claude Opus 4.7 Thinking 1502±4
4 Claude Opus 4.6 1497±4
5 Qwen3.8-Max 1496±10

Qwen3.8-Max与第四名只相差1分,但其置信区间较宽,因此不能根据单一分数断言模型已经稳定超过或追平某款Claude模型。

Vision Arena排名第二

在Vision Arena中,Qwen3.8-Max以1305±9分排名第二,仅次于Claude Fable 5的1318±9分。

这项成绩反映了模型在以下任务中的用户偏好:

图片理解
图表分析
文档视觉解析
UI界面理解
多模态问答
视觉推理
图片与文字联合任务

但Vision Arena是动态真人盲测,排名不能代替OCR准确率、视频理解、空间推理或企业文档测试等具体能力评估。

前端代码榜排名第四

在Arena Code WebDev综合榜中,Qwen3.8-Max以约1668分排名第四,仅落后于Claude Opus 5 Max、Kimi K3 Max和Claude Opus 5 High,领先GPT-5.6 Sol xHigh、GLM-5.2 Max和DeepSeek-V4-Flash。

该榜单重点衡量:

网页需求理解
前端代码生成
页面视觉效果
多步骤工具调用
运行结果检查
交互完整性
Agent式前端开发

需要注意,Qwen3.8-Max在该榜中的投票和置信区间仍处于初步阶段,后续名次可能变化。

参数规模仅次于Kimi K3

Qwen3.8-Max总参数为2.4万亿,略小于Kimi K3的2.8万亿。

两款模型都采用MoE架构、支持原生视觉理解和100万Token上下文,但它们的激活参数分别约为:

模型 总参数 激活参数
Kimi K3 2.8T 104B
Qwen3.8-Max 2.4T 95B

参数数量并不能直接决定模型能力。训练数据、模型架构、后训练、Agent框架和工具环境都会影响最终表现。

从当前公开榜单看:

Kimi K3在前端代码榜仍更高
Qwen3.8-Max在文本综合榜排名更高
Qwen3.8-Max在Vision Arena排名第二
两者都已进入全球顶级模型讨论范围

API已经正式开放

Qwen3.8-Max已经上线阿里云百炼,模型ID为:

qwen3.8-max

官方支持三种主要接口形式:

OpenAI兼容接口
Anthropic兼容接口
DashScope接口

服务已经覆盖北京、新加坡、东京、法兰克福和美国弗吉尼亚等地域。

一个OpenAI兼容的基础调用示例:

from openai import OpenAI

client = OpenAI(
    api_key="<你的阿里云百炼API Key>",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "分析这份项目资料,并制定可执行的交付计划。",
        }
    ],
)

print(response.choices[0].message.content)

具体Base URL需要根据所使用的阿里云地域和Workspace配置调整。

支持三档推理强度

Qwen3.8-Max支持通过reasoning_effort控制思考深度:

low
medium
xhigh

默认档位为xhigh。官方映射的思考预算分别约为4096、16384和262144 Token。

适合使用low的任务:

内容改写
信息提取
简单分类
普通邮件
基础问答

适合使用medium的任务:

文档分析
数据总结
常规代码任务
研究报告初稿

适合使用xhigh的任务:

长程Agent
复杂软件工程
多约束规划
专业研究
高难度推理

推理档位越高,通常意味着等待时间和思考Token消耗越多,不应对所有任务默认使用最高档。

多轮Agent需要完整回传思考历史

阿里云文档显示,Qwen3.8-Max默认开启preserve_thinking

在多轮对话中,客户端需要完整回传历史消息中的reasoning_content。这些历史思考内容也会计入输入Token并产生费用。

这对Agent开发者提出了几个要求:

正确保存历史消息
保留工具调用结果
回传完整思考内容
控制上下文增长速度
及时压缩过长会话
避免重复执行已经完成的任务

如果客户端只保存最终回答,而丢失历史推理和工具状态,后续长任务表现可能受到影响。

Qwen3.8-Max的API价格

阿里云百炼中国区原价为:

计费项目 价格
输入 12元/百万Token
输出 36元/百万Token
输入缓存命中 1.5元/百万Token
显式缓存创建 15元/百万Token
显式缓存命中 1元/百万Token

QwenCloud国际价格为:

计费项目 价格
输入 2美元/百万Token
输出 6美元/百万Token

对于长程Agent,缓存能力非常重要。

大型代码仓库、系统规则和项目文档会在每一轮请求中重复出现。如果能够命中上下文缓存,可以明显降低重复输入成本。

当前限流能力

阿里云百炼在北京、东京、法兰克福和弗吉尼亚区域提供的默认限流为:

30,000 RPM
5,000,000 TPM

新加坡国际区域则为:

15,000 RPM
2,000,000 TPM

这些额度更适合企业级和高并发Agent应用,但具体账户可能受到开通状态、套餐或风控规则影响,应以控制台显示为准。

可以在Qoder中直接使用

Qwen3.8-Max已于8月3日正式上线Qoder,覆盖:

Qoder Desktop
Qoder JetBrains插件
Qoder CLI
QoderWake
Qoder Cloud Agents
Qoder移动端和网页端

开发者更新到最新版本后,可以在模型选择器中直接切换至Qwen3.8-Max。

Qoder还在正式发布期间提供模型调用奖励和夜间Credits折扣。活动时间、可领取次数和适用套餐可能调整,应以Qoder活动页面为准。

可以在千问办公中使用

Qwen3.8-Max也已接入千问办公QwenWork。

千问办公围绕文档、Excel、PPT、网页、数据分析和企业工作流提供任务交付能力,Qwen3.8-Max可以作为底层模型处理复杂办公和多步骤任务。

这使模型能够进入更完整的办公流程,例如:

读取多份企业文档
分析经营数据
生成汇报PPT
制作独立网页
审阅合同
整理项目计划
调用外部数据源
根据反馈继续修改成果

权重开放后意味着什么?

官方表示,Qwen3.8-Max将成为首个开放权重的Qwen Max级模型。

权重开放后,开发者和企业理论上可以进行:

私有化部署
行业微调
推理框架适配
量化和压缩
Agent专项后训练
企业内部数据适配
国产计算平台部署
安全和行为研究

但目前尚未公布:

权重具体发布日期
开放许可证
权重格式
是否包含基础模型
是否提供量化版本
最低硬件要求
推荐推理框架
单机或集群部署方案

因此,现在只能确认“计划开放权重”,不能写成权重已经可以下载。

普通个人用户能够本地运行吗?

从2.4万亿总参数和950亿激活参数判断,即使模型提供低精度或量化权重,完整部署仍需要大型GPU集群。

开放权重的主要受益者可能包括:

云计算平台
大型企业AI团队
高校与科研机构
模型推理服务商
量化和压缩团队
国产硬件厂商
Agent训练平台

普通开发者更现实的方式仍然是使用QwenCloud、阿里云百炼、Qoder或千问办公,而不是下载完整权重在个人电脑上运行。

“端到端交付”不能理解为完全无人审核

Qwen3.8-Max强调从任务输入到最终成果的端到端交付。

但生产级结果仍应经过人工检查,特别是:

法律合同
金融研究
财务数据
对外发布内容
生产代码
用户隐私
企业决策
医疗相关资料

长程任务运行时间越长,错误也越可能在后续步骤中被放大。

企业Agent应该设置:

工具权限边界
文件修改记录
高风险操作确认
任务预算
超时和重试限制
版本控制
自动测试
最终人工验收

Qwen3.8-Max适合哪些用户?

软件开发团队

适合大型仓库分析、跨文件修改、测试、调试和长时间代码Agent任务。

企业办公团队

可用于合同、报告、数据、PPT及复杂业务资料处理。

产品经理和设计师

可以从需求、设计稿或页面截图出发,生成产品原型和交互应用。

金融及研究人员

适合阅读大量资料、整理证据和建立研究框架,但投资结论仍需人工审核。

Agent开发者

可以测试长程规划、工具调用、视觉反馈和闭环执行能力。

云服务与模型平台

权重开放后,可研究托管推理、行业模型和企业私有化部署。

当前需要注意哪些限制?

Arena排名仍处于初步阶段

Qwen3.8-Max在多个Arena榜中标记为Preliminary,新增投票可能改变排名。

16天项目属于官方案例

该项目能够公开检查,但整体运行条件和管理方式仍由阿里团队设置。

输出仍以文本为主

模型可以理解图片和视频,但不会直接输出图片或视频文件,需要通过工具完成多媒体生成与编辑。

长上下文成本较高

100万Token窗口适合大型任务,但一次性输入大量资料会增加费用和延迟。

完整权重尚未发布

当前仍不能确定许可证、量化方式和部署成本。

2.4万亿参数不等于综合能力一定更强

模型实际能力取决于架构、数据、后训练、Agent框架和任务类型,而不是只看总参数。

总结

Qwen3.8-Max于2026年8月3日正式上线。

模型采用2.4万亿总参数、950亿激活参数的稀疏MoE架构,支持100万Token上下文,以及文本、图片和视频输入。它重点提升了编程、真实办公、专业研究、视觉理解和复杂长程任务能力。

在Arena.ai的8月1日榜单中,Qwen3.8-Max分别取得:

Text Arena第5名
Vision Arena第2名
Code WebDev第4名

当前排名仍处于初步阶段,会随盲测投票变化。

在长程代码实验中,Qwen3.8-Max曾连续16天运行,自主构建并持续维护oh-my-cli代码Agent项目。阿里还通过RecreationBench测试模型在没有源码和互联网的情况下,通过操作和视觉反馈重建应用。

API目前已经上线阿里云百炼和QwenCloud,支持OpenAI、Anthropic和DashScope接口,国内价格为每百万Token输入12元、输出36元。

官方计划在下一周开放Qwen3.8-Max模型权重。这是千问团队首次计划开放Max级旗舰模型,但具体日期、许可证、量化版本和部署要求仍未公布。

Qwen3.8-Max展现出的方向已经很明确:

大模型正在从完成一次回答,走向在真实环境中持续工作、检查结果并交付完整成果。

真正决定它能否进入企业生产环境的,不只是2.4万亿参数和榜单成绩,而是长任务成功率、工具调用稳定性、成本、权限控制,以及权重开放后的实际部署能力。

相关链接

© 版权声明

相关文章

暂无评论

none
暂无评论...