Kimi K3之后Qwen3.8来了:2.4T参数预览版实测,15分钟生成可玩3D游戏

Kimi K3发布后,国产旗舰模型的更新节奏仍未放缓。

阿里于2026年7月19日上线新一代旗舰基座模型 Qwen3.8-Max-Preview。模型总参数达到2.4T,即约2.4万亿参数,目前已经进入阿里云Token Plan、Qoder、QoderWork及Qoder系列Agent产品。正式版将在后续推出,阿里也计划开放模型权重。

阿里将Qwen3.8描述为当前能力较强的前沿模型之一,并称其整体表现仅次于Anthropic的Fable 5。需要说明的是,阿里目前尚未在公开技术报告中提供完整的基准配置和逐项成绩,因此网上流传的“击败所有Opus模型”等说法,现阶段仍应视为预览期数据或社交媒体截图,而不是已经完成独立验证的正式结论。

image.png

Qwen3.8-Max-Preview是什么?

Qwen3.8-Max-Preview是通义千问新一代旗舰基础模型的预览版本。

Qoder官方资料显示,模型拥有2.4T参数。相比上一代Qwen3.7-Max,Qwen3.8重点增强了以下能力:

代码工程与软件开发
专业办公与知识工作
全栈应用开发
Office办公工作流
数据分析
深度推理
复杂长程任务
多步骤Agent执行

Qoder将其描述为在软件工程、办公和深度推理方面表现领先的新一代基础模型,并表示其能力仍在持续迭代。

目前能够确认的核心参数并不多:

项目 当前公开信息
模型名称 Qwen3.8-Max-Preview
总参数规模 2.4T
产品状态 Preview预览版
重点能力 Coding、Cowork、深度推理、长程Agent
当前入口 Token Plan、Qoder、QoderWork等
正式版 计划后续推出
模型权重 阿里称将开放,尚未正式发布
架构与激活参数 尚未完整公布
开放许可证 尚未公布
本地部署要求 尚未公布

因此,目前不宜直接认定Qwen3.8采用某一种MoE结构,也不能推算单次推理会激活多少参数。相关信息需要等待正式模型卡或技术报告。

Qwen3.8目前可以在哪里使用?

Qwen3.8-Max-Preview已经覆盖Qoder的多种产品形态,包括:

Qoder Desktop
QoderWork
Qoder JetBrains插件
Qoder CLI
QoderWake
Qoder Cloud Agents
Qoder Mobile及Web App

开发者和知识工作者可以在模型选择器中切换至Qwen3.8-Max-Preview,测试代码工程、数据分析、文档处理和长时间Agent任务。

阿里云Token Plan个人版和团队版也已支持该模型。官方明确提示,Qwen3.8当前仍是预览版本,能力会在预览期持续更新;预览结束后,现有模型可能下线或被正式版本替换。

预览期调用价格大幅降低

为了扩大预览版测试规模,Qoder与阿里云Token Plan为Qwen3.8提供了限时折扣。

Qoder当前的Credits消耗倍率为:

使用时间 标准倍率 活动倍率
08:00—22:00 0.5x 0.05x
22:00—次日08:00 0.5x 0.01x

常规时间相当于1折,夜间低峰时段相当于0.2折。活动从2026年7月19日开始,结束时间暂未公布。

阿里云Token Plan也提供预览期Credits低至1折、夜间进一步折扣等权益。通过降低调用成本,更多用户可以运行持续时间较长、Token和工具调用量较大的Agent任务。

15分钟生成可玩的3D射击游戏

Qwen3.8上线后,社交平台很快出现了第一批软件开发实测。

一名开发者使用相同的3D射击游戏需求测试Qwen3.8和Fable 5。据其分享,Qwen3.8大约用15分钟生成了一个能够直接游玩的版本,基础移动、射击、难度和游戏机制已经可以运行;Fable 5则花费约50分钟完成同类任务。

这次测试呈现出的差异是:

Qwen3.8更快完成第一个可用版本
Fable 5耗时更长,但最终细节更精致
Qwen3.8更偏向先建立完整功能
Fable 5更愿意投入时间完善表现效果

这只是单个开发者、单次任务中的结果,并没有公开完整系统提示词、运行环境、Token消耗和全部修改过程,不能直接作为两款模型整体能力的排名依据。

不过,它展现了Qwen3.8当前较有价值的一项特点:先把产品做出来,再继续调整细节。

Agent模型为什么需要“快速出活”?

代码Agent的价值不只体现在最终代码有多复杂,也体现在它能否尽快建立一个可以运行、测试和修改的版本。

传统模型可能花费大量时间分析:

应该选择哪套框架
页面如何组织
游戏架构如何设计
是否需要增加额外功能
哪种实现方式更加完整

这些思考可能提高最终质量,但也可能导致模型迟迟没有可见结果。

更偏向执行的Agent则会先完成:

1.建立项目结构
2.实现最基础玩法
3.运行程序
4.找到明显错误
5.修复关键问题
6.输出第一版成果
7.再根据反馈优化

对于Vibe Coding、原型验证和早期产品开发来说,一个15分钟内可以操作的版本,往往比一个50分钟后才出现、但细节更精致的版本更容易进入下一轮迭代。

Minecraft风格体素游戏也能一次运行

另一名用户要求Qwen3.8-Max-Preview制作一个Minecraft风格的体素游戏。

其分享的初步结果显示,Qwen3.8生成了较干净的界面,并实现了可以直接操作的游戏内容。测试者将其总结为代码能力较强、UI相对整洁、输出可玩且第一版完成度较高。

这类任务通常要求模型同时处理:

3D场景和摄影机
体素地图
人物或视角控制
键盘及鼠标输入
碰撞关系
UI和状态显示
游戏循环
HTML、JavaScript和Three.js代码

它并不是单一函数生成,而是一个需要多个模块同时运行的小型软件项目。

Qwen3.8开始从代码生成走向产品交付

现有测试说明,Qwen3.8的目标并不只是生成代码片段,而是围绕用户最终需要的成果完成持续工作。

目前用户已经开始用它测试:

3D射击游戏
Minecraft风格体素游戏
产品营销落地页
交互式网页
数据分析
Office办公任务
多步骤代码工程
长程Agent工作流

Qoder官方也将全栈开发、数据分析和Office工作流列为Qwen3.8的主要提升方向。

这种产品定位更加接近“交付型Agent”:

用户告诉模型需要得到什么,模型自行决定需要建立哪些文件、调用什么工具、如何运行验证,以及何时交付第一个可用版本。

与Kimi K3对比:各有明显侧重

Qwen3.8发布前不久,月之暗面刚刚上线2.8T参数的Kimi K3。Qoder的模型列表已经同时提供Qwen3.8-Max-Preview和Kimi K3,方便开发者在同一产品环境中进行测试。

从目前公开案例看,两者呈现出不同特点:

对比方向 Qwen3.8-Max-Preview Kimi K3
总参数 2.4T 2.8T
当前状态 预览版 正式服务已上线
代码任务 强调快速形成可运行结果 强调长程工程与复杂交付
视觉设计 部分测试仍需提升 部分前端和视觉任务表现更强
3D内容 已出现多个可玩游戏案例 3D、视觉闭环和交互内容较突出
开放权重 计划开放 已公布完整权重发布计划
成熟度 持续迭代中的Preview 已进入多款正式产品

在你提供的另一项社交媒体案例中,有开发者让Qwen3.8和Kimi K3分别为一台售价1万美元的“断头台式面包切割机”制作产品落地页。

该体验反馈认为,Kimi K3在整体文字处理和视觉构图方面优势较明显,但Qwen3.8成功生成了具有说服力的产品3D模型。由于该测试的原始运行记录和完整页面尚未公开,它更适合作为模型风格差异的体验参考。

Qwen3.8当前也存在明显问题

Preview版本提前进入真实用户场景,可以快速发现问题,但也意味着其表现尚未完全稳定。

部分社区用户报告,Qwen3.8在长任务中可能出现:

反复尝试相同方案
工具调用进入循环
过度分析简单问题
执行方向逐渐偏移
遇到安全任务时绕路
最终没有完成原始目标

LocalLLaMA社区中已有用户认为,当前预览检查点仍需要更多后训练,尤其需要改善循环执行和Agent边界。

这些问题与阿里云对Preview版本的提示一致:模型能力仍会持续升级,最终正式版可能替换当前预览版本。

“击败所有Opus”目前不能视为官方结论

社交平台流传的Qwen3.8测试图表显示,其部分综合成绩超过多款Opus模型,仅次于Fable 5。

阿里也公开表示,Qwen3.8是当前较强的模型之一,整体水平仅次于Fable 5。

但目前仍缺少以下信息:

完整评测名称
测试题目和数据集
模型具体版本
系统提示词
推理强度
工具和联网权限
测试次数
置信区间
第三方独立复现

因此,SEO文章可以写“阿里称Qwen3.8仅次于Fable 5”,但不宜直接写成“权威测试确认Qwen3.8击败所有Opus”。

更稳妥的表述是:

社交媒体流传的早期成绩显示,Qwen3.8具备接近顶级闭源模型的潜力,但仍需等待正式技术报告和第三方评测。

2.4T开放权重意味着什么?

阿里计划在正式版推出后开放Qwen3.8模型权重。

如果权重按计划开放,开发者可以进一步研究:

模型具体架构
混合专家设计
激活参数规模
本地与集群推理效率
量化效果
行业微调
私有化部署
推理框架适配
Agent后训练

不过,2.4T总参数也意味着完整模型可能需要极高的存储、显存和集群通信能力。

即使模型权重开放,普通个人电脑也很难完整运行。大多数开发者可能仍会通过阿里云、Qoder或第三方推理服务使用模型。

正式发布后需要重点关注:

权重是否完整开放
基础版和指令版是否同时发布
具体许可证
商业使用限制
激活参数
上下文窗口
是否提供量化权重
vLLM和SGLang支持
推理硬件要求

Qwen3.8与Kimi K3释放了什么信号?

Kimi K3和Qwen3.8在数天内连续出现,说明国产旗舰模型已经从单纯比较知识和数学基准,转向真实Agent任务竞争。

新的重点包括:

能否持续运行数十分钟或数小时
能否调用终端和浏览器
能否制作可运行的软件
能否理解图片和视觉反馈
能否在长任务中保持目标
能否用更少时间交付第一版
能否控制Token和算力成本
是否能够开放模型权重

对于用户来说,模型是否能在15分钟内做出一个可玩的游戏,往往比某项抽象基准高出几分更加直观。

Qwen3.8适合哪些用户提前体验?

独立开发者

可以用来快速制作网站、小游戏、插件和产品原型。

Vibe Coding用户

通过自然语言描述功能,测试模型能否直接生成可以运行的项目。

前端和全栈开发者

适合测试跨文件修改、页面生成、接口开发和项目调试。

产品经理与设计师

可以将产品想法快速转换为交互原型,再根据结果补充需求。

数据与办公用户

通过QoderWork测试表格分析、报告生成和Office工作流。

Agent开发者

重点评估模型在工具调用、错误恢复、上下文保持和任务完成率方面的表现。

使用Preview模型需要注意什么?

不要直接替换生产环境模型

预览版可能频繁更新,同一个提示词在不同日期可能得到不同结果。

保存测试条件

应记录模型版本、运行时间、提示词、工具环境和最终成果,方便后续与正式版比较。

检查代码和依赖

可运行不代表代码安全、结构合理或能够长期维护。

限制Agent权限

删除文件、部署生产环境和操作账号等行为应保留人工确认。

不要只看单次成功案例

应使用相同任务运行多次,并记录失败率、Token成本和人工修改时间。

总结

Qwen3.8-Max-Preview已经于2026年7月19日进入阿里云Token Plan、Qoder和QoderWork,模型总参数达到2.4T,重点提升软件工程、专业办公、深度推理和复杂长程Agent能力。

阿里称Qwen3.8属于当前较强的前沿模型,整体能力仅次于Fable 5,并计划在正式版推出后开放模型权重。完整基准、模型架构、许可证和本地部署要求仍待公布。

首批社交媒体实测显示,Qwen3.8能够较快生成可玩的3D射击游戏和Minecraft风格体素游戏。在一项个例中,模型约15分钟完成了第一版,而Fable 5完成同类任务约用了50分钟。

Qwen3.8当前的优势并不一定是所有细节都比Fable 5或Kimi K3更精致,而是能够较快将需求转换为可运行成果。

这可能正是Agent模型最实际的价值:

不是长时间展示自己会思考,而是先把能用的东西做出来。

不过,Qwen3.8仍处于Preview阶段,部分用户已经遇到工具调用循环、任务绕路和视觉细节不足等问题。它能否在正式版中稳定进入全球第一梯队,还需等待开放权重、技术报告和第三方测评。

相关链接

© 版权声明

相关文章

暂无评论

none
暂无评论...