Kimi K3正式发布:2.8万亿参数、100万Token上下文,完整模型权重即将开放

2026年7月17日,月之暗面正式推出新一代旗舰模型 Kimi K3

Kimi K3总参数规模达到 2.8万亿,基于Kimi混合线性注意力机制 **Kimi Delta AttentionKDA)**和注意力残差 **Attention Residuals(AttnRes)**构建,原生支持图片与视频理解,并将上下文窗口扩展至 100万Token

月之暗面将Kimi K3定位为面向长程编程、端到端知识工作、科学研究和复杂推理的旗舰模型。Kimi API官方文档已经将其列为当前优先推荐模型,并确认其支持视觉输入、工具调用、结构化输出和自动上下文缓存等能力。

Kimi K3目前已经在Kimi网页端、手机App、Kimi Work、Kimi Code和Kimi API中上线。发布材料显示,完整模型权重计划在 2026年7月27日前发布,架构、训练和评测的更多细节则将随技术报告公布。

image.png

Kimi K3是什么?

Kimi K3是月之暗面推出的原生多模态、长上下文和智能体模型。

它不仅可以完成文字问答与内容生成,还能够理解图片、视频、软件界面和实时运行结果,并结合终端、浏览器、代码执行器及其他工具持续完成多步骤任务。

Kimi K3主要面向以下场景:

大型代码库分析与修改
长时间软件工程任务
前端、游戏和CAD开发
科学计算与科研编程
金融及行业研究
文档、表格和演示文稿制作
数据可视化与交互式看板
图片和视频理解
多步骤工具调用
长上下文知识问答

Kimi官方文档显示,K3支持文本、图片和视频输入,并可用于Codex、Claude Code、Cline、RooCode等编程智能体环境。

2.8万亿参数意味着什么?

Kimi K3总参数规模达到2.8万亿,约为Kimi K2一万亿参数规模的2.8倍。

不过,参数总量并不等于每次推理都需要调用全部参数。Kimi K3采用混合专家模型架构,在大量专家模块中,根据当前输入选择少量专家参与计算。

根据发布材料,Kimi K3采用Stable LatentMoE框架,共设置 896个专家,每次推理实际激活其中 16个专家

这种高稀疏度设计的目标,是在扩大模型知识容量和任务能力的同时,控制单次推理的实际计算量。

Kimi方面表示,通过模型结构、训练方法和数据配方的共同调整,K3相较K2的整体扩展效率提高约 2.5倍。这意味着相同训练资源可以更有效地转化为模型能力。

Kimi Delta Attention提升长上下文效率

Kimi K3的核心架构之一是Kimi Delta Attention,简称KDA。

传统全注意力机制在处理长文本时,需要计算大量Token之间的关系。随着上下文长度增加,显存占用和计算量也会快速上升。

KDA是一种混合线性注意力机制,使用有限状态记忆保存和更新长序列中的信息,降低长上下文处理成本。

月之暗面此前已经通过Kimi Linear项目公开KDA相关研究。官方介绍显示,KDA在长文本、短文本和强化学习扩展等任务中均表现出较好的效率和性能。

在Kimi K3中,KDA成为支撑100万Token上下文窗口的重要基础。

100万Token上下文可以用于处理:

大型代码仓库
多份研究报告
长篇书籍和论文
大量合同及业务文档
长时间智能体任务记录
多轮工具调用结果
视频和多模态资料
跨文件知识库

官方API文档还显示,Kimi K3会自动启用上下文缓存。只要用户保持较长的输入前缀不变,后续请求会自动尝试命中缓存,不需要单独创建缓存ID或设置有效期。

Attention Residuals改善深层模型信息传递

Kimi K3采用的另一项核心结构是Attention Residuals,也就是注意力残差。

传统Transformer模型通常将每一层的输出逐层累积。随着模型深度增加,早期层的重要信息可能被不断混合或削弱。

Attention Residuals并不是简单地把上一层结果加入下一层,而是让模型根据当前任务,从不同深度的历史表示中选择需要的信息。

这种设计类似为深层模型提供一个可检索的内部信息通道,使信息能够在更多网络层之间稳定传递。

KDA主要解决长序列中的信息流动效率,Attention Residuals则主要改善超深模型中的信息传递。两者共同构成Kimi K3扩展至2.8万亿参数的重要架构基础。Kimi官方API文档已经确认K3同时采用KDA和Attention Residuals。

896个专家,每次激活16个

Kimi K3进一步扩大了混合专家模型的稀疏度。

模型共包含896个专家,但一次前向计算只激活其中16个。不同专家可以在训练过程中学习不同类型的知识和处理模式,例如代码、数学、视觉、语言、科学计算或工具使用。

当用户提出任务时,路由系统会根据当前Token和上下文,将计算分配给更适合的专家。

为了改善大规模专家路由中的负载不均问题,Kimi K3还引入了Quantile Balancing,通过路由分数的分位数进行专家分配,减少对手工平衡规则和敏感超参数的依赖。

模型同时采用Per-Head Muon、Sigmoid Tanh Unit和Gated MLA等设计,用于优化注意力头训练、激活控制和信息选择。

完整技术细节仍需等待Kimi K3技术报告正式公布。

原生支持视觉理解

Kimi K3不是先训练纯文本模型,再通过独立视觉模块进行简单拼接,而是面向文字、图片、视频和软件界面建立统一的多模态能力。

官方API文档确认,Kimi K3支持文本、图片与视频输入。开发者可以通过Base64或文件上传方式提交视觉资料,再让模型分析图片、概括视频或结合视觉结果调用工具。

原生视觉能力让Kimi K3可以处理以下任务:

根据设计截图编写前端页面
观察程序运行结果并继续修改代码
分析游戏画面和交互问题
理解CAD图纸和三维模型
阅读图表、流程图和科研图片
从视频中提取内容和动作信息
根据浏览器页面反馈调整操作
检查可视化结果是否符合要求

在长程开发任务中,模型可以在“编写代码—运行程序—查看截图—发现问题—继续修改”的流程中持续迭代,形成视觉反馈闭环。

Kimi K3强化长程编程能力

长程编程是Kimi K3重点优化的能力之一。

普通代码模型通常适合完成函数编写、代码补全和简单Bug修复,但大型工程任务可能持续数小时,并涉及代码阅读、环境配置、终端操作、测试、性能分析和多轮修复。

Kimi K3强调在较少人工监督的情况下持续推进任务,包括:

1.理解用户目标
2.阅读大型代码仓库
3.制定执行计划
4.修改多个文件
5.调用终端和开发工具
6.运行测试或性能评测
7.根据结果继续调整
8.检查最终交付内容

官方API文档也将复杂编码、跨文件理解和多步骤智能体任务列为Kimi K3的主要使用方向。

24小时GPU内核优化测试

为了测试Kimi K3的长期工程能力,月之暗面构建了一个GPU内核优化竞技场。

不同模型在独立GPU沙箱中处理相同任务、测试框架和生产负载,并可以在最长24小时内反复分析代码、重写内核和运行性能测试。

测试任务覆盖:

NVIDIA H200上的Attention Residuals内核
KDA线性注意力内核
从零实现512头维度MLA内核
国产GPU上的KDA任务

这类任务不只是要求模型生成一段能够运行的代码,还需要理解GPU架构、分析性能瓶颈,并根据实际跑分持续调整实现。

根据Kimi发布材料,K3在最大思考强度下表现接近部分顶级闭源模型,并领先多款参评模型。不过,完整测试方法、运行日志和结果表仍需等待技术报告披露。

从零开发MiniTriton编译器

Kimi团队还测试了K3能否从零构建一个GPU编程系统,而不是只优化已有内核。

在该实验中,Kimi K3开发了名为 MiniTriton 的轻量级GPU编译器。

MiniTriton直接基于MLIR定义自己的中间表示,没有依赖Triton IR,并实现了以下完整流程:

GPU编程抽象
中间表示设计
编译优化Pass
PTX代码生成
FP32和FP64计算
算子编译和执行
真实训练任务接入

在Roofline测试中,MiniTriton在当前支持的算子上,性能接近Triton和torch.compile

团队还使用TensorLite训练nanoGPT,并观察到正常收敛,说明模型生成的不只是几个独立内核,而是一套能够接入真实训练任务的编译器流程。

目前MiniTriton的TF32和BF16支持仍在开发中,其早期Tensor Core实现也不能直接替代经过长期优化的Triton。

从视觉反馈生成3D作品

Kimi K3将编程、视觉理解和三维推理结合,可根据文字、图片和视频制作可运行的交互式作品。

官方展示案例包括:

3D模拟长征十号火箭发射与回收
3D开放世界游戏
3D GBA模拟器
黑洞“卡冈图雅”视觉效果复刻
可交互科学可视化
游戏及实时三维场景

在这些任务中,Kimi K3可以运行代码、查看实时截图,再根据画面中的错误或视觉差异继续修改。

黑洞可视化案例已经提供在线网页,用户可以直接查看交互效果:

查看Kimi K3黑洞可视化作品

连续48小时完成芯片设计验证

Kimi K3还完成了一项芯片设计概念验证。

在连续48小时的自主智能体运行中,K3使用开源EDA工具和Nangate 45nm工艺库,为基于自身模型架构的nano模型设计专用芯片。

发布材料显示,该芯片包含:

约4平方毫米芯片面积
146万个标准单元
0.277MB SRAM
带融合反量化的INT4 MAC阵列
100MHz工作频率
超过每秒8700个Token的仿真解码吞吐

模型需要完成芯片结构设计、逻辑实现、优化、时序分析和验证等步骤。

这项案例主要用于展示Kimi K3持续执行复杂工程任务的能力,并不代表该芯片已经进入实际流片或商业化生产阶段。

科研编程连接论文与可执行代码

Kimi K3还被用于计算天体物理研究。

在复现I-Love-Q普适关系的案例中,K3在约两小时内完成了以下工作:

阅读和交叉验证20多篇论文
实现完整数值计算流程
评估300多种状态方程
检查已发表公式的一致性
生成3000多行Python代码
制作交互式HTML数据仪表盘

传统科研编程任务通常要求研究人员同时理解论文、数学公式、数值算法和代码实现。

Kimi K3试图将文献检索、公式核对、代码编写、数据计算和结果可视化连接为一个连续流程。

不过,AI生成的科研结果仍需要专业人员复核,尤其是公式、实验条件、数值稳定性和结论解释。

Kimi Work上线小组件和看板

随着Kimi K3发布,Kimi Work还增加了 **小组件(Widgets)**和 **看板(Dashboard)**功能。

小组件可以在对话中生成交互式模块,并连接本地数据或外部插件。例如:

股票及行业数据组件
项目进度组件
销售数据图表
实验结果展示
任务状态面板
新闻及市场监控
科研数据可视化

看板则可以将多个小组件汇总到一个长期保留的页面中,并围绕某个项目、主题或目标进行组织。

相比一次性生成报告,这种方式可以让研究结果、数据和任务状态持续更新。

处理大规模行业研究

Kimi发布材料还展示了一份覆盖推理芯片行业42年历史的研究报告。

该任务经过120多轮递归改进,过程中包括:

2800多次网页搜索与抓取
1100多次终端数据拉取
87份企业季报
99份原始PDF
超过11000页资料
定制图表与动画
交互式视觉叙事

用户可以查看完整交互式报告:

查看Kimi K3推理芯片行业研究

其他展示案例还包括可控核聚变产业研究,以及对391个引力波事件的GWTC-5分析。

这些任务体现了Kimi K3在资料搜索、PDF阅读、数据处理、多智能体协作和可视化输出之间的连接能力。

支持视频剪辑和动态图形制作

因为Kimi K3原生支持文字、图片和视频理解,它还可以用于动画和视频剪辑任务。

发布材料展示的案例包括:

制作模型架构动态图形讲解视频
从56段原始素材中选择可用片段
按照动作完成匹配剪辑
进行逐帧卡点
处理音频
根据反馈进行多轮修改

在实际使用中,AI可以承担素材整理、粗剪、节奏匹配和初步视觉设计,但品牌表达、版权核对和最终审美判断仍需创作者完成。

Kimi K3采用量化感知训练

Kimi K3从监督微调阶段开始采用量化感知训练。

根据发布材料,模型使用:

MXFP4权重
MXFP8激活
完全均衡的专家并行训练
静态训练形状
关键路径避免主机同步

这些设计主要用于降低超大规模模型的部署成本,并适配更广泛的计算硬件。

Kimi建议在由64个或更多加速器组成的Supernode配置上部署K3,以获得更大的高带宽通信域。

由于2.8万亿参数模型对显存、存储和通信带宽要求很高,普通个人用户很难在消费级设备上完整部署。开放权重的主要使用者预计仍会是云计算平台、模型服务商、大型企业和研究机构。

Kimi K3如何使用?

Kimi K3目前已经进入多个官方产品入口。

Kimi网页端和手机App

用户可以访问Kimi官网,或将Kimi手机App升级至最新版本。

Kimi App支持iOS、Android和鸿蒙系统。

Kimi Work桌面客户端

知识工作用户可以下载Kimi Work桌面客户端。

发布材料显示,使用Kimi K3需要将Kimi Work升级至 3.1.0及以上版本,目前支持Windows和Apple芯片Mac电脑。

Kimi Code

开发者可以在电脑终端运行Kimi Code,并在支持的客户端中选择K3模型。

Kimi Code可以读取和修改项目文件、运行Shell命令、搜索代码与网页,并根据工具返回结果继续推进开发任务。

Kimi API

开发者可以通过OpenAI兼容接口调用模型,模型ID为:

kimi-k3

Kimi API支持HTTP、Python SDK和Node.js SDK。官方推荐将K3用于复杂编码、长上下文、多步骤智能体、知识工作和深度推理任务。

Kimi K3 API价格

Kimi K3 API按照每100万Token计费。

当前官方价格为:

Token类型 每100万Token价格
缓存命中输入 2元
未命中缓存输入 20元
模型输出 100元

Kimi K3拥有100万Token上下文窗口,价格不按照上下文长度分段,而是根据实际输入和输出Token数量计算。

官方还表示,借助Mooncake分离式推理架构,Kimi API在部分编程场景中的上下文缓存命中率可以超过90%。实际费用仍取决于任务内容、上下文重复程度和输出长度。

当前仅支持max思考强度

Kimi K3始终开启思考模式。

开发者可以通过reasoning_effort参数配置思考力度,但当前唯一支持的档位是:

max

Kimi已经确认,其他思考强度将在后续上线。用户上传的发布材料提到未来将增加lowhigh两种模式。

在多轮对话和工具调用中,开发者必须将API返回的完整Assistant消息原样加入下一次请求,不能只回传最终content。否则可能丢失推理历史,影响后续任务表现。

完整权重计划7月27日前发布

Kimi K3被定位为3万亿级开放权重模型,但在正式上线初期,完整模型权重尚未同步发布。

根据官方发布材料:

Kimi K3服务已经上线
API已经开放调用
完整权重计划在2026年7月27日前发布
技术报告将公布架构、训练和评测细节
团队正在与推理框架及开源社区进行适配
KDA对应的vLLM Prefix Cache实现将随模型发布

因此,在权重正式发布前,不宜直接写成“Kimi K3完整开源代码和权重已经可以下载”。

更准确的表述是:

Kimi K3已经正式上线,并计划在2026年7月27日前完整开放模型权重。

Kimi K3目前有哪些限制?

Kimi也在发布材料中披露了模型现阶段的几项限制。

对历史思考内容较敏感

Kimi K3在后训练过程中使用了思考历史保留机制。

如果智能体框架没有完整回传历史推理消息,或者用户在同一会话中从其他模型直接切换到K3,可能出现上下文干扰。

开发者应尽量使用经过适配的Agent框架,并避免在复杂任务进行到一半时切换模型。

可能过于主动

Kimi K3重点训练了长时间和高难度任务执行能力。

当任务描述不够明确时,它可能自行补充条件或代替用户作出决定。

在代码修改、文件删除、系统配置和线上操作等场景中,建议通过System Prompt或AGENTS.md明确规定:

允许修改哪些文件
哪些操作必须先询问
是否可以安装依赖
是否允许访问网络
是否可以删除文件
是否可以操作生产环境
完成任务的验收条件

与顶级闭源模型仍有差距

Kimi发布材料表示,K3在整体评测中已经达到较强水平,并领先多款参评模型,但在部分用户体验和高难任务上,与最强闭源模型仍存在差距。

这意味着2.8万亿参数并不能直接等同于所有任务中的最佳表现。

模型效果还取决于训练数据、后训练方案、智能体框架、工具环境、提示词和推理资源。

Kimi K3适合哪些用户?

软件开发者

适合大型代码仓库分析、跨文件修改、性能优化、测试和长程开发任务。

科研人员

可用于论文阅读、公式整理、科学计算、代码实现和数据可视化。

投研及咨询人员

适合处理公司公告、财务报表、行业报告、数据表格和长篇研究材料。

设计及三维开发者

可结合图片、视频、实时截图和代码,辅助开发网页、游戏、CAD及三维交互作品。

内容创作者

可用于资料研究、脚本编写、动态图形、视频素材整理和初步剪辑。

企业团队

可以通过Kimi企业版或后续Kimi Hosted Agent平台,构建具有沙箱、长任务运行环境和团队管理能力的内部智能体。

总结

Kimi K3是月之暗面目前参数规模最大、上下文窗口最长的旗舰模型。

该模型拥有2.8万亿参数,基于Kimi Delta Attention和Attention Residuals构建,并采用896专家、每次激活16专家的高稀疏度MoE架构。

Kimi K3原生支持文字、图片和视频理解,拥有100万Token上下文,主要面向长程编程、知识工作、复杂推理、科学计算和多步骤智能体任务。官方API文档已经开放模型调用,并提供工具调用、自动缓存、结构化输出和动态加载工具等能力。

用户目前可以通过Kimi网页端、手机App、Kimi Work、Kimi Code和Kimi API使用K3。API价格为每百万Token缓存命中输入2元、未命中输入20元、输出100元。

完整模型权重计划在2026年7月27日前发布,更多架构、训练与评测细节也将随技术报告公布。

在权重和技术报告正式公开后,开发者才能进一步验证Kimi K3的本地部署成本、推理效率、开放协议和不同硬件环境中的实际表现。

相关链接

© 版权声明

相关文章

暂无评论

none
暂无评论...