2026年7月17日,月之暗面正式推出新一代旗舰模型 Kimi K3。
Kimi K3总参数规模达到 2.8万亿,基于Kimi混合线性注意力机制 **Kimi Delta Attention(KDA)**和注意力残差 **Attention Residuals(AttnRes)**构建,原生支持图片与视频理解,并将上下文窗口扩展至 100万Token。
月之暗面将Kimi K3定位为面向长程编程、端到端知识工作、科学研究和复杂推理的旗舰模型。Kimi API官方文档已经将其列为当前优先推荐模型,并确认其支持视觉输入、工具调用、结构化输出和自动上下文缓存等能力。
Kimi K3目前已经在Kimi网页端、手机App、Kimi Work、Kimi Code和Kimi API中上线。发布材料显示,完整模型权重计划在 2026年7月27日前发布,架构、训练和评测的更多细节则将随技术报告公布。
Kimi K3是什么?
Kimi K3是月之暗面推出的原生多模态、长上下文和智能体模型。
它不仅可以完成文字问答与内容生成,还能够理解图片、视频、软件界面和实时运行结果,并结合终端、浏览器、代码执行器及其他工具持续完成多步骤任务。
Kimi K3主要面向以下场景:
Kimi官方文档显示,K3支持文本、图片和视频输入,并可用于Codex、Claude Code、Cline、RooCode等编程智能体环境。
2.8万亿参数意味着什么?
Kimi K3总参数规模达到2.8万亿,约为Kimi K2一万亿参数规模的2.8倍。
不过,参数总量并不等于每次推理都需要调用全部参数。Kimi K3采用混合专家模型架构,在大量专家模块中,根据当前输入选择少量专家参与计算。
根据发布材料,Kimi K3采用Stable LatentMoE框架,共设置 896个专家,每次推理实际激活其中 16个专家。
这种高稀疏度设计的目标,是在扩大模型知识容量和任务能力的同时,控制单次推理的实际计算量。
Kimi方面表示,通过模型结构、训练方法和数据配方的共同调整,K3相较K2的整体扩展效率提高约 2.5倍。这意味着相同训练资源可以更有效地转化为模型能力。
Kimi Delta Attention提升长上下文效率
Kimi K3的核心架构之一是Kimi Delta Attention,简称KDA。
传统全注意力机制在处理长文本时,需要计算大量Token之间的关系。随着上下文长度增加,显存占用和计算量也会快速上升。
KDA是一种混合线性注意力机制,使用有限状态记忆保存和更新长序列中的信息,降低长上下文处理成本。
月之暗面此前已经通过Kimi Linear项目公开KDA相关研究。官方介绍显示,KDA在长文本、短文本和强化学习扩展等任务中均表现出较好的效率和性能。
在Kimi K3中,KDA成为支撑100万Token上下文窗口的重要基础。
100万Token上下文可以用于处理:
官方API文档还显示,Kimi K3会自动启用上下文缓存。只要用户保持较长的输入前缀不变,后续请求会自动尝试命中缓存,不需要单独创建缓存ID或设置有效期。
Attention Residuals改善深层模型信息传递
Kimi K3采用的另一项核心结构是Attention Residuals,也就是注意力残差。
传统Transformer模型通常将每一层的输出逐层累积。随着模型深度增加,早期层的重要信息可能被不断混合或削弱。
Attention Residuals并不是简单地把上一层结果加入下一层,而是让模型根据当前任务,从不同深度的历史表示中选择需要的信息。
这种设计类似为深层模型提供一个可检索的内部信息通道,使信息能够在更多网络层之间稳定传递。
KDA主要解决长序列中的信息流动效率,Attention Residuals则主要改善超深模型中的信息传递。两者共同构成Kimi K3扩展至2.8万亿参数的重要架构基础。Kimi官方API文档已经确认K3同时采用KDA和Attention Residuals。
896个专家,每次激活16个
Kimi K3进一步扩大了混合专家模型的稀疏度。
模型共包含896个专家,但一次前向计算只激活其中16个。不同专家可以在训练过程中学习不同类型的知识和处理模式,例如代码、数学、视觉、语言、科学计算或工具使用。
当用户提出任务时,路由系统会根据当前Token和上下文,将计算分配给更适合的专家。
为了改善大规模专家路由中的负载不均问题,Kimi K3还引入了Quantile Balancing,通过路由分数的分位数进行专家分配,减少对手工平衡规则和敏感超参数的依赖。
模型同时采用Per-Head Muon、Sigmoid Tanh Unit和Gated MLA等设计,用于优化注意力头训练、激活控制和信息选择。
完整技术细节仍需等待Kimi K3技术报告正式公布。
原生支持视觉理解
Kimi K3不是先训练纯文本模型,再通过独立视觉模块进行简单拼接,而是面向文字、图片、视频和软件界面建立统一的多模态能力。
官方API文档确认,Kimi K3支持文本、图片与视频输入。开发者可以通过Base64或文件上传方式提交视觉资料,再让模型分析图片、概括视频或结合视觉结果调用工具。
原生视觉能力让Kimi K3可以处理以下任务:
在长程开发任务中,模型可以在“编写代码—运行程序—查看截图—发现问题—继续修改”的流程中持续迭代,形成视觉反馈闭环。
Kimi K3强化长程编程能力
长程编程是Kimi K3重点优化的能力之一。
普通代码模型通常适合完成函数编写、代码补全和简单Bug修复,但大型工程任务可能持续数小时,并涉及代码阅读、环境配置、终端操作、测试、性能分析和多轮修复。
Kimi K3强调在较少人工监督的情况下持续推进任务,包括:
官方API文档也将复杂编码、跨文件理解和多步骤智能体任务列为Kimi K3的主要使用方向。
24小时GPU内核优化测试
为了测试Kimi K3的长期工程能力,月之暗面构建了一个GPU内核优化竞技场。
不同模型在独立GPU沙箱中处理相同任务、测试框架和生产负载,并可以在最长24小时内反复分析代码、重写内核和运行性能测试。
测试任务覆盖:
这类任务不只是要求模型生成一段能够运行的代码,还需要理解GPU架构、分析性能瓶颈,并根据实际跑分持续调整实现。
根据Kimi发布材料,K3在最大思考强度下表现接近部分顶级闭源模型,并领先多款参评模型。不过,完整测试方法、运行日志和结果表仍需等待技术报告披露。
从零开发MiniTriton编译器
Kimi团队还测试了K3能否从零构建一个GPU编程系统,而不是只优化已有内核。
在该实验中,Kimi K3开发了名为 MiniTriton 的轻量级GPU编译器。
MiniTriton直接基于MLIR定义自己的中间表示,没有依赖Triton IR,并实现了以下完整流程:
在Roofline测试中,MiniTriton在当前支持的算子上,性能接近Triton和torch.compile。
团队还使用TensorLite训练nanoGPT,并观察到正常收敛,说明模型生成的不只是几个独立内核,而是一套能够接入真实训练任务的编译器流程。
目前MiniTriton的TF32和BF16支持仍在开发中,其早期Tensor Core实现也不能直接替代经过长期优化的Triton。
从视觉反馈生成3D作品
Kimi K3将编程、视觉理解和三维推理结合,可根据文字、图片和视频制作可运行的交互式作品。
官方展示案例包括:
在这些任务中,Kimi K3可以运行代码、查看实时截图,再根据画面中的错误或视觉差异继续修改。
黑洞可视化案例已经提供在线网页,用户可以直接查看交互效果:
连续48小时完成芯片设计验证
Kimi K3还完成了一项芯片设计概念验证。
在连续48小时的自主智能体运行中,K3使用开源EDA工具和Nangate 45nm工艺库,为基于自身模型架构的nano模型设计专用芯片。
发布材料显示,该芯片包含:
模型需要完成芯片结构设计、逻辑实现、优化、时序分析和验证等步骤。
这项案例主要用于展示Kimi K3持续执行复杂工程任务的能力,并不代表该芯片已经进入实际流片或商业化生产阶段。
科研编程连接论文与可执行代码
Kimi K3还被用于计算天体物理研究。
在复现I-Love-Q普适关系的案例中,K3在约两小时内完成了以下工作:
传统科研编程任务通常要求研究人员同时理解论文、数学公式、数值算法和代码实现。
Kimi K3试图将文献检索、公式核对、代码编写、数据计算和结果可视化连接为一个连续流程。
不过,AI生成的科研结果仍需要专业人员复核,尤其是公式、实验条件、数值稳定性和结论解释。
Kimi Work上线小组件和看板
随着Kimi K3发布,Kimi Work还增加了 **小组件(Widgets)**和 **看板(Dashboard)**功能。
小组件可以在对话中生成交互式模块,并连接本地数据或外部插件。例如:
看板则可以将多个小组件汇总到一个长期保留的页面中,并围绕某个项目、主题或目标进行组织。
相比一次性生成报告,这种方式可以让研究结果、数据和任务状态持续更新。
处理大规模行业研究
Kimi发布材料还展示了一份覆盖推理芯片行业42年历史的研究报告。
该任务经过120多轮递归改进,过程中包括:
用户可以查看完整交互式报告:
其他展示案例还包括可控核聚变产业研究,以及对391个引力波事件的GWTC-5分析。
这些任务体现了Kimi K3在资料搜索、PDF阅读、数据处理、多智能体协作和可视化输出之间的连接能力。
支持视频剪辑和动态图形制作
因为Kimi K3原生支持文字、图片和视频理解,它还可以用于动画和视频剪辑任务。
发布材料展示的案例包括:
在实际使用中,AI可以承担素材整理、粗剪、节奏匹配和初步视觉设计,但品牌表达、版权核对和最终审美判断仍需创作者完成。
Kimi K3采用量化感知训练
Kimi K3从监督微调阶段开始采用量化感知训练。
根据发布材料,模型使用:
这些设计主要用于降低超大规模模型的部署成本,并适配更广泛的计算硬件。
Kimi建议在由64个或更多加速器组成的Supernode配置上部署K3,以获得更大的高带宽通信域。
由于2.8万亿参数模型对显存、存储和通信带宽要求很高,普通个人用户很难在消费级设备上完整部署。开放权重的主要使用者预计仍会是云计算平台、模型服务商、大型企业和研究机构。
Kimi K3如何使用?
Kimi K3目前已经进入多个官方产品入口。
Kimi网页端和手机App
用户可以访问Kimi官网,或将Kimi手机App升级至最新版本。
Kimi App支持iOS、Android和鸿蒙系统。
Kimi Work桌面客户端
知识工作用户可以下载Kimi Work桌面客户端。
发布材料显示,使用Kimi K3需要将Kimi Work升级至 3.1.0及以上版本,目前支持Windows和Apple芯片Mac电脑。
Kimi Code
开发者可以在电脑终端运行Kimi Code,并在支持的客户端中选择K3模型。
Kimi Code可以读取和修改项目文件、运行Shell命令、搜索代码与网页,并根据工具返回结果继续推进开发任务。
Kimi API
开发者可以通过OpenAI兼容接口调用模型,模型ID为:
kimi-k3
Kimi API支持HTTP、Python SDK和Node.js SDK。官方推荐将K3用于复杂编码、长上下文、多步骤智能体、知识工作和深度推理任务。
Kimi K3 API价格
Kimi K3 API按照每100万Token计费。
当前官方价格为:
| Token类型 | 每100万Token价格 |
|---|---|
| 缓存命中输入 | 2元 |
| 未命中缓存输入 | 20元 |
| 模型输出 | 100元 |
Kimi K3拥有100万Token上下文窗口,价格不按照上下文长度分段,而是根据实际输入和输出Token数量计算。
官方还表示,借助Mooncake分离式推理架构,Kimi API在部分编程场景中的上下文缓存命中率可以超过90%。实际费用仍取决于任务内容、上下文重复程度和输出长度。
当前仅支持max思考强度
Kimi K3始终开启思考模式。
开发者可以通过reasoning_effort参数配置思考力度,但当前唯一支持的档位是:
max
Kimi已经确认,其他思考强度将在后续上线。用户上传的发布材料提到未来将增加low和high两种模式。
在多轮对话和工具调用中,开发者必须将API返回的完整Assistant消息原样加入下一次请求,不能只回传最终content。否则可能丢失推理历史,影响后续任务表现。
完整权重计划7月27日前发布
Kimi K3被定位为3万亿级开放权重模型,但在正式上线初期,完整模型权重尚未同步发布。
根据官方发布材料:
因此,在权重正式发布前,不宜直接写成“Kimi K3完整开源代码和权重已经可以下载”。
更准确的表述是:
Kimi K3已经正式上线,并计划在2026年7月27日前完整开放模型权重。
Kimi K3目前有哪些限制?
Kimi也在发布材料中披露了模型现阶段的几项限制。
对历史思考内容较敏感
Kimi K3在后训练过程中使用了思考历史保留机制。
如果智能体框架没有完整回传历史推理消息,或者用户在同一会话中从其他模型直接切换到K3,可能出现上下文干扰。
开发者应尽量使用经过适配的Agent框架,并避免在复杂任务进行到一半时切换模型。
可能过于主动
Kimi K3重点训练了长时间和高难度任务执行能力。
当任务描述不够明确时,它可能自行补充条件或代替用户作出决定。
在代码修改、文件删除、系统配置和线上操作等场景中,建议通过System Prompt或AGENTS.md明确规定:
与顶级闭源模型仍有差距
Kimi发布材料表示,K3在整体评测中已经达到较强水平,并领先多款参评模型,但在部分用户体验和高难任务上,与最强闭源模型仍存在差距。
这意味着2.8万亿参数并不能直接等同于所有任务中的最佳表现。
模型效果还取决于训练数据、后训练方案、智能体框架、工具环境、提示词和推理资源。
Kimi K3适合哪些用户?
软件开发者
适合大型代码仓库分析、跨文件修改、性能优化、测试和长程开发任务。
科研人员
可用于论文阅读、公式整理、科学计算、代码实现和数据可视化。
投研及咨询人员
适合处理公司公告、财务报表、行业报告、数据表格和长篇研究材料。
设计及三维开发者
可结合图片、视频、实时截图和代码,辅助开发网页、游戏、CAD及三维交互作品。
内容创作者
可用于资料研究、脚本编写、动态图形、视频素材整理和初步剪辑。
企业团队
可以通过Kimi企业版或后续Kimi Hosted Agent平台,构建具有沙箱、长任务运行环境和团队管理能力的内部智能体。
总结
Kimi K3是月之暗面目前参数规模最大、上下文窗口最长的旗舰模型。
该模型拥有2.8万亿参数,基于Kimi Delta Attention和Attention Residuals构建,并采用896专家、每次激活16专家的高稀疏度MoE架构。
Kimi K3原生支持文字、图片和视频理解,拥有100万Token上下文,主要面向长程编程、知识工作、复杂推理、科学计算和多步骤智能体任务。官方API文档已经开放模型调用,并提供工具调用、自动缓存、结构化输出和动态加载工具等能力。
用户目前可以通过Kimi网页端、手机App、Kimi Work、Kimi Code和Kimi API使用K3。API价格为每百万Token缓存命中输入2元、未命中输入20元、输出100元。
完整模型权重计划在2026年7月27日前发布,更多架构、训练与评测细节也将随技术报告公布。
在权重和技术报告正式公开后,开发者才能进一步验证Kimi K3的本地部署成本、推理效率、开放协议和不同硬件环境中的实际表现。
相关链接
