小米开源 Xiaomi-Robotics-0 后训练全流程:VLA大模型让机器人完成高精度耳机收纳任务

小米开源 Xiaomi-Robotics-0 后训练全流程:VLA大模型让机器人完成高精度耳机收纳任务

小米机器人团队正式公开 Xiaomi-Robotics-0 的真机后训练全流程,为开发者和研究团队提供了从模型适配到真实机器人部署的完整参考路径。根据小米机器人官方页面信息,Xiaomi-Robotics-0 是一个面向高性能与实时执行优化的 Vision-Language-Action,也就是 VLA 模型,并在 2026年4月27日 更新中开放了完整后训练流程。 

这次更新最受关注的演示,是机器人完成“将耳机收纳进充电盒”的高精度操作任务。该任务看似简单,但实际对机器人空间感知、抓取稳定性、实时反馈和动作连续性要求非常高。小米官方介绍称,机器人在经过 20小时任务数据后训练 后,可以连续完成三套耳机收纳而不失败,并已在 GitHub 仓库公开完整后训练流程。 

Xiaomi-Robotics-0是什么?

Xiaomi-Robotics-0 是小米机器人团队推出的开源 VLA 大模型。VLA 的全称是 Vision-Language-Action,即视觉-语言-动作模型。这类模型的核心目标,是让机器人能够看懂环境、理解人类指令,并直接生成可执行的动作序列。

传统机器人控制往往依赖工程师针对特定任务编写固定规则或控制程序,而 VLA 模型希望让机器人具备更强的泛化能力。例如,用户用自然语言告诉机器人“把耳机放进充电盒”,模型需要结合摄像头画面、机械臂状态和语言指令,判断耳机位置、左右耳对应关系、抓取姿态和放入路径,然后输出连续动作。

官方 GitHub 页面显示,Xiaomi-Robotics-0 是一个 4.7B参数 的 VLA 模型,面向高性能、无缝实时执行进行设计,并已开放推理代码、评测脚本、预训练权重和多个任务微调权重。 

后训练全流程开源,为什么重要?

这次更新的重点不是单纯发布一个模型,而是开放了 真机后训练流程。对于机器人开发来说,预训练模型通常只提供基础能力,但要让机器人完成某个真实任务,还需要在具体场景中进行适配训练,也就是后训练。

小米官方页面介绍,后训练用于将 Xiaomi-Robotics-0 适配到特定任务。在后训练过程中,小米采用动作前缀机制,让连续预测出的动作片段之间保持一致性;同时,为了让机器人动作更具响应性,团队还引入了多种方法,避免模型过度依赖连续动作之间的时间相关性。 

这对开发者非常关键。过去很多机器人模型在论文或仿真中表现不错,但真正落到真实机器人时,往往会遇到延迟、抖动、动作不连续、环境变化适应差等问题。后训练流程的开放,可以帮助更多团队理解如何把通用VLA模型适配到真实机械臂任务中。

20小时数据后训练,完成耳机入盒高精度任务

官方演示任务是“将耳机插入对应充电盒槽位”。小米官方页面指出,这一任务具有明显挑战:耳机体积小,需要准确区分左右耳,并完成精确空间对位;成功插入需要高精度抓取和细粒度操作。经过 20小时数据后训练 后,机器人展示了连续插入三套耳机且不失败的能力。 

这类任务可以很好地体现VLA模型在真实场景中的价值。机器人不仅要识别耳机,还要判断它应该放入左槽还是右槽;不仅要抓住耳机,还要保持姿态稳定;不仅要靠近充电盒,还要在极小空间内完成对位和插入。

不少媒体将这一能力概括为“亚毫米级操作”。更准确地说,官方演示体现的是面向极小公差场景的高精度空间对位能力。由于耳机与充电盒槽位配合空间很小,机器人必须具备细致的空间感知、稳定抓取和实时动作修正能力,才能避免插入失败或触碰移位。

异步执行:解决真实机器人推理延迟问题

机器人要在真实环境中完成流畅操作,不能等模型每次推理结束后再开始下一步动作。因为大模型推理存在延迟,如果机器人动作和模型推理不能并行,就容易造成停顿、卡顿或动作不连续。

Xiaomi-Robotics-0 的一个重要设计是 异步执行。官方页面说明,在部署阶段,机器人会在执行当前动作片段剩余动作的同时,推理下一段动作;只要当前动作片段中预留的已提交动作时间大于推理延迟,就可以保证机器人始终有动作可执行,从而实现连续、无缝的真实机器人运行。 

这项设计对真实机器人部署非常实用。相比只在仿真环境中获得高分,真实机器人更需要低延迟、稳定性和连续动作能力。异步执行可以让大模型控制机械臂时更接近实时控制系统的要求。

动作前缀机制:让连续动作自然衔接

机器人任务通常不是单步动作,而是一串连续动作。例如收纳耳机时,机器人需要识别、接近、抓取、移动、对准、插入、松开,每一步都需要平滑衔接。如果前后两次模型推理生成的动作片段不一致,就可能出现突然转向、抖动或动作断裂。

为了解决这一问题,小米在后训练中采用 action prefixing,也就是动作前缀机制。模型在生成下一段动作时,会参考当前动作片段中已经承诺执行的一部分动作,从而保持前后动作片段之间的连续性。官方同时指出,为了避免模型只复制前一段动作而忽略视觉信号,还设计了自适应损失重加权、Λ形注意力掩码和动作前缀随机遮蔽等方法。 

这套设计让机器人既能保持动作平滑,又不会失去对环境变化的响应能力。对于复杂真实任务来说,这一点非常重要。

训练数据与模型架构:兼顾泛化能力与实时执行

官方页面显示,Xiaomi-Robotics-0 的训练使用了约 2亿步机器人轨迹数据 和超过 8000万条通用视觉语言数据。机器人数据来自开源数据集和小米内部通过遥操作采集的数据,其中包括 338小时乐高拆解数据和400小时毛巾折叠数据。 

在模型架构方面,Xiaomi-Robotics-0 由预训练 VLM 和 Diffusion Transformer 组成。官方介绍称,模型采用 Qwen3-VL-4B-Instruct 作为视觉语言部分,VLM处理观察图像和语言指令并生成KV缓存,DiT再结合机器人本体状态生成动作片段;整体模型规模为4.7B参数。 

这种结构的优势在于,VLM负责理解视觉和语言,DiT负责生成连续动作。两者结合后,模型既能理解任务语义,也能输出适合机械臂执行的动作序列。

仿真与真机表现:从基准测试走向真实任务

根据小米官方页面,Xiaomi-Robotics-0 在多个仿真基准上取得了较强表现:LIBERO平均成功率达到98.7%;SimplerEnv中 Visual Matching 为85.5%、Visual Aggregation 为74.7%、WidowX 为79.2%;CALVIN在ABC-D和ABCD-D划分中平均长度分别达到4.75和4.80。 

真机评测方面,官方提到模型在乐高拆解和毛巾折叠两个双臂操作任务中取得了较高成功率和较强吞吐表现。此次新增的耳机收纳任务,则进一步展示了模型在小物体、高精度、细粒度操作场景中的适配潜力。 

这说明 Xiaomi-Robotics-0 的目标不是只做仿真成绩,而是面向真实机器人任务的稳定执行能力。

对机器人开发者有什么价值?

Xiaomi-Robotics-0 后训练全流程开源,对开发者有三个直接价值。

第一,降低真实机器人任务适配门槛。开发者可以参考小米提供的后训练代码、样例数据和部署流程,将模型适配到自己的机械臂任务中。

第二,提供完整评测和部署参考。GitHub 仓库已经包含 LIBERO、CALVIN、SimplerEnv 等评测脚本,并提供 Hugging Face Transformers 生态下的部署示例。 

第三,推动VLA模型从研究走向应用。很多具身智能团队都面临“模型能理解,但机器人不好执行”的问题。Xiaomi-Robotics-0 的后训练流程把动作连续性、推理延迟和真实执行稳定性纳入完整方案,对行业有较强参考价值。

Xiaomi-Robotics-0适合哪些应用场景?

1. 精密装配

耳机入盒任务说明该模型具备处理小物体和精细对位任务的潜力。未来可用于电子产品装配、零件整理、包装分拣等场景。

2. 双臂协作操作

官方真机评测包括乐高拆解和毛巾折叠,这类任务都要求机器人处理复杂形变、遮挡、抓取失败恢复和双臂协同。

3. 家庭服务机器人

未来家用机器人需要完成叠衣服、整理桌面、拿取物品、收纳小物件等任务,VLA模型的泛化能力和后训练流程可为这些场景提供基础。

4. 工业柔性制造

小批量、多品类、高变化的生产线,需要机器人快速适应新任务。后训练流程可以帮助机器人从通用能力迁移到具体生产任务。

5. 科研与教育

开源代码、模型权重和评测流程可用于高校、实验室和机器人团队进行具身智能、VLA模型、机器人控制和多模态学习研究。

为什么说这次开源值得关注?

Xiaomi-Robotics-0 的价值不仅在于模型本身,还在于它把“后训练”这一真实机器人落地中的关键环节公开出来。对于具身智能来说,模型从数据中学到通用能力只是第一步,真正难点在于如何让机器人在真实世界中稳定、快速、连续地完成任务。

官方 GitHub 显示,该项目采用 Apache-2.0 License,并已开放代码、技术报告、模型权重和后训练相关内容。  这对开发者生态建设非常有帮助,也有利于更多团队基于 Xiaomi-Robotics-0 进行二次开发和真实机器人验证。

SEO内容布局建议

如果这篇文章用于SEO发布,建议重点布局以下关键词:

“小米机器人 Xiaomi-Robotics-0”

“Xiaomi-Robotics-0 后训练全流程”

VLA大模型

“机器人亚毫米级操作”

“机器人耳机收纳”

“具身智能开源模型”

“机器人真实部署”

“机器人异步执行”

“机器人动作前缀机制”

“Vision-Language-Action模型”

这些关键词覆盖AI模型、机器人、具身智能、开源开发者和工业应用人群。标题建议保留“小米”“Xiaomi-Robotics-0”“VLA大模型”“后训练全流程”“机器人精细操作”等核心词,有利于搜索匹配。

总结

小米开源 Xiaomi-Robotics-0 后训练全流程,是具身智能和机器人VLA模型落地中的重要进展。该模型通过视觉语言理解、动作生成、异步执行和动作前缀机制,让机器人能够在真实环境中完成连续、平滑、高精度操作。官方演示中,模型仅用20小时任务数据后训练,就能完成耳机收纳入充电盒的复杂任务,并连续完成三套耳机收纳而不失败。 

对于开发者来说,这次开源提供了从模型权重、推理代码、评测脚本到后训练流程的完整参考;对于机器人行业来说,它展示了VLA模型从仿真基准走向真实任务执行的可行路径。随着更多团队基于开源流程进行适配,智能机器人在精密装配、家庭服务、工业制造和科研教育等场景中的应用空间有望进一步扩大。

相关链接

 

© 版权声明

相关文章

暂无评论

none
暂无评论...