小米发布Xiaomi-Robotics-1具身智能基底模型:10万小时真实数据探索物理AI Scaling效应

2026年7月16日,小米机器人团队正式发布具身智能基底模型 Xiaomi-Robotics-1

该模型通过超过 10万小时真实世界操作轨迹进行预训练,再使用跨本体真实机器人数据完成后训练,目标是缓解机器人领域长期存在的数据规模不足问题,并验证数据量、模型尺寸与机器人任务能力之间是否同样存在清晰的Scaling效应

小米官方实验结果显示,随着预训练数据量和模型规模持续增加,Xiaomi-Robotics-1的动作预测误差逐步下降;完成后训练后,模型在未见环境、未见物体和复杂移动操作任务中的成功率也持续提高。

这表明,大语言模型和视觉模型中常见的规模化训练规律,可能同样适用于具身智能与物理AI领域。

image.png

Xiaomi-Robotics-1是什么?

Xiaomi-Robotics-1是小米面向机器人操作任务开发的视觉—语言—动作模型,也可以称为VLA模型机器人基底模型

传统视觉语言模型主要负责理解图像、视频和文字内容,而VLA模型还需要根据视觉信息和自然语言指令,直接生成机器人可以执行的动作。

例如,当用户向机器人发出以下指令时:

整理沙发上的物品
将鞋子放入鞋柜
收纳厨房餐具
把衣服放进洗衣机
将手机装入包装盒
为打印机补充耗材

模型不仅需要理解指令,还要识别物体、判断空间关系、规划操作步骤,并持续控制机械臂或移动机器人完成任务。

小米将Xiaomi-Robotics-1定位为可以直接用于多类移动操作任务的机器人基底模型。经过后训练后,模型能够在真实环境中执行多种此前未见过的操作任务。

使用超过10万小时真实世界操作数据预训练

机器人模型的发展长期受到数据规模限制。

文本模型可以从互联网获得大量文本,视觉模型也可以利用图片和视频进行训练,但高质量机器人数据通常需要真实机器人反复操作和人工采集,成本较高、速度较慢,而且不同机器人之间的硬件和动作空间并不统一。

为扩大训练数据规模,Xiaomi-Robotics-1采用了不依赖特定机器人本体的 UMI操作轨迹进行预训练。

官方资料显示,其预训练数据超过10万小时,覆盖1700多个真实场景,包括:

家庭住宅
商业空间
工业场所
户外环境
日常物品整理
容器开合
搬运与放置
清洁与收纳
工具及设备操作

这些数据并不局限于某一种机械臂或某一款机器人,而是通过统一操作接口采集真实世界中的物体交互过程。

这种训练方式可以让模型先学习较为通用的物体运动、空间变化和操作规律,再通过后训练适配具体机器人。

自动标注10万小时机器人操作轨迹

面对10万小时规模的操作数据,完全依靠人工为每一段视频编写指令和动作描述并不现实。

因此,小米构建了一套自动标注流程。

系统首先将较长的操作轨迹切分为固定长度的视频片段,再使用视觉语言模型分析片段内容,描述机械夹爪、目标物体和场景状态发生了哪些变化。

例如,系统可以将一段视频标注为:

将杯子从桌面移动到托盘
打开柜门并取出物品
把衣服放入洗衣机
将散落物品整理到收纳盒
把包装材料折叠并放置到指定区域

模型通过大量“场景状态变化—动作轨迹”数据,学习如何生成能够推动物理环境发生对应变化的机器人动作。

小米官方表示,这种自动化数据处理流程是扩大机器人训练数据规模的重要基础。

预训练与后训练两阶段训练方案

Xiaomi-Robotics-1采用类似大语言模型的两阶段训练方式,包括预训练和后训练。

第一阶段:大规模预训练

预训练主要用于拓展模型对现实世界、物体交互和通用动作模式的理解。

模型通过超过10万小时UMI数据学习不同环境中的操作规律,包括:

物体如何移动
不同工具如何使用
容器如何打开和关闭
物体之间如何产生接触
机械夹爪如何接近和抓取物体
操作前后场景状态如何变化

这一阶段并不要求模型完全匹配某一款机器人的具体关节和控制方式,而是先建立通用的动作生成能力。

第二阶段:跨本体后训练

完成预训练后,模型还需要与真实机器人本体及自然语言指令进行对齐。

小米使用的后训练数据包括:

小米内部采集的机器人数据
筛选后的开源机器人数据
高质量UMI操作数据
不同机器人本体产生的操作轨迹
经过人工切分和指令标注的数据

其中,小米在真实家庭环境中采集了超过 7200小时真实机器人数据,覆盖整理沙发、收拾鞋柜和收纳厨房用品等任务。

通过跨本体训练,模型可以将预训练阶段获得的通用动作能力,映射到不同机械臂、移动底盘和机器人平台上。

什么是跨本体机器人训练?

“本体”指的是机器人的具体硬件形态和控制结构。

不同机器人可能存在明显差异,例如:

机械臂关节数量不同
夹爪结构不同
摄像头位置不同
移动底盘结构不同
动作控制频率不同
可执行动作范围不同

如果模型只能使用某一款机器人采集的数据,训练成本会很高,模型也难以迁移到其他硬件平台。

跨本体训练的目标,是让一个模型同时学习来自不同机器人和操作设备的数据,再通过统一的动作表示或后训练方式适配具体硬件。

Xiaomi-Robotics-1先通过本体无关数据进行大规模预训练,再使用跨本体真实机器人数据进行对齐,以提高模型在不同机器人平台和不同任务之间的迁移能力。

Xiaomi-Robotics-1验证物理AI Scaling效应

Scaling通常指随着训练数据、模型参数和计算资源增加,模型能力按照相对稳定的趋势提高。

在大语言模型领域,增加训练数据与模型规模通常可以提升语言理解、推理和任务泛化能力。但在机器人领域,由于训练数据规模有限,类似规律是否成立,一直缺少足够大规模的真实实验。

Xiaomi-Robotics-1主要从两个阶段观察Scaling现象。

预训练阶段:动作预测误差持续下降

小米对不同数据规模和模型尺寸进行了对比。

实验结果显示:

增加预训练数据后,验证集动作误差持续下降
扩大模型尺寸后,动作预测精度进一步提高
数据量与模型规模同时扩大时,模型表现更加稳定
当前增长趋势尚未表现出明显饱和迹象

这意味着更多真实世界操作数据能够持续帮助模型学习物体交互和动作生成规律。

后训练阶段:真实机器人成功率持续提高

小米进一步测试了预训练阶段的能力提升是否能够迁移到真实机器人。

实验在未见环境和未见物体实例中进行。结果显示,随着预训练数据和模型尺寸增加,完成后训练的机器人任务成功率也稳定提高。

官方表示,更强的预训练模型能够带来更好的真实机器人表现,而且当前成功率增长仍未出现明显平台期。

这说明预训练阶段获得的能力并非只体现在动作预测指标中,也可以转化为真实环境中的任务执行能力。

支持“开箱即用”的移动操作能力

完成后训练后,Xiaomi-Robotics-1可以直接执行多类移动操作任务。

“开箱即用”并不意味着模型可以在任何机器人上无需配置直接运行,而是指模型完成通用后训练后,已经具备较广泛的真实机器人任务能力,不需要为每个基础任务都从头训练。

小米展示的任务场景包括:

整理客厅和沙发
收拾鞋柜
收纳厨房用品
移动物品并放到指定位置
处理不同形状和材质的物体
在陌生环境中理解并执行自然语言指令

测试中使用的环境和部分物体实例未出现在训练数据中,主要用于评估模型的泛化能力。

少量数据即可适配新的复杂任务

除通用任务外,小米还测试了Xiaomi-Robotics-1学习新任务时的数据效率。

测试任务包括:

手机包装
打印机耗材补充
洗衣机衣物装载
包装箱整理

在平均每个任务使用不到10小时演示数据的情况下,Xiaomi-Robotics-1整体成功率达到 75%,而相同数据预算下,π0.5基线模型为40%。

当平均每个任务的训练数据增加到40小时以内时,Xiaomi-Robotics-1整体成功率进一步达到 85%,π0.5基线模型为53%。

具体测试结果如下:

新任务 不足10小时数据 不足40小时数据
手机包装 70% 80%
打印机耗材补充 70% 60%
洗衣机衣物装载 80% 100%
包装箱整理 80% 100%
整体成功率 75% 85%

需要注意的是,不同任务和评估环境之间存在差异,表格数据主要用于展示同一套实验设置下的相对表现。

四项公开仿真基准取得SOTA成绩

小米还在四项机器人仿真基准中测试Xiaomi-Robotics-1,项目页面显示其在四项测试中均取得当时最好的结果。

RoboCasa

Xiaomi-Robotics-1平均成功率为 74.5%,第二名为72.6%,相对提升2.6%。

RoboCasa365

Xiaomi-Robotics-1平均成功率达到 57.4%,第二名为46.6%,相对提升23.2%。

VLABench

Xiaomi-Robotics-1取得 59.1% 的平均成功率,第二名为53.2%,相对提升11.1%。

RoboDojo

Xiaomi-Robotics-1取得 13.93% 的平均成功率,第二名为8.80%,相对提升58.3%。

仿真基准 Xiaomi-Robotics-1 第二名 相对提升
RoboCasa 74.5% 72.6% 2.6%
RoboCasa365 57.4% 46.6% 23.2%
VLABench 59.1% 53.2% 11.1%
RoboDojo 13.93% 8.80% 58.3%

以上排行榜状态以小米项目页面标注的 2026年7月15日 为准。

Xiaomi-Robotics-1与Xiaomi-Robotics-0有什么区别?

Xiaomi-Robotics-0是小米此前发布的实时视觉—语言—动作模型,重点在于实时推理、通用机器人操作以及公开仿真任务表现。

Xiaomi-Robotics-1则进一步将重点放在大规模机器人数据预训练和物理AI Scaling规律上。

两者的主要区别可以概括为:

对比方向 Xiaomi-Robotics-0 Xiaomi-Robotics-1
主要目标 实时VLA推理与任务执行 大规模数据预训练与机器人Scaling
数据重点 机器人操作数据与仿真任务 超过10万小时真实世界UMI轨迹
训练方式 VLA预训练与任务适配 本体无关预训练加跨本体后训练
核心能力 实时控制和公开基准表现 泛化能力、数据效率和多本体适配
主要研究问题 如何提高机器人实时执行能力 数据与模型规模能否持续提升物理AI能力

Xiaomi-Robotics-1并不是简单替代上一代模型,而是尝试扩大机器人训练数据和模型能力边界。

10万小时机器人数据意味着什么?

与互联网文本和图片相比,10万小时真实操作轨迹仍然不是无限规模的数据,但对于机器人领域而言,已经属于较大规模的数据集。

更重要的是,这些数据覆盖1700多个场景,并包含家庭、商业、工业和户外空间。

大规模真实世界数据可以帮助模型学习:

不同光照和视角下的物体特征
复杂背景中的目标定位
物体接触与空间变化
不同材质和形状的抓取方式
长时间任务中的动作衔接
未见环境中的操作迁移
多种工具和容器的使用方式

相比只在固定实验室环境中采集数据,跨场景数据更有利于测试模型面对现实环境变化时的稳定性。

Xiaomi-Robotics-1可能应用在哪些场景?

家庭服务机器人

用于物品整理、衣物处理、厨房收纳、清洁辅助和家庭物品搬运。

工业制造

用于零件分拣、物料搬运、包装、设备补充和柔性生产任务。

仓储与物流

用于商品抓取、箱体整理、订单分拣、装箱和货架操作。

商业服务

用于零售补货、餐饮辅助、酒店物品配送和公共空间整理。

机器人训练平台

开发者可以在基底模型之上使用少量行业数据,训练面向特定机器人和特定任务的操作模型。

人车家全生态

结合小米在智能家居、汽车和机器人方面的硬件布局,具身智能模型未来也可能用于连接家庭设备、移动机器人和智能空间。

当前代码和模型权重开放情况

小米已经上线Xiaomi-Robotics-1官方网站、技术报告、GitHub项目和模型入口。

不过,截至2026年7月16日,GitHub项目README仍显示代码和模型权重将于后续开放,Hugging Face组织页面暂未展示可直接下载的Xiaomi-Robotics-1权重。

因此,目前可以查看完整项目介绍和技术报告,但开发者是否能够直接下载并部署模型,需要以小米后续更新的仓库状态为准。

物理AI Scaling仍面临哪些问题?

Xiaomi-Robotics-1展示了数据和模型规模增长带来的能力提升,但机器人Scaling仍然面临多项实际问题。

数据采集成本较高

真实操作数据需要设备、场地、操作人员和数据清洗流程,成本明显高于收集互联网文本。

不同机器人硬件差异较大

机械臂、夹爪、摄像头和移动底盘之间存在差异,跨本体能力仍需要持续验证。

真实世界安全要求更高

机器人生成错误文字通常只影响内容质量,但错误动作可能造成物体损坏、设备碰撞或人员受伤。

长任务稳定性仍需提升

现实任务可能包含几十个连续步骤,任何一个环节失败都可能影响最终任务完成率。

仿真成绩不等于真实部署效果

仿真基准有助于统一比较模型,但真实环境中的光照、遮挡、摩擦、物体材质和设备误差更加复杂。

因此,机器人模型除了提高成功率,还需要加强安全控制、异常检测和人工接管机制。

总结

小米发布的Xiaomi-Robotics-1是一款面向通用机器人操作任务的具身智能基底模型。

该模型使用超过10万小时真实世界UMI操作轨迹进行预训练,覆盖1700多个场景,并结合超过7200小时小米内部真实机器人数据、开源数据和高质量UMI数据完成跨本体后训练。

实验结果显示,随着预训练数据量和模型尺寸增加,模型动作预测误差持续下降,未见环境中的真实机器人任务成功率持续提高。

在新任务适配测试中,Xiaomi-Robotics-1使用平均不足10小时演示数据即可达到75%的整体成功率;在RoboCasa、RoboCasa365、VLABench和RoboDojo四项仿真基准中,也取得了项目发布时的SOTA成绩。

Xiaomi-Robotics-1的核心价值,在于验证大规模数据预训练能否持续提升机器人的真实世界操作能力。随着机器人数据采集、跨本体训练和安全控制技术不断完善,具身智能模型有望进入家庭服务、工业制造、仓储物流和商业服务等更多场景。

相关链接

© 版权声明

相关文章

暂无评论

none
暂无评论...