小米发布 Xiaomi-Robotics-1:以超 10 万小时真实轨迹探索 VLA 扩展趋势
小米机器人团队发布 Xiaomi-Robotics-1,一个其称为「开箱即用」的机器人视觉-语言-动作(VLA)基础模型。官方研究页显示,该模型在超过 10 万小时的真实世界操作轨迹(UMI 无本体采集,覆盖 1700+ 家庭、商业、工业与户外场景)上完成预训练;后训练混合自有真机、筛选后的开源机器人数据和高质量 UMI 数据,其中自有真机数据超过 7200 小时。论文(arXiv 2607.15330)于 7 月 16 日提交。项目页虽已链接 GitHub 和 Hugging Face,但截至本文发布,GitHub 仓库只有 README 与论文 PDF,HF 组织页也没有 Xiaomi-Robotics-1 权重;论文使用的是「计划发布」措辞,代码、权重和训练数据均不能算已开放。
这项工作的核心论点是「打破数据壁垒」:语言与视觉基础模型靠 scaling law 持续推进前沿,而机器人领域长期受限于大规模高质量数据稀缺。Xiaomi-Robotics-1 给出的答案是「无本体预训练 + 少量真机后训练」的两阶段配方——预训练阶段用自动标注管线(VLM 为轨迹片段生成场景状态转移描述)解决十万小时级数据无法人工标注的问题,后训练阶段再做本体对齐与自然语言指令对齐。
最值得关注的是团队报告的扩展趋势:预训练阶段验证集动作误差随数据量与模型规模增加而下降,这一趋势也传递到后训练后的真机表现——在未见环境与物体实例上,更强的预训练模型取得更高成功率,且在其观察范围内未出现饱和迹象。官方页面没有披露参数规模、scaling 指数或可复算公式,因此这更准确地说是 Xiaomi-Robotics-1 实验中的定性趋势,尚不足以证明普适的 VLA scaling law。这与昨日收录的昆仑万维 Riemann-1.0、早前面壁智能 MiniCPM-Robot 同属一波信号:国产厂商正在尝试把 LLM 时代的 scaling 方法论迁移到具身智能赛道。
需要注意的是:真机成功率与基准成绩均为团队自报,尚待第三方独立复现;官方页面未披露模型参数量,代码仓库也尚无许可证。项目上线后迅速登上 Hacker News 热榜前列(370+ 分);是否兑现代码与权重发布承诺,以及后续社区复现结果,值得继续观察。
来源:https://robotics.xiaomi.com/xiaomi-robotics-1.html | https://arxiv.org/abs/2607.15330