从 Dyna-2 的百万小时实验,看具身智能的数据来源、规模效应与世界建模路线
如果说过去两年,具身智能行业讨论最多的是「机器人什么时候真正走进工厂和家庭」,那么到了今天,一个更加底层的问题正在逐渐浮出水面: 我们究竟该怎样训练一个真正具备泛化能力的机器人?

最近,Dyna Robotics 发布的新一代世界-动作模型 Dyna-2,再次把这个问题推到了行业中央。
Dyna-2 使用超过100 万小时的第一人称人类视频进行预训练。更值得注意的是,在预训练过程中,它没有使用机器人数据,却观察到了一个非常重要的现象: 随着人类视频数据规模不断增加,模型在从未见过的机器人任务上的表现,也在持续提升。
从 1,000 小时、10,000 小时,到 100,000 小时、1,000,000 小时,模型性能并没有出现明显的平台期。
这项工作真正值得关注的地方,并不只是「100 万小时」这个数字。
它实际上把当下具身智能最核心、也最具争议的三个问题摆到了桌面上: 机器人预训练数据应该从哪里来?
不断增加数据之后,机器人能力是否真的存在规模化定律?
什么样的学习目标,才能真正让这种规模化发生?
而这三个问题,很可能决定未来几年具身智能行业真正的技术路线。
01 机器人需要的数据 到底应该从哪里来?

这是整个具身智能行业最现实的问题。
大模型之所以能够快速发展,一个非常重要的前提,是互联网已经天然存在海量文本、图片和视频数据。
但机器人不同。
机器人需要学习的是: • 如何拿起一个杯子; • 如何折叠衣服; • 如何打开抽屉; • 如何使用工具; • 如何判断物体之间的空间关系; • 甚至是如何理解接触、摩擦、形变和力。
这些都属于真实物理世界中的交互经验。
传统机器人训练往往依赖遥操作、示教或者专门的数据采集设备。

这种方法最大的优势,是可以获得非常准确的动作数据。
机器人看到了什么、机械臂移动了多少、夹爪什么时候闭合、关节角度如何变化,都可以被精确记录下来。
但问题也非常明显: 机器人数据很贵。
每一小时机器人训练数据,背后都需要设备、场地、人员以及大量真实操作。
如果未来通用机器人的训练真的需要百万小时、千万小时甚至更多数据,仅靠机器人本体采集,很难快速扩展。
于是,行业开始把目光转向另外一个巨大数据源: 人类。
人类每天都在完成机器人未来需要学习的任务。

做饭、收纳、清洁、装配、搬运、整理、开门、使用工具……
如果能够把这些行为通过第一人称视觉、动作捕捉、手部姿态等方式记录下来,那么人类本身,就可能成为一个规模近乎无限的「现实世界数据生成器」。
这也是 Dyna-2 给行业带来的第一个重要启示: 机器人学习的数据,不一定只能来自机器人。
未来真正具有规模优势的数据体系,很可能是: 大量人类行为数据作为基础,机器人数据完成最终的本体适配。
从这个角度看,具身智能未来竞争的不只是模型,也不仅仅是机器人硬件。
谁能够持续、高质量、低成本地获取真实世界中的人类操作数据,谁就可能掌握下一阶段具身智能最重要的基础资源之一
02 数据堆得越多 机器人真的会越来越聪明吗?

第二个问题更加关键。
因为「有数据」并不等于「数据越多越有效」。
过去行业一直希望复制大语言模型的发展路径: • 更多数据 • → 更大模型 • → 更强能力。
但机器人面对的是复杂得多的真实物理世界。
不同场景、不同物体、不同任务之间差异巨大。
更重要的是: 人的身体和机器人的身体并不一样。
人有手指、有肌肉、有柔性关节,而机器人可能使用机械臂、平行夹爪或者灵巧手。
因此,一个长期存在的问题是: 即使我们获得了大量人类数据,这些经验真的能够随着规模扩大,持续迁移到机器人身上吗?
Dyna-2 给出的结果值得关注。
当人类视频预训练规模从 1,000 小时不断提升至 1,000,000 小时之后,模型不仅在人类数据上的预测不断改善,在完全没有参与过预训练的机器人任务上,表现也同步提升。
也就是说: 人类经验的增加,开始稳定地转化为机器人能力的提升。
这背后的意义非常大。
因为它意味着,人类与机器人之间所谓的「本体鸿沟」,可能并不是一个完全无法跨越的问题。
它可能只是一个规模问题。
当模型看到的任务、环境、物体和交互足够丰富之后,它开始逐渐学到一些并不属于某一种身体结构的东西: • 物体会怎样运动; • 空间关系如何变化; • 接触之后会发生什么; • 一个任务最终应该达到什么状态。
这些知识,本质上是关于物理世界本身的。
而不是关于「人类的手」或者「机器人的夹爪」。

因此,对整个行业来说,一个非常值得思考的问题是: 未来具身智能真正需要规模化的,也许并不是某一种机器人数据,而是整个真实世界中的交互经验。
如果这条规律继续成立,那么今天百万小时的数据,很可能只是开始。
未来的数据竞争,很可能进入千万小时甚至更大的尺度。
03 机器人究竟应该学「动作」 还是先学「世界」?
这是三个问题中最值得讨论的一个。
目前很多机器人基础模型采用的核心思路,本质上都是: 看到当前画面和任务指令,然后直接预测机器人下一步应该做什么。
简单来说,就是: 看到环境 → 预测动作。
这种方法非常直接。
就像语言模型预测下一个 Token 一样,机器人模型预测下一个 Action。
只要拥有足够多的「观察—动作」数据,理论上模型就能够学习如何完成任务。
但 Dyna-2 的实验提出了一个不同方向。
他们发现,只训练动作预测,并不能稳定获得跨本体的规模化收益。
真正产生明显变化的,是加入了另外一个任务: 预测未来世界会变成什么样。
比如: • 如果杯子被推动,下一秒它会在哪里? • 如果手抓住毛巾并向左移动,毛巾会如何发生形变? • 如果抽屉被拉动,它的空间结构会怎样变化? • 如果物体被放进盒子,最终场景应该是什么状态?
换句话说,机器人不仅要学习: 「我下一步应该做什么?」
还需要学习: 「我做完之后,这个世界会发生什么?」 这就是世界模型的价值。

当一个模型开始理解世界状态如何随着动作变化,它学习到的就不再只是某一种机器人动作的统计规律,而是一套更加通用的物理规律。
也正因为如此,当机器人的身体发生变化时—— • 从人类的手,变成机械夹爪; • 从双臂机器人,变成灵巧手; 模型仍然有可能利用此前学到的世界知识完成迁移。
因此,未来机器人模型路线的竞争,很可能会从: Action Model 逐渐走向: World Model + Action Model。 机器人不仅需要学会「行动」,更需要形成一个对真实世界持续运行的内部理解。
从数据规模到世界理解
如果把这三个问题放在一起,会看到一条越来越清晰的路线: 第一步,是扩大真实世界数据来源。 从昂贵、有限的机器人数据,扩展到规模更大的人类操作数据。 第二步,是让这些数据真正产生规模效应。 模型看到越多真实世界交互,就获得越强的泛化能力。 第三步,则是改变模型学习这些数据的方式。
不只是模仿人的动作,而是理解: 动作如何改变世界。
这也是我们认为具身智能最值得关注的方向之一。
对于机器人来说,真正稀缺的也许从来都不是「动作」。
真正稀缺的,是对真实世界足够广泛、足够丰富、足够连续的理解。
星际元机器人: 让真实世界成为机器人的训练场

具身智能最终面对的,不是一个封闭的数据集。
而是一个真实、复杂,并且不断变化的物理世界。
机器人未来需要进入工厂、仓库、商业空间乃至家庭,面对数以万计的物体、任务、环境以及意外情况。
这意味着,我们无法为机器人提前写下所有规则,也无法只靠有限数量的单一机器人重复采集所有经验。
机器人的能力边界,最终取决于它能够看到多少真实世界,理解多少真实世界,并从多少真实交互中学习。
因此,在星际元机器人看来,未来具身智能的数据体系需要同时解决三个问题: 规模、真实性与可学习性。
数据不仅要足够多,也必须来自真实的人类行为与真实物理环境;
不仅要记录「看到了什么」,也需要尽可能保留动作、轨迹、空间以及交互过程;
更重要的是,这些数据最终需要能够真正进入模型训练,让机器人从数据中建立对物理世界的理解。

【这里可以根据星际元机器人实际业务补充一段,例如:第一人称数据采集、动作捕捉、遥操作、人类操作数据、多模态数据、机器人真机数据等具体能力。】
从语言模型到视觉模型,过去十年的 AI 发展已经一次次证明: 当正确的数据、模型与目标函数开始同时具备规模化条件,能力的边界就会迅速向外扩展。
现在,这件事正在物理世界再次发生。
100 万小时不会是终点。
当机器人真正开始从人类经验、真实世界视频以及自身交互中持续学习,我们或许正在进入一个新的阶段: 机器人不再只是被编程去完成某一个动作。
而是开始真正学习—— 这个世界,是如何运转的。
星际元机器人 让真实世界的数据,成为通用机器人的经验。

