← Back to news
2026年8月25日 · 平台管理员

当 Ego 数据成为 2026 具身智能的核心风口

当 Ego 数据成为 2026 具身智能的核心风口

要说 2026 年具身赛道最无法绕开的行业浪潮,必然是 Ego 第一视角数据。 市场需求爆发,高质量第一视角操作数据处于供不应求的状态。

自 2026 年开春,头部企业接连发布的多篇研究工作,彻底把行业目光聚焦在第一视角人类操作视频之上。 不管是依托数万小时第一视角素材完成预训练的 EgoScale,还是体量突破四万小时的 DreamDojo,第一视角人类视频正式走进具身大模型预训练的核心舞台,不再是小众实验室里的边角研究方向。 多项重磅成果集中亮相,绝非偶然。 如果拉长时间轴回溯,第一视角人类视频早已进入科研人员的研究视野,但为什么直到 2026 年初,它才真正站到行业聚光灯之下? 星际元 Stellar Ego 深度跟进整条技术演进脉络,我们尝试把这场产业跃迁拆解成两大板块来解读: 第一,复盘过去数年,学术界与产业界一直在攻克人类操作视频当中的各类技术痛点; 第二,拆解大规模第一视角视频参与机器人预训练,为何在当下这个时间节点得以落地成立。 下面我们从技术演进脉络展开。

第一视角视频的技术溯源: 最初并不是为机器人而生

第一视角数据的独特价值,最早诞生于计算机视觉领域。 CV 领域很早就捕捉到它独有的优势:第一视角天然记录人手和物体之间完整交互过程,这是第三人称镜头很难稳定捕捉到的信息。 采集设备佩戴在额头位置,手部与物件接触、抓取、挪动的细节几乎每一帧都被完整留存,是视觉模型训练的珍贵素材。 基于这一认知,一大批经典开源数据集陆续问世。

2018 年问世的 EPIC‑KITCHENS 搭建起大规模厨房场景第一视角数据集; 2022 年发布的 Ego4D 进一步拓宽场景边界,覆盖工坊、户外社交、居家日常,数据集体量达到数千小时。 这些数据集诞生之初,服务目标还是计算机视觉传统任务,却无意间为后续具身智能的发展储备了丰厚的数据底座。

人类视频驱动机器人学习的 三个发展阶段

阶段一  试探性探索,抽取间接监督信号(2021‑2023)
阶段一 试探性探索,抽取间接监督信号(2021‑2023)
阶段二  技术范式迭代,视频转向可执行监督(2023 下半年‑2025 上半年)
阶段二 技术范式迭代,视频转向可执行监督(2023 下半年‑2025 上半年)
阶段三  第一视角视频成为预训练核心支柱(2025 下半年‑至今)
阶段三 第一视角视频成为预训练核心支柱(2025 下半年‑至今)

Record Mapping: 如何从视频当中萃取有效信号

判断模型从第一视角视频学习什么,可以借助两个分析维度: 一是模型学习帧内观测特征,还是预判环境未来动态演化; 二是中间表征,选择人类可读懂的显式变量,还是模型自主习得的隐式潜表征。 两大维度构成四象限,可以概括产业与学界的技术路径。 两条清晰大趋势:2D 向 3D 迁移; 隐式表征搭配世界模型逐步成为主流。

显式路线: 从静态交互区域,走向三维轨迹重建

早期显式方案偏向静态的可交互区域热力图,WHIRL、SWIM 就是代表,用来标记场景当中哪些位置可以进行抓取操作。 但仅仅知道 “杯柄可以抓握”,距离输出完整运动路径还有很大距离,同时 affordance 本身自带模糊属性,慢慢退化成辅助手段。 二维关键点轨迹是另一类显式方案,ATM 工作具备代表性,从视频提取手和物体在图像平面的运动关键点序列,输入策略网络。 但二维轨迹丢失深度信息,没办法区分手部水平移动和垂直下落; 面对插入、翻转、避障这类强三维约束任务,短板格外突出。在数据量大、算力预算有限的场景,2D 方案依旧具备成本优势,面对高精度灵巧操作,能力上限非常明显。 于是技术演进自然走向二维转三维。借助成熟三维重建工具,从单目视频流还原三维运动信息。 DexMV 很早就开展相关探索,从多视角操作视频重建手和物体三维运动,再重定向映射到灵巧机械手。 EgoVLA 依托第一视角视频提取手部三维姿态、腕部轨迹作为预训练信号,结合 VLA 架构学习操作先验。 VITRA 更进一步,同时解算手部轨迹与物体状态变化,记录物件被推动、旋转、形变的全过程,联合编码形成完整交互描述。 当然显式三维路线也存在短板:后处理与标注成本高昂,性能高度依赖底层视觉算法。 遇到镜头剧烈晃动、运动模糊、物体遮挡,手部跟踪效果会大幅衰减; 单目第一视角画面下,人手姿态向机器人夹爪转换,旋转歧义很难彻底消除。

隐式路线: 不预设中间量,让模型自主挖掘动作特征

和显式思路截然不同,隐式路线不会人为定义需要提取什么特征,交由模型自行学习类似动作的潜表征 latent action。 LAPA 是该方向代表工作,输入相邻两帧图像,编码器把画面变化压缩为低维潜动作向量,解码器基于当前帧 + 潜动作预测下一帧画面。 但离散化动作 token 容易丢失细腻连续运动细节。 后续 CoMo 转向连续潜运动表征,不再只追求画面压缩效果,而是最大限度保留和动作相关的连续运动信息,让潜表征更加贴合真实运动。 隐式方案最大优势,就是适配海量无标注人类视频。 原生第一视角素材大多缺少标签,不需要复杂后处理,可使用的数据规模远高于标注数据集,天然适配大规模预训练。 短板同样客观存在:表征不可解释,调试排错难度高; 灵巧操作精度存在瓶颈; 潜动作到真实机器人控制指令,依旧需要一层映射转换。

以上全部技术,都建立在同一个前提: 从人类视频萃取的信息,最终要落地到机器人实体执行。 人手拥有 27 个自由度,普通平行夹爪仅有 1 个自由度,人体运动链和机械本体不存在天然同构关系,这就是具身鸿沟 embodiment gap。 就算精准复刻人的操作行为,机器人也未必可以复现。 最直接的解法,就是在训练配方当中加入机器人真机数据。 必须认清,人类第一视角视频不是万能解药,无论算法如何优化,很难完全脱离真机数据辅助。 除此之外,行业沉淀出三类解决路径:数据层编辑改写、显式几何重定向、构建跨本体共享表征空间。

Embodied Mapping: 跨越人与机器人的本体鸿沟

人与机器人硬件本体存在天然差异,这是 Ego 数据落地的根本阻碍。 Ego 视频记录的是人类的视觉感知与肢体行为,可机器人的躯体结构、关节约束和人类完全不同。 直接投喂人类第一视角数据,模型学到的是人的行为,很难迁移到机器人,这就是本体映射的核心矛盾。 过往行业主要有两条解决路径: 纯视觉模仿复刻 门槛低,但忽略本体差异。仅能完成简单任务,机器人极易动作失效,实际落地稳定性不足。 骨骼姿态解算转换提取人体骨骼,再换算成机器人关节指令。效果上限更高,但采集、算法成本巨大,很难规模化。 这也解释了,为什么早年已有 Ego 数据集,却没能撬动产业。数据只是原材料,本体映射难题阻断了数据转化为机器人能力的路径。 2026 年这批工作的核心进步,不在于单纯堆砌数据量,而是重构本体映射的处理思路。 不再生硬转换人体骨骼,转而训练模型学习视觉和行为意图的关联:从第一视角画面读懂环境、识别操作目标,再结合机器人本体生成适配动作。 新范式大幅削弱了本体异构带来的损耗,海量 Ego 数据的价值才得以释放,高质量 Ego 数据也迅速变成行业刚需,供需缺口快速拉大。

拐点为什么出现在 2026?

第一视角人类视频,究竟是炒作风口,还是长期成立的技术方向?

一、第一视角数据供给体系走向成熟 开源数据集持续迭代,从早期小片段升级到 Ego4D 数千小时多场景素材。 同时商业化数据供给快速崛起。 国内具身数据厂商已经实现规模化交付,可支撑 EgoScale、DreamDojo 这类项目的训练需求,覆盖居家、工坊等数千类实操任务,单周产出数万小时高质量素材。 越来越多服务商入场,持续扩充 Ego 数据供给池。 Stellar Ego 头环正是针对该行业痛点,面向机器人打造可规模化的轻量化采集硬件。 无需复杂改装,头戴即可采集高保真手物交互第一视角画面,兼顾佩戴体验与数据质量,打通硬件采集‑数据清洗‑模型训练全链路,降低行业获取高质量 Ego 数据的门槛。 未来平民化大规模采集时代,头戴设备将成为海量第一视角素材的重要入口。

二、具身大模型的需求,倒逼攻克人类视频学习难题 行业希望复刻大模型缩放定律,构建具身基础模型,已有研究证实:更大体量、更多样的数据,能够持续推高模型性能。 但机器人真机采集成本居高不下。 即便高效遥操作方案,真机有效样本产出依旧有限,硬件分发还要面对物流、运维等现实约束,很难指数级扩张。 行业自然转向更容易规模化的人类操作视频。 人类产出的操作视频总量远大于机器人数据集总和;第一视角和机器人观测视角接近,手物交互信息密度高,对采集对象干扰小。 甚至仅靠手机简易设备就可以完成录制。 未来若普通大众参与采集,如何处理海量素材,会成为核心命题,而现存算法问题,大多属于阶段性可解决问题。

三、范式迭代:VLA 走向世界模型,补齐交互短板 行业正从 VLA 视觉语言架构向世界模型演进。 通用视频生成模型大多偏向叙事画面,缺少真实物理交互内容,而人类第一视角操作视频刚好补上这一块关键短板。

四、上下游工具链成熟,降低视频信息挖掘门槛 三维重建、视觉基础模型带来工具能力提升:MANO 人手参数模型成为社区标准; HaMeR 实现单目视频三维手部轨迹重建;DINOv2 提供稳定跨域特征; 大规模视频语言模型实现任务自动切分与标注。 缺少这套底层工具,相关算法方案就没有可靠输入。

五、从零散算法走向工业化完整数据流水线 单点算法模块整合为全链路管线。 原始 Ego 视频经过过滤切片、手部重建、动作提取后标准化输出,直接供给预训练模型。 端侧做手物交互筛选,保留高价值片段;云端完成切分、轨迹解算、降噪增强,形成闭环迭代。 EgoScale 验证缩放定律,依靠的不是单一算法,而是整套工业化管线,证明第一视角视频可以稳定转化为模型能力。

机遇与待解命题

第一视角人类视频,已经从辅助素材升级为机器人学习的核心数据源,但行业挖掘才刚刚起步。 后续可以进一步挖掘第三人称视频价值,拓展全身运动控制研究; 依托 real‑to‑sim 管线将真实操作转为仿真资源,推动仿真数据集规模化,丰富模型评测手段。 Stellar Ego 也在迭代整套体系,不只提供硬件采集能力,也在探索原始视频向仿真资产转化链路,实现数据复用,摆脱一次性消耗。 同时仍有诸多开放性问题待解答: 什么样的硬件方案能支撑普通人参与大规模数据生产? 海量原始视频最优的清洗加工路径是什么? 算力应当侧重显式后处理,还是依靠海量数据让模型自主学习特征? 浪潮已至,但挑战仍存,留给科研与产业大量探索空间。 趋势已成,道阻且长。