思考探索:具身智能的数据鸿沟:先对齐,再扩规模
“跨越数据鸿沟”最值得保留的判断,不是把数据说成万能药,而是把数据问题拆成了一个更硬的工程问题:机器人数据只有在表示、动作、任务和评测都能对齐之后,规模才会变成能力。否则,更多小时数可能只是把更多坐标系、更多动作接口、更多噪声和更多伪相关塞进同一个模型。
这也是为什么我更愿意把当前具身智能的瓶颈写成:
1 | 数据规模 |
这里的“对齐”不是抽象口号。它至少包括四层:模态是否完整,动作空间是否可共享,任务目标是否足够丰富,评测分布是否真的离开训练分布。每一层没处理好,都会把看似宝贵的数据变成训练里的干扰项。
数据鸿沟不是只有“少”
机器人领域当然缺数据。真机采集贵,失败样本难拿,长时任务难标,跨机器人数据格式混乱。但如果只把数据鸿沟理解为“小时数太少”,就会漏掉更核心的问题:现有数据经常不能被同一个学习目标稳定消费。
| 鸿沟 | 具体表现 | 训练里的后果 |
|---|---|---|
| 模态鸿沟 | 视觉多,触觉、力觉、深度、声音和本体状态不完整 | 模型只能从图像外观猜物理属性,接触和重量常识薄弱 |
| 标准鸿沟 | 不同数据集的相机、坐标系、动作频率、标注和存储格式不同 | 多源数据难以合并,统一训练时容易互相污染 |
| 硬件鸿沟 | 单臂、双臂、灵巧手、移动底盘和人形机器人的自由度不同 | 同一个物理动作在数值上不相似,迁移需要重新适配 |
| 虚实鸿沟 | 仿真延迟、噪声、摩擦、接触和视觉质量过于理想 | 仿真成功率高,真机部署后失败模式集中爆发 |
所以更稳的判断是:数据鸿沟的第一层不是“没有数据”,而是 x 和 y 的格式没有统一语言。x 是视觉、本体、语言、历史、几何和任务状态;y 是动作、未来观测、成功/失败、风险分数和恢复路径。只要 x 与 y 的语义不稳定,模型就很难学到可迁移的结构。
世界模型为什么会进入主线
传统 VLA 可以粗略写成:
1 | observation + language -> action |
这条路线有巨大价值,因为它把 VLM 的语义能力接到了机器人动作。但它也容易把训练压成动作标签回归。模型知道当前图像和指令应该对应哪段动作,却不一定被迫解释“这段动作之后世界会怎样变化”。
WAM 和世界模型路线把目标改成:
1 | history observation + language + robot state |
关键差异不在于一定要生成更漂亮的视频,而在于未来预测给动作学习提供了密集动态监督。动作不再只是孤立标签,而要和未来视觉、几何状态和真实观测刷新互相约束。

图源:DreamZero,原论文 Figure 2。读图重点:WAM 的训练信号同时包含未来视频和动作,动作需要和预测到的世界变化相互支持。
DreamZero 代表的是“协同预测动作与视频”:把 future video latent 和 action chunk 放进同一个生成过程。LingBot-VA 与 LingBot-VA 2.0 更强调因果视频动作建模、异步执行和语义动作对齐。Fast-WAM 则给出一个重要边界:视频共训练的主要价值可能在训练期塑造世界表征,推理时未必总要显式生成未来视频。
这几条路线合起来,能得到一个更克制的结论:
1 | 预测未来不是目的, |
如果任务需要长时规划、反事实比较和候选策略评估,显式想象仍然有价值;如果任务更看重低延迟闭环控制,未来预测也可以退到训练目标和 latent 表征里。视频只是当前最方便的世界状态载体,不是世界模型的终点。
MoT 是接口设计,不是魔法模块
这条主线里反复出现的 MoT 思路,可以稳一点读成:具身模型正在把“理解、视频动态、动作生成”拆成不同专家,再通过共享注意力或联合调度交换信息。原因很直接:语义理解、视频预测和动作控制的频率、尺度、损失函数都不同,强行用一个完全同质的 backbone 可能互相拖累。
| 专家 | 主要学习对象 | 常见风险 |
|---|---|---|
| Understanding expert | 语言、物体、场景语义、指令约束 | 只懂语义,不懂接触和可达性 |
| Video / world expert | 未来视觉、运动趋势、场景动态 | 画面合理但动作不可执行 |
| Action expert | 连续动作块、末端运动、关节控制 | 训练分布内拟合强,跨硬件迁移弱 |
Motus 把这件事做成统一生成框架:VLA、world model、inverse dynamics、video generation 和 video-action joint prediction 都可以看成同一组视频/动作变量在不同条件下的生成问题。它的关键不是名字里的 unified,而是用 latent action 和调度器把不同任务变成可以切换的模式。
这也是“任务扩充”的含义。多任务不是为了让模型看起来全能,而是让不同监督信号约束同一个内部状态:图像描述约束语义,目标定位约束空间,视频生成约束动态,动作预测约束控制,任务状态约束停止、拒绝和恢复。
Qwen-RobotManip 的启示:对齐释放规模
Qwen-RobotManip 把“先对齐,再扩规模”讲得最直接。它的题目就是 Alignment Unlocks Scale。机器人数据不像文本那样天然共享一个 token space:不同机器人有不同自由度、末端坐标系、相机位姿、动作频率、夹爪接口和遥操作协议。直接拼起来,模型看到的“同一个物理动作”可能在数值上完全不像。

图源:Qwen-RobotManip,原论文 Figure 1。读图重点:Qwen-RobotManip 用统一 80 维 state/action 表示、camera-frame EEF 动作和历史 context,把不同机器人操作数据投到更可共享的接口里。
它的三层对齐很有参考价值。
| 对齐层 | 机制 | 解决的问题 |
|---|---|---|
| Representation alignment | 统一 80 维 state/action 模板和 mask | 不同 embodiment 的状态、动作维度不一致 |
| Motion alignment | camera-frame end-effector delta pose | 相似末端运动在不同机器人坐标下数值差异过大 |
| Behavior alignment | structured embodiment prompt + episode history context | 静态机器人标签不足以描述当前任务阶段和执行风格 |
这比“堆数据”更具体。只有当相似物理运动在表示空间里也相似,模型才可能从 ALOHA、UR、Franka、人类第一视角视频和合成数据之间抽出共同结构。
Qwen-RobotManip 的数据引擎也很典型:开源机器人数据约 11,000 小时,人类第一视角视频约 1,900 小时,人到机器人合成数据约 24,800 小时,总计约 38,100 小时。这个数字要谨慎读:24,800 小时不是等价真实机器人遥操作时长,而是从人类视频 retarget、分割、inpainting、仿真渲染和深度引导合成出来的扩展数据。

图源:Qwen-RobotManip,原论文 Figure 2。读图重点:human-to-robot synthesis 不是简单把人手视频当机器人数据,而是经过动作 retarget、平滑、手臂分割、背景补全、机器人渲染和深度合成。
这里能带走的不是某个具体数字,而是一条数据工程原则:合成数据要先通过接口对齐,才可能变成动作学习资产。否则它只是在训练集里增加看起来像机器人、实际上控制语义不稳定的视频。
Scaling 的三个台阶
把这条主线抽象出来,具身智能的 scaling 可以分三步。
第一步,对齐数据。
先处理机器人数据自身的格式、坐标、动作和质量问题。突变检测、极值过滤、状态动作趋势对齐、运动学一致性校验、坐标系方向统一,这些听起来不像模型创新,却决定了后续训练是否稳定。真实机器人数据的珍贵不只在“拍到了”,还在每一帧是否能和动作、状态、指令、任务阶段对上。
第二步,用不同领域构造全模态数据。
分割模型提供目标和手臂 mask,深度模型提供几何线索,VLM 生成任务解释和质量检查,inpainting 模型移除或替换视觉目标,仿真系统补长尾场景。这里的数据引擎更像一个工具链:
1 | raw video / robot logs |
这条线和 Depth Anything 3、SpatialVLA、Qwen-RobotManip 里的 H2R pipeline 是同一类问题:机器人不能只靠 RGB 外观学操作,必须把普通视频和日志转成空间、动作、任务都能索引的经验。
第三步,扩充训练任务。
数据规模解决覆盖,任务设计决定系统特性。只做动作预测,模型会更像行为克隆器;加上视频生成,模型被迫学习动态;加上目标检测和深度,模型被迫关注空间;加上任务状态,模型才有机会学习继续、停止、拒绝和恢复。
| 训练任务 | 更可能塑造的能力 | 仍需注意的边界 |
|---|---|---|
| 图像描述 / VQA | 语义理解、对象关系、语言 grounding | 不保证动作可执行 |
| 目标检测 / 轨迹预测 | 空间定位、对象运动、可达性线索 | 不等于接触动力学 |
| 视频生成 / 未来预测 | 动态先验、动作后果、短时 rollout | 画面真实不等于规划可靠 |
| 任务状态感知 | 继续、停止、无效指令、阶段判断 | 标签体系必须贴近真实任务 |
| 动作 chunk 预测 | 低延迟控制、连续执行 | 容易在 OOD 场景退化 |
这就是“任务决定系统特性”的意思。模型不会自动从数据里长出所有能力;训练目标没有要求它判断无效任务,它就很难学会拒绝;训练目标没有要求它从失败状态恢复,它就会把失败当作分布外噪声。
采样频率也是数据质量
用奈奎斯特定律作类比很有启发:如果采样频率低于信号最高频率的两倍,高频信号会混叠。放到机器人里,它不是严格数学证明,而是一个很实用的工程提醒。
机器人动作不是单帧标签,而是连续信号。接触、滑动、碰撞、夹爪闭合、末端微调、视觉遮挡和控制延迟,都可能发生在很短时间窗内。如果相机帧率、动作频率、本体状态记录和时间戳同步不足,数据里就会出现“看起来同一个状态对应多个动作”或“动作已经发生但状态还没反映”的错配。
这类错配会直接污染学习目标:
1 | 采样 / 同步不足 |
所以数据预处理不是附属工作。它是把物理过程重新对齐到可学习时间轴上的过程。没有这一步,后面的模型越大,只是越有能力拟合错误同步带来的伪模式。
Evaluation 要从 IID 换到 OOD 和闭环
真正的 OOD 测试,不应该是训练和测试都在同一套简洁场景里换几个 seed。更有诊断价值的设置是:简易场景 SFT,困难场景测试;干净场景训练,随机材质、背景、光照、相机、初态和语言模板测试;单一机器人训练,换未见机器人或未见末端接口测试。
Qwen-RobotManip 的一个重要提醒是,IID benchmark 上从零训练或小范围微调的模型也可能接近预训练模型;差距只有在 LIBERO-Plus、RoboTwin-Clean2Rand、RoboTwin-IF、RoboTwin-XE 这类 OOD 轴上才更清楚。换句话说,预训练质量应该用迁移难度来测,而不是只用同分布任务成功率来测。
评测还要进入闭环。一个模型会不会生成合理动作,只是第一层;它执行失败后能否识别失败、刷新真实观测、调整下一段动作、必要时拒绝或请求接管,才决定它是不是接近可用系统。
| 评测问题 | 更能暴露的能力 |
|---|---|
| 指令换写后是否仍执行正确目标 | 语言是否真的进入控制,而不是视觉模式匹配 |
| 背景、光照、物体布局变化后是否稳定 | 场景泛化和空间 grounding |
| 换机器人或末端执行器后是否仍有非零成功率 | action representation 和 motion alignment |
| 故意制造抓偏、滑落、遮挡后能否恢复 | 失败识别、重新规划和闭环修正 |
| 给出不存在目标或危险指令时是否拒绝 | 任务状态、安全边界和无效任务判断 |
这也是我认为“数据层 vs 功能层”需要合起来看的原因。数据层提供经验,功能层决定模型如何消费经验;评测层再反过来告诉你数据池缺哪类经验。缺少这个回路,数据扩充很容易变成一次性堆料。
我的判断
具身智能的数据鸿沟会先以“对齐工程”的形式被跨过去,而不是被某个单一模型结构瞬间抹平。未来一段时间,最重要的能力可能不是谁又多收了多少小时数据,而是谁能把这些数据变成更干净的状态、动作、几何、任务和失败回流。
我会用五个问题判断一条具身路线是否真的在跨越数据鸿沟:
- 它是否把不同机器人动作映射到可共享的物理语义,而不是只做维度补零;
- 它是否让视觉、深度、本体、指令、历史和动作在时间轴上对齐;
- 它是否用未来预测、任务状态、空间任务和动作预测共同约束内部表征;
- 它是否把失败、人工纠正、无效任务和部署分布放回数据池;
- 它是否用 OOD 和闭环评测,而不是只用同分布 benchmark 证明规模收益。
如果这五个问题有答案,数据规模才会从“更多样本”变成“更多可复用经验”。如果没有答案,所谓跨越数据鸿沟,很可能只是把鸿沟复制进训练集。
外部材料
- Qwen-RobotManip arXiv 与 Qwen 官方页:理解 alignment unlocks scale、80 维动作空间、H2R 合成和 OOD 评测。
- DreamZero:理解 WAM 如何把未来视频和动作联合建模。
- π0.5:理解开放世界 VLA 如何通过异构任务和数据共训练获得泛化。
- Fast-WAM:理解训练期视频共训练与推理期未来生成的区别。
- Motus:理解 MoT、latent action 和多模式世界动作模型。
- Depth Anything 3:理解深度和 ray 表示怎样把视觉日志转成几何资产。
- Title: 思考探索:具身智能的数据鸿沟:先对齐,再扩规模
- Author: Charles
- Created at : 2026-08-03 09:00:00
- Updated at : 2026-08-03 09:00:00
- Link: https://charles2530.github.io/2026/08/03/ai-files-thinking-exploration-embodied-ai-data-gap-alignment-and-scaling-0731-1219/
- License: This work is licensed under CC BY-NC-SA 4.0.