思考探索:具身智能的数据鸿沟:先对齐,再扩规模

思考探索:具身智能的数据鸿沟:先对齐,再扩规模

Charles Lv8

“跨越数据鸿沟”最值得保留的判断,不是把数据说成万能药,而是把数据问题拆成了一个更硬的工程问题:机器人数据只有在表示、动作、任务和评测都能对齐之后,规模才会变成能力。否则,更多小时数可能只是把更多坐标系、更多动作接口、更多噪声和更多伪相关塞进同一个模型。

这也是为什么我更愿意把当前具身智能的瓶颈写成:

1
2
3
数据规模
x 对齐之后 -> 经验覆盖、泛化、任务迁移
x 未对齐时 -> 多源冲突、负迁移、IID 高分、OOD 失效

这里的“对齐”不是抽象口号。它至少包括四层:模态是否完整,动作空间是否可共享,任务目标是否足够丰富,评测分布是否真的离开训练分布。每一层没处理好,都会把看似宝贵的数据变成训练里的干扰项。

数据鸿沟不是只有“少”

机器人领域当然缺数据。真机采集贵,失败样本难拿,长时任务难标,跨机器人数据格式混乱。但如果只把数据鸿沟理解为“小时数太少”,就会漏掉更核心的问题:现有数据经常不能被同一个学习目标稳定消费。

鸿沟 具体表现 训练里的后果
模态鸿沟 视觉多,触觉、力觉、深度、声音和本体状态不完整 模型只能从图像外观猜物理属性,接触和重量常识薄弱
标准鸿沟 不同数据集的相机、坐标系、动作频率、标注和存储格式不同 多源数据难以合并,统一训练时容易互相污染
硬件鸿沟 单臂、双臂、灵巧手、移动底盘和人形机器人的自由度不同 同一个物理动作在数值上不相似,迁移需要重新适配
虚实鸿沟 仿真延迟、噪声、摩擦、接触和视觉质量过于理想 仿真成功率高,真机部署后失败模式集中爆发

所以更稳的判断是:数据鸿沟的第一层不是“没有数据”,而是 xy 的格式没有统一语言。x 是视觉、本体、语言、历史、几何和任务状态;y 是动作、未来观测、成功/失败、风险分数和恢复路径。只要 xy 的语义不稳定,模型就很难学到可迁移的结构。

世界模型为什么会进入主线

传统 VLA 可以粗略写成:

1
observation + language -> action

这条路线有巨大价值,因为它把 VLM 的语义能力接到了机器人动作。但它也容易把训练压成动作标签回归。模型知道当前图像和指令应该对应哪段动作,却不一定被迫解释“这段动作之后世界会怎样变化”。

WAM 和世界模型路线把目标改成:

1
2
history observation + language + robot state
-> future state / future video + action

关键差异不在于一定要生成更漂亮的视频,而在于未来预测给动作学习提供了密集动态监督。动作不再只是孤立标签,而要和未来视觉、几何状态和真实观测刷新互相约束。

DreamZero joint video and action

图源:DreamZero,原论文 Figure 2。读图重点:WAM 的训练信号同时包含未来视频和动作,动作需要和预测到的世界变化相互支持。

DreamZero 代表的是“协同预测动作与视频”:把 future video latent 和 action chunk 放进同一个生成过程。LingBot-VALingBot-VA 2.0 更强调因果视频动作建模、异步执行和语义动作对齐。Fast-WAM 则给出一个重要边界:视频共训练的主要价值可能在训练期塑造世界表征,推理时未必总要显式生成未来视频。

这几条路线合起来,能得到一个更克制的结论:

1
2
预测未来不是目的,
让动作学习被未来状态约束,才是目的。

如果任务需要长时规划、反事实比较和候选策略评估,显式想象仍然有价值;如果任务更看重低延迟闭环控制,未来预测也可以退到训练目标和 latent 表征里。视频只是当前最方便的世界状态载体,不是世界模型的终点。

MoT 是接口设计,不是魔法模块

这条主线里反复出现的 MoT 思路,可以稳一点读成:具身模型正在把“理解、视频动态、动作生成”拆成不同专家,再通过共享注意力或联合调度交换信息。原因很直接:语义理解、视频预测和动作控制的频率、尺度、损失函数都不同,强行用一个完全同质的 backbone 可能互相拖累。

专家 主要学习对象 常见风险
Understanding expert 语言、物体、场景语义、指令约束 只懂语义,不懂接触和可达性
Video / world expert 未来视觉、运动趋势、场景动态 画面合理但动作不可执行
Action expert 连续动作块、末端运动、关节控制 训练分布内拟合强,跨硬件迁移弱

Motus 把这件事做成统一生成框架:VLA、world model、inverse dynamics、video generation 和 video-action joint prediction 都可以看成同一组视频/动作变量在不同条件下的生成问题。它的关键不是名字里的 unified,而是用 latent action 和调度器把不同任务变成可以切换的模式。

这也是“任务扩充”的含义。多任务不是为了让模型看起来全能,而是让不同监督信号约束同一个内部状态:图像描述约束语义,目标定位约束空间,视频生成约束动态,动作预测约束控制,任务状态约束停止、拒绝和恢复。

Qwen-RobotManip 的启示:对齐释放规模

Qwen-RobotManip 把“先对齐,再扩规模”讲得最直接。它的题目就是 Alignment Unlocks Scale。机器人数据不像文本那样天然共享一个 token space:不同机器人有不同自由度、末端坐标系、相机位姿、动作频率、夹爪接口和遥操作协议。直接拼起来,模型看到的“同一个物理动作”可能在数值上完全不像。

Qwen-RobotManip overview

图源:Qwen-RobotManip,原论文 Figure 1。读图重点:Qwen-RobotManip 用统一 80 维 state/action 表示、camera-frame EEF 动作和历史 context,把不同机器人操作数据投到更可共享的接口里。

它的三层对齐很有参考价值。

对齐层 机制 解决的问题
Representation alignment 统一 80 维 state/action 模板和 mask 不同 embodiment 的状态、动作维度不一致
Motion alignment camera-frame end-effector delta pose 相似末端运动在不同机器人坐标下数值差异过大
Behavior alignment structured embodiment prompt + episode history context 静态机器人标签不足以描述当前任务阶段和执行风格

这比“堆数据”更具体。只有当相似物理运动在表示空间里也相似,模型才可能从 ALOHA、UR、Franka、人类第一视角视频和合成数据之间抽出共同结构。

Qwen-RobotManip 的数据引擎也很典型:开源机器人数据约 11,000 小时,人类第一视角视频约 1,900 小时,人到机器人合成数据约 24,800 小时,总计约 38,100 小时。这个数字要谨慎读:24,800 小时不是等价真实机器人遥操作时长,而是从人类视频 retarget、分割、inpainting、仿真渲染和深度引导合成出来的扩展数据。

Human-to-robot pipeline

图源:Qwen-RobotManip,原论文 Figure 2。读图重点:human-to-robot synthesis 不是简单把人手视频当机器人数据,而是经过动作 retarget、平滑、手臂分割、背景补全、机器人渲染和深度合成。

这里能带走的不是某个具体数字,而是一条数据工程原则:合成数据要先通过接口对齐,才可能变成动作学习资产。否则它只是在训练集里增加看起来像机器人、实际上控制语义不稳定的视频。

Scaling 的三个台阶

把这条主线抽象出来,具身智能的 scaling 可以分三步。

第一步,对齐数据。

先处理机器人数据自身的格式、坐标、动作和质量问题。突变检测、极值过滤、状态动作趋势对齐、运动学一致性校验、坐标系方向统一,这些听起来不像模型创新,却决定了后续训练是否稳定。真实机器人数据的珍贵不只在“拍到了”,还在每一帧是否能和动作、状态、指令、任务阶段对上。

第二步,用不同领域构造全模态数据。

分割模型提供目标和手臂 mask,深度模型提供几何线索,VLM 生成任务解释和质量检查,inpainting 模型移除或替换视觉目标,仿真系统补长尾场景。这里的数据引擎更像一个工具链:

1
2
3
4
5
raw video / robot logs
-> segmentation / depth / trajectory / language annotation
-> quality judge
-> simulation or human-to-robot synthesis
-> aligned data pool

这条线和 Depth Anything 3SpatialVLA、Qwen-RobotManip 里的 H2R pipeline 是同一类问题:机器人不能只靠 RGB 外观学操作,必须把普通视频和日志转成空间、动作、任务都能索引的经验。

第三步,扩充训练任务。

数据规模解决覆盖,任务设计决定系统特性。只做动作预测,模型会更像行为克隆器;加上视频生成,模型被迫学习动态;加上目标检测和深度,模型被迫关注空间;加上任务状态,模型才有机会学习继续、停止、拒绝和恢复。

训练任务 更可能塑造的能力 仍需注意的边界
图像描述 / VQA 语义理解、对象关系、语言 grounding 不保证动作可执行
目标检测 / 轨迹预测 空间定位、对象运动、可达性线索 不等于接触动力学
视频生成 / 未来预测 动态先验、动作后果、短时 rollout 画面真实不等于规划可靠
任务状态感知 继续、停止、无效指令、阶段判断 标签体系必须贴近真实任务
动作 chunk 预测 低延迟控制、连续执行 容易在 OOD 场景退化

这就是“任务决定系统特性”的意思。模型不会自动从数据里长出所有能力;训练目标没有要求它判断无效任务,它就很难学会拒绝;训练目标没有要求它从失败状态恢复,它就会把失败当作分布外噪声。

采样频率也是数据质量

用奈奎斯特定律作类比很有启发:如果采样频率低于信号最高频率的两倍,高频信号会混叠。放到机器人里,它不是严格数学证明,而是一个很实用的工程提醒。

机器人动作不是单帧标签,而是连续信号。接触、滑动、碰撞、夹爪闭合、末端微调、视觉遮挡和控制延迟,都可能发生在很短时间窗内。如果相机帧率、动作频率、本体状态记录和时间戳同步不足,数据里就会出现“看起来同一个状态对应多个动作”或“动作已经发生但状态还没反映”的错配。

这类错配会直接污染学习目标:

1
2
3
4
5
采样 / 同步不足
-> state-action lag
-> 趋势方向不一致
-> action chunk 边界抖动
-> 模型学到平均动作或延迟动作

所以数据预处理不是附属工作。它是把物理过程重新对齐到可学习时间轴上的过程。没有这一步,后面的模型越大,只是越有能力拟合错误同步带来的伪模式。

Evaluation 要从 IID 换到 OOD 和闭环

真正的 OOD 测试,不应该是训练和测试都在同一套简洁场景里换几个 seed。更有诊断价值的设置是:简易场景 SFT,困难场景测试;干净场景训练,随机材质、背景、光照、相机、初态和语言模板测试;单一机器人训练,换未见机器人或未见末端接口测试。

Qwen-RobotManip 的一个重要提醒是,IID benchmark 上从零训练或小范围微调的模型也可能接近预训练模型;差距只有在 LIBERO-Plus、RoboTwin-Clean2Rand、RoboTwin-IF、RoboTwin-XE 这类 OOD 轴上才更清楚。换句话说,预训练质量应该用迁移难度来测,而不是只用同分布任务成功率来测。

评测还要进入闭环。一个模型会不会生成合理动作,只是第一层;它执行失败后能否识别失败、刷新真实观测、调整下一段动作、必要时拒绝或请求接管,才决定它是不是接近可用系统。

评测问题 更能暴露的能力
指令换写后是否仍执行正确目标 语言是否真的进入控制,而不是视觉模式匹配
背景、光照、物体布局变化后是否稳定 场景泛化和空间 grounding
换机器人或末端执行器后是否仍有非零成功率 action representation 和 motion alignment
故意制造抓偏、滑落、遮挡后能否恢复 失败识别、重新规划和闭环修正
给出不存在目标或危险指令时是否拒绝 任务状态、安全边界和无效任务判断

这也是我认为“数据层 vs 功能层”需要合起来看的原因。数据层提供经验,功能层决定模型如何消费经验;评测层再反过来告诉你数据池缺哪类经验。缺少这个回路,数据扩充很容易变成一次性堆料。

我的判断

具身智能的数据鸿沟会先以“对齐工程”的形式被跨过去,而不是被某个单一模型结构瞬间抹平。未来一段时间,最重要的能力可能不是谁又多收了多少小时数据,而是谁能把这些数据变成更干净的状态、动作、几何、任务和失败回流。

我会用五个问题判断一条具身路线是否真的在跨越数据鸿沟:

  1. 它是否把不同机器人动作映射到可共享的物理语义,而不是只做维度补零;
  2. 它是否让视觉、深度、本体、指令、历史和动作在时间轴上对齐;
  3. 它是否用未来预测、任务状态、空间任务和动作预测共同约束内部表征;
  4. 它是否把失败、人工纠正、无效任务和部署分布放回数据池;
  5. 它是否用 OOD 和闭环评测,而不是只用同分布 benchmark 证明规模收益。

如果这五个问题有答案,数据规模才会从“更多样本”变成“更多可复用经验”。如果没有答案,所谓跨越数据鸿沟,很可能只是把鸿沟复制进训练集。

外部材料

  • Qwen-RobotManip arXivQwen 官方页:理解 alignment unlocks scale、80 维动作空间、H2R 合成和 OOD 评测。
  • DreamZero:理解 WAM 如何把未来视频和动作联合建模。
  • π0.5:理解开放世界 VLA 如何通过异构任务和数据共训练获得泛化。
  • Fast-WAM:理解训练期视频共训练与推理期未来生成的区别。
  • Motus:理解 MoT、latent action 和多模式世界动作模型。
  • Depth Anything 3:理解深度和 ray 表示怎样把视觉日志转成几何资产。
  • Title: 思考探索:具身智能的数据鸿沟:先对齐,再扩规模
  • Author: Charles
  • Created at : 2026-08-03 09:00:00
  • Updated at : 2026-08-03 09:00:00
  • Link: https://charles2530.github.io/2026/08/03/ai-files-thinking-exploration-embodied-ai-data-gap-alignment-and-scaling-0731-1219/
  • License: This work is licensed under CC BY-NC-SA 4.0.
Comments