论文题名: Motus: A Unified Latent Action World Model。 作者: Hongzhe Bi、Hengkai Tan、Shenghao Xie、Zeyuan Wang、Shuhe Huang、Haitian Liu、Ruowen Zhao、Yao Feng、Chendong Xian
-
论文专题讲解:VGGT-Ω:几何重建怎样变成具身空间表征
论文题名: VGGT-Ω。 作者: Jianyuan Wang、Minghao Chen、Shangzhan Zhang、Nikita Karaev、Johannes Schönberger、Patrick Labatut、Piotr Bojanowski、David Novotny、Andrea Vedaldi、Ch
-
论文专题讲解:Fast-WAM:WAM 一定要推理时想象未来吗
论文题名: Fast-WAM: Do World Action Models Need Test-time Future Imagination?。 作者: Tianyuan Yuan、Zibin Dong、Yicheng Liu、Hang Zhao。 机构: IIIS, Tsinghua University;Gal
-
思考探索:世界模型 Infra:从模型谱系到物理 AI 工程栈
世界模型已经不只是一个算法名词。早期 PlaNet、Dreamer、MuZero 让我们看到:agent 可以先学习环境动力学,再在内部 rollout、搜索或训练策略。后来的 V-JEPA、Genie、GAIA-1、Sora 2、NVIDIA Cosmos 又把这个问题推向更大的尺度:视频、动作、语言、3D、仿真和合
-
论文专题讲解:D4RT:动态场景的 4D 重建与跟踪
论文题名: Efficiently Reconstructing Dynamic Scenes One D4RT at a Time。 作者: Chuhan Zhang、Guillaume Le Moing、Skanda Koppula、Ignacio Rocco、Liliane Momeni、Junyu Xie、Sh
-
论文专题讲解:kai0:资源受限下的高可靠机器人操作
论文题名: χ₀: Resource-Aware Robust Manipulation via Taming Distributional Inconsistencies。 作者: Checheng Yu、Chonghao Sima、Gangcheng Jiang、Hai Zhang、Haoguang Mai、Hon
-
具身智能:机器人数据里的 `state` 和 `action`:不要被字段名骗了
具身智能的入门很容易从模型名开始:VLA、Diffusion Policy、ACT、RT-2。可是训练真正落到机器人数据时,最先撞上的问题通常更朴素:一行数据里有 observation.state ,还有 action ,它们维度相同、数值也很像,那模型到底在学什么? 结论先放前面: 字段名不决定语义,数据采集和控制
-
思考探索:WAM 与 3D 视觉:世界模型从视频想象走向物理闭环
关注的问题。 World Action Models 与 3DV in WM 如何从视频想象走向机器人可用的物理闭环。 2026 年具身智能里,世界模型和 WAM 迅速升温,真正值得追问的是 世界模型到底怎样变成机器人可用的物理闭环 。 如果只从概念上讲,WAM 很容易被理解成“视频生成模型加动作头”。但结合 Drea
-
论文专题讲解:World Model for Robot Learning:机器人学习世界模型综述
论文题名: World Model for Robot Learning: A Comprehensive Survey。 作者: Bohan Hou、Gen Li、Jindou Jia、Tuo An、Xinying Guo、Sicong Leng、Haoran Geng、Yanjie Ze、Tatsuya Harad
-
知识问答:具身智能与 VLA QA
具身智能、VLA、机器人数据和闭环部署的高频问题,通常卡在能力外推:把 VLM 能力、视频生成能力、离线指标或 demo 结果过度推到真实机器人执行。 基础定义与系统边界 Q:具身智能和普通多模态 AI 的关键区别是什么? 面试回答。 普通多模态 AI 多数停留在感知和问答:看图、读视频、回答问题。具身智能要让智能体在