世界模型与规划有一条重要线索:规划不一定只能写成显式搜索或值函数优化,也可以写成推断问题。与此同时,复杂动作空间直接规划太难,很多系统会把动作片段压缩成潜在动作或技能代码,再在更紧凑的空间里做推理。 规划即推理、潜在动作和 WM / WAM / VAM 连接三件事:奖励最大化如何改写成后验推断,潜在动作为什么适合高维控
-
世界模型:生成式模拟与视频世界模型:从好看视频到可交互未来
视频世界模型很容易被误读成“更强的视频生成”。在世界模型语境里,它真正要回答的是:给定历史、动作、目标和场景约束,未来是否会以可验证、可交互、可用于决策的方式演化。 视频生成模型要补上动作因果、交互约束和评测接口,才能变成服务规划和数据回流的世界模型。 普通视频生成缺少动作因果 普通视频生成常建模: $$ p thet
-
世界模型:评测:不要让好看的未来骗过决策系统
评测世界模型时,最容易被一段漂亮视频带偏。视频很清晰、动作很顺、物体看起来也没穿模,但只要换一个候选动作,未来仍然差不多;或者 planner 按它的预测去执行,真实环境里马上碰撞、滑落、卡住。这样的模型可以是很强的视频模型,却还不是可靠的决策模型。 世界模型评测要判断模型是否改善动作选择、风险识别或数据回流,而不只是
-
世界模型:高效训练路线图
世界模型高效训练要在有限预算下回答一个工程问题: 怎样少用真实交互、少用视频 token、少占显存和通信、少花 rollout 延迟,同时还能让预测真的改善决策。 世界模型训练可以拆成五类成本、四条主要路线和一套证据判断方法。 中心问题:预测未来是为了选动作 一个面向决策的世界模型至少要建模: $$ p theta z
-
世界模型:开发路线:先把数据、动作和评测接成闭环
面向机器人任务开发世界模型,第一步是把“世界状态是什么、动作如何改变它、怎样判定成功”讲清楚。否则模型即使能生成未来,也不知道自己在预测哪个坐标系里的未来,更无法服务真实闭环。 能服务机器人任务的世界模型,需要把数据、几何、动作、仿真和评测接成闭环。 图源:Wikimedia Commons: Equipment fo
-
世界模型:数据引擎与自我改进
世界模型的长期价值,不只在于一次训练出一个“会想象未来”的模型,而在于它能否成为持续收集数据、发现盲点、生成新经验并反哺策略的核心引擎。世界模型不仅是预测器,也可能是数据调度器、失败分析器、样本筛选器和反事实生成器。 世界模型可以与主动采样、失败回流、near-miss 挖掘、仿真生成、人工反馈和门禁验证结合,形成持续
-
世界模型:机器人与自动驾驶中的世界模型
世界模型最有吸引力的落地场景,正是那些真实试错昂贵、长时规划重要、环境部分可观测且安全约束严格的系统。机器人与自动驾驶同时满足这几个条件,因此它们也是世界模型从“研究概念”走向“工程工具”的主战场。 不过,这两个领域虽然都适合世界模型,却并不相同。机器人更强调接触、操控、技能组合和低层闭环;自动驾驶更强调多主体交互、地
-
世界模型:动作条件视频世界模型端到端训练案例
动作条件视频世界模型可以从一个机器人桌面操作案例拆开:数据、视觉状态、动作接口、训练系统、rollout 推理、量化和闭环评测需要形成一条可复盘的技术链路。 任务设定 假设我们要训练一个模型,用于桌面机器人任务: 这个模型不是普通视频生成器。它必须满足四个条件: 1. 动作敏感 :同一历史下换动作,未来应合理分叉。 2
-
VLM/VLA:世界模型高效训练接口
如果主线是 世界模型的高效训练技术 ,VLM/VLA 不应只是前置知识,而应该被看成世界模型训练的数据接口、状态接口和验证接口。它们分别回答:视觉语言状态怎么来,动作怎么来,失败怎么回流,闭环收益怎么验证。 四个接口 接口 VLM/VLA 提供什么 世界模型用来做什么 高效训练收益 — --- — --- 状态
-
VLM/VLA:视觉 Tokenizer 与连接器:视觉证据怎样被压成可用 token
VLM/VLA 的第一道瓶颈是视觉证据怎样进入后续模型。图片、视频、多相机、深度、点云和机器人 proprioception 都不能原样无限塞进上下文;它们必须先被切成 token、压成 latent,或者通过 query / cross-attention 被抽取成少量证据。 视觉 tokenizer 和 conne