VLM/VLA 里的公式不应该被当成符号表背诵。它们大多在回答三件事: 读公式时先问四个问题:输入是什么,输出是什么,时间下标 表示哪一刻,模型是在回答“理解”“行动”还是“预测后果”。只要这四件事清楚,公式就不再是装饰。 图源:RT-2 project page / 论文。原图表达视觉语言模型如何把网络知识和
-
世界模型:Rollout 服务、量化与 Kernel:省成本不能省掉动作因果
世界模型进入系统后,问题会从“模型能不能预测未来”变成“能不能在规划器等待窗口内,以可接受成本预测多条候选未来”。这时量化、KV cache、少步视频生成、长上下文 attention 和 kernel 调度都会进入同一条链。 降低 rollout 成本时,必须同时证明动作分叉、风险判断和闭环收益没有被压坏。 Roll
-
世界模型:VLA 到世界模型:一条机器人闭环链路怎么搭
VLA、世界模型、训练系统和评测经常被分开讲,但真实项目里它们必须接成一条链:机器人数据给出观测和动作,VLA 产生候选动作,世界模型预测动作后果,评测系统判断这些预测是否真的改善闭环决策。 做“机器人数据 + VLA 动作 + 世界模型预测 + 闭环评测”方案时,每一层都要讲清输入、输出、证据和失败边界。 数据和动作
-
世界模型:高效训练完整实验报告样例
world-model-mini-chain fixture 展示一条小型世界模型训练链路:数据、训练配置、系统成本、闭环指标、失败归因和改进计划必须放在同一条证据链里。它不证明真实模型效果,只说明这些证据如何一起支持训练判断。 摘要 任务是桌面机器人动作条件世界模型的最小评测:给定多相机历史、语言目标、本体状态和候选
-
世界模型:高效训练效率技术覆盖矩阵
世界模型高效训练的技术矩阵要回答三件事:某项技术到底省哪类成本,证据在哪里,还不能证明什么。 图源: Towards Video World Models Figure 2(可从论文标题 arXiv 检索核对)。原图表达 internal world model、external world model、video w
-
世界模型:Masked / JEPA 与潜变量预测:先学状态,再接动作
世界模型常被想象成“给当前画面和动作,生成未来视频”。这当然是一条路线,但不是唯一入口。对规划和控制来说,模型真正需要保住的是会改变动作选择的状态:物体位置、速度、接触、遮挡、任务阶段、风险、奖励和终止。高清纹理、背景光照、阴影细节有时只是昂贵的旁枝。 Masked / JEPA 路线的核心问题是: 能不能先学一个更像
-
世界模型:WM / WAM / VAM:动作到底怎样进入世界模型
近两年,世界模型、视频模型和机器人策略越来越容易被写到同一篇论文里:有的给动作预测未来,有的直接从视觉语言输出动作,有的把未来视频和未来动作一起生成。 WM / WAM / VAM 不是统一标准术语,但很适合作为读论文的接口坐标系。 动作在模型里放在哪里,决定了世界模型能不能服务规划和控制。 不要先问模型名字。先问四件
-
世界模型:不确定性与风险敏感规划
世界模型如果只输出一个“最可能的未来”,在高风险决策里往往不够。机器人、自动驾驶和复杂 agent 系统真正关心的不只是平均回报最大,而是在不确定未来里哪些动作更安全,哪些动作期望高但尾部风险不可接受。 不确定性建模与风险敏感规划,是把世界模型从平均预测器提升为安全决策工具的关键。 硬证据模块:风险页要优先证明“不漏报
-
世界模型:模拟器、反事实与合成 Rollout
世界模型一旦不仅用于预测未来,而开始指导下一步收什么数据、在哪些场景做验证、如何构造高价值训练样本,就会自然走向模拟器、反事实生成和合成 rollout 数据。这条路线的核心是让 imagined data 服务长尾风险覆盖、失败恢复、planner warmup、策略改进和数据引擎闭环。 硬证据模块:合成 rollo
-
世界模型:RSSM、Dreamer 与规划:世界模型怎样变成控制信号
Dreamer 这条线要回答的是:真实环境交互很贵时,能不能先学一个内部环境,再让策略在这个内部环境里练习。RSSM 是这个内部环境的状态骨架,PlaNet 用它在线搜索动作,Dreamer 用它批量想象轨迹来训练 actor-critic。 如果只记一个判断: posterior 用真实观测校正现在,prior 在没