世界模型高效训练的技术矩阵要回答三件事:某项技术到底省哪类成本,证据在哪里,还不能证明什么。

图源:Towards Video World Models Figure 2(可从论文标题 arXiv 检索核对)。原图表达 internal world model、external world model、video world model、simulation platform 和 neural 3D/4D 的位置关系;读图重点是:效率技术必须先落到“表示、训练系统、推理、验证”中的某个成本层。它不能证明某项技术已经具备闭环控制收益,只提供分类坐标。
数据效率
表示效率
训练系统效率
| 效率技术 |
解决的成本 |
站内入口 |
原始证据 |
缺口 / 不能证明 |
| Activation checkpointing |
长轨迹激活显存 |
训练 |
通用训练系统实践 |
增加重算,需确认 recurrent state 和 mask 一致 |
| Sequence packing |
padding、无效 attention |
高效训练路线图 |
站内 4 路相机 token 账 |
不能让不同 episode 互相可见 |
| FSDP / ZeRO |
optimizer、gradient、parameter state |
训练 |
ZeRO 专题 |
通信和 checkpoint I/O 可能成为新瓶颈 |
| MagiAttention |
异构 mask 长上下文通信和负载不均 |
MagiAttention 专题 |
MagiAttention docs / benchmark |
只证明系统吞吐,不证明 dynamics 更准 |
| Low-bit training / FP8 |
显存、带宽、通信 payload |
低比特训练 |
站内低比特与技术报告专题 |
reward/risk/action head 需要精度保护 |
推理效率
| 效率技术 |
解决的成本 |
站内入口 |
原始证据 |
缺口 / 不能证明 |
| KV cache / GQA |
rollout decode 显存和带宽 |
推理成本建模 |
高效训练路线图 KV 账 |
KV 变小不保证候选动作排序不变 |
| KVSlimmer |
长上下文 KV 合并和 decoder 开销 |
KVSlimmer 专题 |
KVSlimmer |
文本长上下文收益不能直接外推到动作分叉 |
| Low-bit KV |
KV 显存、HBM 带宽 |
量化 |
站内量化与 KV cache 页面 |
risk / action head 仍需回归测试 |
| CausVid / DMD |
少步视频 rollout、streaming latency |
CausVid 专题 |
CausVid paper result |
视频延迟下降不等于 planning utility |
| SLO / batching |
端到端延迟、并发容量 |
推理成本建模 |
系统日志或压测 |
P95/P99 变好不证明模型更安全 |
验证效率
| 效率技术 |
解决的成本 |
站内入口 |
原始证据 |
缺口 / 不能证明 |
| Action sensitivity |
无效视频 demo、动作不敏感模型 |
世界模型评测 |
mini-chain 报告样例 |
单一反事实测试不能覆盖所有风险 |
| Closed-loop gain |
open-loop 指标和真实决策脱节 |
世界模型评测 |
Dreamer / V-JEPA 2-AC 等闭环设置 |
成功率需要配合失败桶和成本账 |
| Risk calibration |
near-miss 漏报、安全错判 |
不确定性与风险敏感规划 |
mini-chain risk ECE 示例 |
小样本 ECE 不能证明部署安全 |
| Failure replay |
失败不可复盘、数据回流低效 |
端到端案例 |
Toy fixture failure replay |
需要真实视频、预测、动作和人工标签 |
读完怎么用
- 如果你在做方案设计,先从“解决的成本”定位路线。
- 如果你在写博客或论文笔记,至少引用“原始证据”和“缺口 / 不能证明”两列。
- 如果你在做实验,进入 完整实验报告样例,按数据、配置、系统账、评测和失败归因写证据链。