材料范围与核验日期。 材料由一份技术交流 PPT 重构,重点核验了 Vision Banana、DriveLaW、Drive-JEPA、SparseWorld、DriveFuture、DreamZero 和 WAM-Nav 的论文、项目页或官方仓库。Checked Date:2026-07-10。相关实验结果均为作者报
-
思考探索:具身智能的可纠错状态链:动作之外,系统还要记录什么
一次抓杯失败,可能来自深度、任务阶段、坐标映射、控制延迟,也可能发生在夹爪接触后的滑动。20 篇具身智能论文反复碰到同一个困难:动作头只能回答模型此刻想做什么,真实机器人还得知道场景现在是什么样、任务进行到了哪里、控制器实际执行了什么,以及失败后世界还剩下什么状态。 少一项,闭环里就会出现无法定位的断点。系统仍可继续输
-
思考探索:高效 AI 的状态账本:少搬状态,比少算一次更重要
过去我理解高效 AI,首先会数 FLOPs:矩阵乘少了多少,attention block 跳过多少,模型调用减少几次。连续读完这一组训练与推理论文后,我更在意另一张账:一次训练或生成里,系统保存了哪些状态,这些状态被复制几份,何时跨设备搬运,又在什么时刻才真正需要完整物化。 这里的“状态”范围很宽。参数、梯度和 Ad
-
思考探索:扩散模型加速:每删一步,都要重新安排误差
读完这一组论文,我不再把少步生成理解成“原路径的快捷播放”。多步采样里的每一段时间,都承担了一部分结构、运动、纹理和误差修正。删掉步骤不会让这些责任消失,只会迫使训练目标、学生模型、在线 critic、采样器或系统模块接手。 所以我对扩散加速形成了一个简单判断: 步数可以减少,误差不会凭空消失;好方法的区别,在于它把误
-
强化学习:VLA、机器人与闭环强化学习
Vision-Language-Action(VLA)模型把视觉观察和语言任务映射为机器人动作。能预测示范动作只是起点:真实机器人还要在部分可观测、连续控制和安全约束下反复执行、重新观察、恢复失败。闭环强化学习关注的是这条执行链最终能否提高回报与成功率,而不是单帧动作误差是否更小。 本章回答什么 本章回答:机器人为什么
-
强化学习:Agent、环境与训练闭环
本章回答什么 强化学习训练到底在循环什么?本章用一个仓储机器人任务回答:环境如何产生数据,policy 如何选择动作,一批 trajectory 又如何变成 return、advantage 或 target,最后更新 policy。 读完后,你应能从一次 environment step 追到一次参数更新,并说明为什
-
强化学习:Q-learning 与 DQN
本章回答什么 怎样从 TD prediction 走到离散动作控制,又怎样把 Q-table 换成神经网络而不让 bootstrap 目标不断追逐自己?本章先划清 SARSA 与 Q-learning 的 on-policy / off-policy 边界,再解释 DQN 的函数逼近、experience replay
-
强化学习:综合实践与算法选择
本章回答什么 算法选择要检查任务信息、动作、数据和证据是否满足算法假设。下面用一套紧凑决策流程和三个可执行 capstone 检查:GridWorld 的模型与 terminal mask、Pendulum 的连续控制更新、verifier LLM 的组内 advantage 与策略约束。 完成后应能写出选择理由、运行
-
强化学习:Policy Gradient 与 REINFORCE
本章回答什么 动作来自随机采样,尤其是离散 action 时,梯度从哪里来?Policy Gradient 不对采出的 action id 求导,而是用 score-function estimator 提高高回报动作的 log probability。REINFORCE 是这条思路最直接的 Monte Carlo 实
-
强化学习:Offline Reinforcement Learning
Offline Reinforcement Learning(Offline RL)只使用已经记录好的固定数据集训练策略,不在训练期间向环境请求新 transition。它适合机器人、医疗流程和推荐系统这类真实探索昂贵或危险的场景,但也把一个问题放到中心:策略一旦选择数据集没有覆盖的动作,价值估计还能不能相信? 本章回