整理 Hexo、GitHub Pages 与 Redefine 主题搭建过程中的配置步骤、评论系统和常见问题。
-
Sticky
-
思考探索:世界模型该预测什么:答案取决于谁消费未来
把 PlaNet、Dreamer、V-JEPA 和 LingBot-World 放在一起,最先出现的冲突是:它们预测的对象不同,却都被称作世界模型。于是,“像素生成和 latent dynamics 谁更接近真正的世界模型”这个争论就问错了方向。 一段高清未来视频很容易检查,却可能没有严格响应动作;Dreamer 的
-
思考探索:世界模型是什么:从预测画面到承受行动后果
关注的问题。 当视频生成、3D 场景、机器人策略和强化学习都在使用“世界模型”这个词时,怎样给它一个既不过宽、也不把技术路线排除在外的定义? “世界模型”正在变成 AI 里最容易产生误会的词之一。能生成一段视频的模型、可编辑的 3D 场景、物理仿真器、Dreamer 一类的 latent dynamics,以及带视觉输
-
思考探索:读完 12 份技术报告:前沿模型正在变成受约束的闭环
把 12 份技术报告的目录并排,会看到一个反常现象:模型能力越强,报告花在数据、cache、rollout、工具环境和安全控制上的篇幅越多。 checkpoint 仍然重要,但它已经不足以描述一个前沿模型的真实能力。 同一份权重接入不同的 KV cache、thinking budget、工具环境或安全控制,会表现出显
-
思考探索:从预测未来到利用未来:Latent World Model 怎样进入规划闭环
材料范围与核验日期。 材料由一份技术交流 PPT 重构,重点核验了 Vision Banana、DriveLaW、Drive-JEPA、SparseWorld、DriveFuture、DreamZero 和 WAM-Nav 的论文、项目页或官方仓库。Checked Date:2026-07-10。相关实验结果均为作者报
-
思考探索:具身智能的可纠错状态链:动作之外,系统还要记录什么
一次抓杯失败,可能来自深度、任务阶段、坐标映射、控制延迟,也可能发生在夹爪接触后的滑动。20 篇具身智能论文反复碰到同一个困难:动作头只能回答模型此刻想做什么,真实机器人还得知道场景现在是什么样、任务进行到了哪里、控制器实际执行了什么,以及失败后世界还剩下什么状态。 少一项,闭环里就会出现无法定位的断点。系统仍可继续输
-
思考探索:高效 AI 的状态账本:少搬状态,比少算一次更重要
过去我理解高效 AI,首先会数 FLOPs:矩阵乘少了多少,attention block 跳过多少,模型调用减少几次。连续读完这一组训练与推理论文后,我更在意另一张账:一次训练或生成里,系统保存了哪些状态,这些状态被复制几份,何时跨设备搬运,又在什么时刻才真正需要完整物化。 这里的“状态”范围很宽。参数、梯度和 Ad
-
思考探索:扩散模型加速:每删一步,都要重新安排误差
读完这一组论文,我不再把少步生成理解成“原路径的快捷播放”。多步采样里的每一段时间,都承担了一部分结构、运动、纹理和误差修正。删掉步骤不会让这些责任消失,只会迫使训练目标、学生模型、在线 critic、采样器或系统模块接手。 所以我对扩散加速形成了一个简单判断: 步数可以减少,误差不会凭空消失;好方法的区别,在于它把误
-
强化学习:VLA、机器人与闭环强化学习
Vision-Language-Action(VLA)模型把视觉观察和语言任务映射为机器人动作。能预测示范动作只是起点:真实机器人还要在部分可观测、连续控制和安全约束下反复执行、重新观察、恢复失败。闭环强化学习关注的是这条执行链最终能否提高回报与成功率,而不是单帧动作误差是否更小。 本章回答什么 本章回答:机器人为什么
-
强化学习:Agent、环境与训练闭环
本章回答什么 强化学习训练到底在循环什么?本章用一个仓储机器人任务回答:环境如何产生数据,policy 如何选择动作,一批 trajectory 又如何变成 return、advantage 或 target,最后更新 policy。 读完后,你应能从一次 environment step 追到一次参数更新,并说明为什