具身智能一旦离开实验室,面对的就不再是“平均成功率”,而是具体责任边界、真实物理风险和持续运营问题。部署模式决定系统怎样接入业务流程,安全案例则回答一个更根本的问题:为什么我们相信它足够安全、何时必须回退、出了问题如何追责与修复。 为什么具身智能部署比纯软件系统难 对话系统的错误常常是答非所问,而机器人的错误会表现为撞
-
具身智能:一个任务跑通具身闭环:从看见到失败回流
具身智能最容易在抽象层面讲得很漂亮:VLA、WAM、世界模型、planner、controller、success checker 全都重要。但真正理解它,最好从一个任务走一遍。 把圆柱体放进罐口尺寸接近的罐子,看起来像普通 pick-and-place,实际会同时考察尺寸感知、目标绑定、抓取、路径规划、动作执行、成功
-
具身智能:相机、深度与机器人视觉:图像怎样接回 3D 世界
机器人看到的“图像”并不天然等于 3D 世界。相机类型、标定、深度质量和坐标系会决定机器人能不能估距离、能不能恢复物体尺寸、能不能把视觉结果交给抓取和规划模块。 从 RGB 图像到机器人可用的 3D 状态,需要经过相机模型、深度估计、坐标转换和任务接口。 单目为什么有尺度歧义 单目相机只有一个视角。它把 3D 世界投影
-
具身智能:基础:观测、动作与反馈闭环
具身系统通过身体与环境交换信息和作用:传感器提供有限、延迟且带噪的观测,策略提出动作,规划与控制把动作变成物理执行,环境返回新的状态。能力来自整条反馈链,而不是单独一个视觉模型、语言模型或动作网络。 具身智能的系统坐标包括:任务与运行边界怎样定义;观测、状态和动作怎样组成 episode;VLA、policy、plan
-
具身智能:资产到轨迹:机器人数据生产线怎么跑通
仿真机器人数据集不是“收集一批 3D 模型”这么简单。一个资产要进入机器人训练,必须同时有视觉外观、真实尺寸、物理属性、碰撞体、抓取标注、任务脚本、轨迹规划和成功判定。缺其中一环,数据看起来很多,训练时却很难复现失败。 从一个物体资产到一条可训练的机器人轨迹,中间要经过感知、抓取、轨迹、记录和评测等环节。 图源:Spa
-
扩散模型:视频与多模态扩散:视频不是把图片多画几帧
图像扩散只要生成一个静态样本,视频扩散要生成一段会动的样本。这个变化看起来只是多了时间轴,实际会把训练、架构、条件控制和评测全部变复杂。 视频扩散不能简单照搬图像扩散;现代视频生成系统要靠 tokenizer、时空主干、条件接口、采样路径和评测一起撑住质量、运动和成本。 视频扩散的核心是同时满足五件事:视频压缩器不能先
-
扩散模型:DDPM 数学与训练:从前向高斯链到噪声预测
DDPM 把生成问题写成两个方向相反的过程:前向过程用固定高斯转移逐步破坏数据,反向过程用神经网络近似未知的反向条件分布。训练的关键,是利用已知前向过程把变分目标转成不同噪声水平上的监督回归。 DDPM 数学需要连接六个对象:逐步前向转移 $q x t mid x t-1 $、任意时刻的闭式边缘 $q x t mid
-
扩散模型:Score Matching 到 SDE:扩散模型到底在学哪一个方向
扩散模型表面上是在预测噪声,采样时又像在逐步去噪。更统一的读法是:模型在每个噪声水平上学习一个方向场,告诉当前样本应该往哪里移动,才能从噪声分布回到数据分布。这个方向场的核心对象叫 score 。 DDPM 的噪声预测、Score SDE 的反向过程、Probability Flow ODE 和 DPM-Solver,
-
扩散模型:扩散训练配方与排障
扩散训练最容易被误解成一组技巧:数据清洗、cosine schedule、EMA、condition dropout、CFG sweep、几个固定 prompt。真实项目里,这些开关构成一条排障链。样本糊、主体错、prompt 不听、视频闪烁、动作扩散成功率下降,都要追问:失败发生在哪个噪声区间,条件信号有没有进入 d
-
扩散模型:噪声日程与参数化
扩散训练看起来只是“给图加噪,再让模型预测噪声”。真正影响模型性格的,是两件更细的事:噪声日程决定训练样本会落在哪些难度区间,参数化决定模型用什么坐标回答这个去噪问题。它们会直接影响采样器、CFG、少步生成、视频一致性和世界模型里的动作敏感性。 噪声日程与参数化连接训练和推理:训练决定模型怎样学会局部方向,Score/