卷积、kernel、filter、Fourier/DCT、频率、SNR、timestep 和多尺度金字塔共同处理信号的局部变化、全局趋势、频率成分和尺度选择。视觉、扩散、动作 chunk 和世界模型论文虽然对象不同,常用这套数学判断模型该在什么范围内看、在什么频段上改、在什么噪声阶段生成。 卷积:用同一个局部模板扫过信
-
基础知识:因果、反事实与分布偏移
causal、intervention、counterfactual、OOD、train-test mismatch、distribution shift 和 benchmark generalization 都在追问同一件事:模型学到的是观察相关,还是能经得起动作、干预和部署分布变化的机制。相关性告诉我们“两个变量一
-
基础知识:微积分与牛顿-莱布尼茨公式
训练、优化、扩散模型和控制都会把变化写成导数、积分、梯度、ODE 或 SDE。微积分提供这套语言:导数描述局部变化率,积分累积区间内的变化,牛顿-莱布尼茨公式把二者接起来。 导数:局部变化率 一元函数的导数写成: $$ f’ x = lim Delta x to 0 frac f x+ Delta x -f x Del
-
基础知识:梯度估计、离散变量与训练信号
普通反向传播有一个隐含前提:从 loss 到参数之间存在一条可微的计算路径。但很多重要模型偏偏会在中间采样、argmax、round、生成 one-hot 状态,或者用一个不参与反向传播的 teacher 提供目标。链式法则走到这里,路会突然断掉。 真正的问题是: 训练目标的梯度还能从哪里来,这个梯度估计有多大偏差和方
-
具身智能:机器人运动学与 DH 参数:从关节状态算到末端位姿
机器人数据中的关节角不是末端位置,视觉模型给出的目标位姿也不能直接变成电机角度。两者之间需要机器人运动学:正运动学把关节状态映射成末端位姿,逆运动学寻找满足目标与约束的关节解,规划和控制再决定怎样安全到达并稳定跟踪。 本章回答什么 串联机械臂运动学需要解释关节空间、任务空间、Forward Kinematics(FK)
-
具身智能:坐标变换与手眼协调:把相机观测接到机器人动作
视觉模型可以在图像里找到物体,但机器人控制器不能直接执行“向图片左边移动”。视觉估计给出的位姿只有在坐标系、变换方向、单位、时间戳和标定版本都明确时,才能变成规划与控制目标。 本章回答什么 从相机观测到机器人动作的最小空间接口包括:怎样表示旋转和平移;怎样组合、求逆和检查一条坐标变换链;eye-in-hand 与 ey
-
扩散模型:最小 DDPM 实现:让公式、训练与采样逐行对齐
这一实现只保留 DDPM 闭环中不可缺少的部分:噪声日程、任意时间步加噪、带时间条件的去噪网络、噪声预测损失、单步反向转移和完整采样链。目标是让每条核心公式都能在一份可测试的 PyTorch 代码里找到对应位置。 这份实现把 DDPM 数学与训练 中的六个对象映射到代码,并解释张量形状、时间下标和最终一步的边界处理。配
-
扩散模型:基础:概率路径、局部预测与反向生成
扩散模型的关键不在“去掉图片上的噪点”,而在于把难以直接采样的数据分布,连接到一个容易采样的简单分布。模型学习这条路径上的局部信息,采样器再把局部信息积分成完整生成轨迹。 扩散方法共用一组坐标:数据分布与单个样本的区别;前向过程为何由人规定;训练为何能构造监督信号;生成为何必须从噪声分布出发;DDPM、score-ba
-
扩散模型:Flow Matching 与 Rectified Flow:从速度回归到低曲率生成路径
Flow Matching 直接学习概率路径上的速度场,并通过常微分方程把简单分布输送到数据分布。它与 diffusion/score 方法可以共享“数据—噪声路径”的几何图,但监督目标、时间方向和生成方程必须分别写清。 Flow Matching 可以分成四层读:条件概率路径怎样构造可监督的 conditional
-
扩散模型:扩散网络架构与 Stable Diffusion 系统
扩散训练目标只规定网络在噪声状态上预测什么,并不规定网络必须采用哪种主干。U-Net、DiT、VAE、文本编码器和 scheduler 处在不同层:前两者近似去噪函数,VAE 定义表示空间,文本编码器提供条件,scheduler 负责沿时间轨迹更新状态。 读扩散网络架构时,先拆三个系统问题:denoiser 为什么必须