基础知识:概率论、分布与期望
随机变量、分布、条件概率、期望、方差、似然和贝叶斯提供机器学习处理不确定性的共同语言。文本、图像、用户请求、机器人环境和训练数据都不是确定对象,概率论描述“可能发生什么”“多可能”“在什么条件下可能”。
随机变量:把不确定结果变成可计算对象
随机变量 把随机实验的结果映射成数值或类别。比如:
| 随机变量 | 可能取值 |
|---|---|
| 下一个 token | 词表里的某个 token |
| 图像标签 | cat、dog、car 等类别 |
| 机器人动作 | 连续关节角或离散动作 token |
| 奖励 | 成功、失败、分数或人类偏好 |
模型训练时,很多公式其实是在说随机变量之间的关系。
分布:可能性的形状
离散随机变量用概率质量函数 描述,连续随机变量用概率密度 描述。
图源:Wikimedia Commons: Normal Distribution PDF。原图展示正态分布概率密度。这里的重点是:分布是一整片可能性的形状,均值、方差和尾部都会影响模型判断。
连续分布里,某个点的密度 不是“取到这个点的概率”。真正的概率来自区间积分:
这也是为什么扩散模型、VAE、概率流 ODE 会把概率密度、积分和连续时间放在一起。
公式里的 是密度, 是你关心的区间。连续变量“刚好等于某个点”的概率通常为 0,所以要问区间概率。比如模型预测机器人末端误差 近似服从正态分布时,我们更关心 ,而不是 。
期望:在分布下取平均
期望写成:
连续情形是:
这两行的差别只在 是离散还是连续。下标 告诉你样本来自哪个分布, 是你对样本计算的量。期望表示按分布长期抽样后的平均,不等于某一次样本的结果。
训练里常见的目标:
意思是:从数据分布 里抽样,计算模型损失,再取平均。mini-batch 训练只是用有限样本近似这个期望。
后面看预训练时,可以把 理解成“上下文和下一个 token”, 理解成交叉熵。代码里一个 batch 只给出几十到几千个样本,所以训练得到的是期望的噪声估计。这也是为什么数据顺序、batch size、packing 和采样策略会影响训练稳定性。
条件期望:知道当前状态后,未来平均会怎样
条件期望把一部分信息固定下来,再对剩余随机性取平均:
第一项问“已经知道 时, 平均是多少”;第二项是全期望公式:先在每个 的条件下求平均,再按 自身的分布对这些条件平均加权。
例如一辆配送车只有“道路畅通”和“道路拥堵”两种状态。令 表示道路状态, 表示送达时间;若道路畅通的概率为 0.7、平均送达时间为 20 分钟,道路拥堵的概率为 0.3、平均送达时间为 50 分钟,那么总体平均送达时间是
固定“道路畅通”后, 仍会对红绿灯、装卸时长和路线中的其他随机因素取平均;全期望还会进一步对道路状态本身取平均。条件期望用来明确哪些信息已经固定、哪些随机性仍被平均掉,它不会把未来变成确定值。
强化学习里的状态价值正是条件期望:
给定当前状态 后,这个期望对策略后续采样的动作、环境的随机转移以及由此产生的未来奖励取平均。这里先把 读成“当前状态下的平均未来回报”即可;递推关系留到 MDP、价值函数与 Bellman 再展开。
方差:估计有多抖
方差描述随机变量围绕均值的波动:
RL 里的 policy gradient 方差大,是因为一次 trajectory 的 return 受很多随机因素影响;batch size 变大通常能降低估计噪声;baseline 和 advantage 也可以看成降低方差的工具。
协方差:两个误差方向会不会一起变化
方差只看一个随机变量自己的波动。协方差看两个随机变量是否倾向于一起偏离均值:
逐项读:
| 情况 | 协方差符号 | 直觉 |
|---|---|---|
| 偏大时 也常偏大 | 正 | 两个方向同向变化 |
| 偏大时 常偏小 | 负 | 两个方向反向变化 |
| 没有明显线性共同变化 | 接近 0 | 不代表完全独立 |
协方差受变量单位影响。为了得到无量纲、范围在 的线性相关程度,常用 Pearson correlation:
如果随机向量 有均值 ,所有维度两两协方差可以排成协方差矩阵:
对角线 是每个维度自己的方差;非对角项 表示两个方向怎样一起变化。协方差矩阵是对称半正定矩阵,因此可以用特征向量看不确定性主要沿哪些方向展开。
一个机器人例子:设末端位置误差是 。如果相机斜着观察桌面,深度误差可能同时投影到水平和垂直方向,使 正相关。此时只报“横向标准差 1 cm、纵向标准差 1 cm”会漏掉误差方向;完整 对应的是一条倾斜的不确定性椭圆。planner 若只检查轴对齐阈值,可能低估椭圆长轴方向上的碰撞风险。
多元高斯常写成:
决定分布中心, 决定各方向的尺度和耦合。DPM-Solver++ 里的 是各向同性协方差;RSSM posterior 可以输出对角高斯以节省计算;风险规划则可能需要保留方向相关的不确定性。
这里要守住两个边界:零协方差通常只表示“没有线性相关”,不自动推出独立;相关系数高也不说明 导致 。因果解释要回到因果、反事实与分布偏移。
条件概率:知道一件事后,另一件事的可能性
条件概率写成:
语言模型的核心就是条件概率:
它表示:在给定过去 token 的条件下,下一个 token 的分布。VLA 里也会写:
表示:给定历史观测和语言指令,动作的分布。
竖线右边永远要认真读。 只允许看过去 token;如果训练时 mask 错了,让模型看到 或答案位置,loss 会变好,但生成时会露馅。VLA 里的 也一样,它声明策略能看见到当前为止的观测历史,而不是未来画面。
贝叶斯:用证据更新信念
贝叶斯公式写成:
其中 是假设, 是证据。它说的是:先有先验 ,看到证据 后,用 likelihood 更新成后验 。
一个机器人例子: 是“杯子在桌子左侧”, 是相机看到的图像证据。先验 来自地图或上一帧估计, 衡量如果杯子真在左侧,看到这张图的可能性,后验 就是融合观测后的新信念。世界模型里的 belief state 和 latent posterior 都有这种味道。
在机器学习里,贝叶斯思路会出现在:
| 场景 | 贝叶斯语言 |
|---|---|
| 潜变量模型 | 看到 后推断隐藏原因 |
| 机器人定位 | 用传感器观测更新位姿信念 |
| 不确定性估计 | 区分模型不知道和数据本身随机 |
| 世界模型 | 根据观测历史更新 latent state |
似然:模型解释数据的能力
似然常写成:
如果把 看成变量,它衡量的是“在当前参数下,观察到数据 有多合理”。最大似然训练就是让真实数据在模型下尽可能可能。
语言模型交叉熵和负对数似然紧密相关:
概率越高,loss 越小;概率越低,loss 越大。
常见误读
| 误读 | 更稳的理解 |
|---|---|
| 概率高就一定会发生 | 概率描述可能性,不保证单次结果 |
| softmax 概率就是真实置信度 | 它是模型分布,可能未校准 |
| 期望就是实际样本平均 | 样本平均只是对期望的估计 |
| 协方差为 0 就代表两个变量独立 | 一般只能说明无线性相关;高斯等特殊条件下才可进一步推出独立 |
| 相关系数高就说明存在因果 | 它只描述统计共变,因果还需要干预或额外假设 |
| likelihood 和 probability 完全一样 | 数学形式相同,但关注对象不同:概率固定模型看数据,似然固定数据看参数 |
读完以后怎么判断
看到概率公式,先找随机变量、条件和分布来源。问清楚样本从哪里来,模型允许看见什么,期望是用真实分布还是 mini-batch 近似。后面的训练、生成、评估和 RL 公式都会因此清楚很多。
外部材料
- Title: 基础知识:概率论、分布与期望
- Author: Charles
- Created at : 2026-06-14 09:00:00
- Updated at : 2026-06-14 09:00:00
- Link: https://charles2530.github.io/2026/06/14/ai-files-prerequisite-math-probability-distributions-and-expectation/
- License: This work is licensed under CC BY-NC-SA 4.0.