基础知识:概率论、分布与期望

基础知识:概率论、分布与期望

Charles Lv8

随机变量、分布、条件概率、期望、方差、似然和贝叶斯提供机器学习处理不确定性的共同语言。文本、图像、用户请求、机器人环境和训练数据都不是确定对象,概率论描述“可能发生什么”“多可能”“在什么条件下可能”。

随机变量:把不确定结果变成可计算对象

随机变量 XX 把随机实验的结果映射成数值或类别。比如:

随机变量 可能取值
下一个 token XtX_t 词表里的某个 token
图像标签 YY cat、dog、car 等类别
机器人动作 AtA_t 连续关节角或离散动作 token
奖励 RtR_t 成功、失败、分数或人类偏好

模型训练时,很多公式其实是在说随机变量之间的关系。

分布:可能性的形状

离散随机变量用概率质量函数 p(x)p(x) 描述,连续随机变量用概率密度 p(x)p(x) 描述。

Normal distribution

图源:Wikimedia Commons: Normal Distribution PDF。原图展示正态分布概率密度。这里的重点是:分布是一整片可能性的形状,均值、方差和尾部都会影响模型判断。

连续分布里,某个点的密度 p(x)p(x) 不是“取到这个点的概率”。真正的概率来自区间积分:

P(aXb)=abp(x)dxP(a\le X\le b)=\int_a^b p(x)\,dx

这也是为什么扩散模型、VAE、概率流 ODE 会把概率密度、积分和连续时间放在一起。

公式里的 p(x)p(x) 是密度,[a,b][a,b] 是你关心的区间。连续变量“刚好等于某个点”的概率通常为 0,所以要问区间概率。比如模型预测机器人末端误差 XX 近似服从正态分布时,我们更关心 P(X1cm)P(|X|\le 1\text{cm}),而不是 P(X=0)P(X=0)

期望:在分布下取平均

期望写成:

EXp[f(X)]=xp(x)f(x)\mathbb{E}_{X\sim p}[f(X)] = \sum_x p(x)f(x)

连续情形是:

EXp[f(X)]=p(x)f(x)dx\mathbb{E}_{X\sim p}[f(X)] = \int p(x)f(x)\,dx

这两行的差别只在 XX 是离散还是连续。下标 XpX\sim p 告诉你样本来自哪个分布,f(X)f(X) 是你对样本计算的量。期望表示按分布长期抽样后的平均,不等于某一次样本的结果。

训练里常见的目标:

E(x,y)D[(fθ(x),y)]\mathbb{E}_{(x,y)\sim\mathcal{D}} \left[ \ell(f_\theta(x),y) \right]

意思是:从数据分布 D\mathcal{D} 里抽样,计算模型损失,再取平均。mini-batch 训练只是用有限样本近似这个期望。

后面看预训练时,可以把 (x,y)(x,y) 理解成“上下文和下一个 token”,\ell 理解成交叉熵。代码里一个 batch 只给出几十到几千个样本,所以训练得到的是期望的噪声估计。这也是为什么数据顺序、batch size、packing 和采样策略会影响训练稳定性。

条件期望:知道当前状态后,未来平均会怎样

条件期望把一部分信息固定下来,再对剩余随机性取平均:

E[XY=y],E[X]=EY[E[XY]].\mathbb E[X\mid Y=y], \qquad \mathbb E[X]=\mathbb E_Y[\mathbb E[X\mid Y]].

第一项问“已经知道 Y=yY=y 时,XX 平均是多少”;第二项是全期望公式:先在每个 YY 的条件下求平均,再按 YY 自身的分布对这些条件平均加权。

例如一辆配送车只有“道路畅通”和“道路拥堵”两种状态。令 YY 表示道路状态,XX 表示送达时间;若道路畅通的概率为 0.7、平均送达时间为 20 分钟,道路拥堵的概率为 0.3、平均送达时间为 50 分钟,那么总体平均送达时间是

E[X]=0.7×20+0.3×50=29 分钟.\mathbb E[X] =0.7\times 20+0.3\times 50 =29\text{ 分钟}.

固定“道路畅通”后,E[XY=畅通]\mathbb E[X\mid Y=\text{畅通}] 仍会对红绿灯、装卸时长和路线中的其他随机因素取平均;全期望还会进一步对道路状态本身取平均。条件期望用来明确哪些信息已经固定、哪些随机性仍被平均掉,它不会把未来变成确定值。

强化学习里的状态价值正是条件期望:

Vπ(s)=Eπ[GtSt=s].V^\pi(s)=\mathbb E_\pi[G_t\mid S_t=s].

给定当前状态 St=sS_t=s 后,这个期望对策略后续采样的动作、环境的随机转移以及由此产生的未来奖励取平均。这里先把 Vπ(s)V^\pi(s) 读成“当前状态下的平均未来回报”即可;递推关系留到 MDP、价值函数与 Bellman 再展开。

方差:估计有多抖

方差描述随机变量围绕均值的波动:

Var(X)=E[(XE[X])2]\mathrm{Var}(X)=\mathbb{E}[(X-\mathbb{E}[X])^2]

RL 里的 policy gradient 方差大,是因为一次 trajectory 的 return 受很多随机因素影响;batch size 变大通常能降低估计噪声;baseline 和 advantage 也可以看成降低方差的工具。

协方差:两个误差方向会不会一起变化

方差只看一个随机变量自己的波动。协方差看两个随机变量是否倾向于一起偏离均值:

Cov(X,Y)=E[(XE[X])(YE[Y])]\operatorname{Cov}(X,Y) = \mathbb{E} \left[ (X-\mathbb{E}[X]) (Y-\mathbb{E}[Y]) \right]

逐项读:

情况 协方差符号 直觉
XX 偏大时 YY 也常偏大 两个方向同向变化
XX 偏大时 YY 常偏小 两个方向反向变化
没有明显线性共同变化 接近 0 不代表完全独立

协方差受变量单位影响。为了得到无量纲、范围在 [1,1][-1,1] 的线性相关程度,常用 Pearson correlation:

ρXY=Cov(X,Y)Var(X)Var(Y)\rho_{XY} = \frac{ \operatorname{Cov}(X,Y) }{ \sqrt{ \operatorname{Var}(X) \operatorname{Var}(Y) } }

如果随机向量 xRdx\in\mathbb{R}^d 有均值 μ\mu,所有维度两两协方差可以排成协方差矩阵:

Σ=E[(xμ)(xμ)]\Sigma = \mathbb{E} \left[ (x-\mu)(x-\mu)^\top \right]

对角线 Σii\Sigma_{ii} 是每个维度自己的方差;非对角项 Σij\Sigma_{ij} 表示两个方向怎样一起变化。协方差矩阵是对称半正定矩阵,因此可以用特征向量看不确定性主要沿哪些方向展开。

一个机器人例子:设末端位置误差是 e=(ex,ey)e=(e_x,e_y)。如果相机斜着观察桌面,深度误差可能同时投影到水平和垂直方向,使 ex,eye_x,e_y 正相关。此时只报“横向标准差 1 cm、纵向标准差 1 cm”会漏掉误差方向;完整 Σ\Sigma 对应的是一条倾斜的不确定性椭圆。planner 若只检查轴对齐阈值,可能低估椭圆长轴方向上的碰撞风险。

多元高斯常写成:

xN(μ,Σ)x\sim\mathcal N(\mu,\Sigma)

μ\mu 决定分布中心,Σ\Sigma 决定各方向的尺度和耦合。DPM-Solver++ 里的 σt2I\sigma_t^2I 是各向同性协方差;RSSM posterior 可以输出对角高斯以节省计算;风险规划则可能需要保留方向相关的不确定性。

这里要守住两个边界:零协方差通常只表示“没有线性相关”,不自动推出独立;相关系数高也不说明 XX 导致 YY。因果解释要回到因果、反事实与分布偏移

条件概率:知道一件事后,另一件事的可能性

条件概率写成:

P(AB)=P(A,B)P(B)P(A\mid B)=\frac{P(A,B)}{P(B)}

语言模型的核心就是条件概率:

pθ(xtx<t)p_\theta(x_t\mid x_{<t})

它表示:在给定过去 token 的条件下,下一个 token 的分布。VLA 里也会写:

πθ(atot,l)\pi_\theta(a_t\mid o_{\le t}, l)

表示:给定历史观测和语言指令,动作的分布。

竖线右边永远要认真读。pθ(xtx<t)p_\theta(x_t\mid x_{<t}) 只允许看过去 token;如果训练时 mask 错了,让模型看到 xt+1x_{t+1} 或答案位置,loss 会变好,但生成时会露馅。VLA 里的 oto_{\le t} 也一样,它声明策略能看见到当前为止的观测历史,而不是未来画面。

贝叶斯:用证据更新信念

贝叶斯公式写成:

P(HE)=P(EH)P(H)P(E)P(H\mid E) = \frac{P(E\mid H)P(H)}{P(E)}

其中 HH 是假设,EE 是证据。它说的是:先有先验 P(H)P(H),看到证据 EE 后,用 likelihood P(EH)P(E\mid H) 更新成后验 P(HE)P(H\mid E)

一个机器人例子:HH 是“杯子在桌子左侧”,EE 是相机看到的图像证据。先验 P(H)P(H) 来自地图或上一帧估计,P(EH)P(E\mid H) 衡量如果杯子真在左侧,看到这张图的可能性,后验 P(HE)P(H\mid E) 就是融合观测后的新信念。世界模型里的 belief state 和 latent posterior 都有这种味道。

在机器学习里,贝叶斯思路会出现在:

场景 贝叶斯语言
潜变量模型 看到 xx 后推断隐藏原因 zz
机器人定位 用传感器观测更新位姿信念
不确定性估计 区分模型不知道和数据本身随机
世界模型 根据观测历史更新 latent state

似然:模型解释数据的能力

似然常写成:

pθ(x)p_\theta(x)

如果把 θ\theta 看成变量,它衡量的是“在当前参数下,观察到数据 xx 有多合理”。最大似然训练就是让真实数据在模型下尽可能可能。

语言模型交叉熵和负对数似然紧密相关:

LNLL=logpθ(x)\mathcal{L}_{\text{NLL}} = -\log p_\theta(x)

概率越高,loss 越小;概率越低,loss 越大。

常见误读

误读 更稳的理解
概率高就一定会发生 概率描述可能性,不保证单次结果
softmax 概率就是真实置信度 它是模型分布,可能未校准
期望就是实际样本平均 样本平均只是对期望的估计
协方差为 0 就代表两个变量独立 一般只能说明无线性相关;高斯等特殊条件下才可进一步推出独立
相关系数高就说明存在因果 它只描述统计共变,因果还需要干预或额外假设
likelihood 和 probability 完全一样 数学形式相同,但关注对象不同:概率固定模型看数据,似然固定数据看参数

读完以后怎么判断

看到概率公式,先找随机变量、条件和分布来源。问清楚样本从哪里来,模型允许看见什么,期望是用真实分布还是 mini-batch 近似。后面的训练、生成、评估和 RL 公式都会因此清楚很多。

外部材料

  • Title: 基础知识:概率论、分布与期望
  • Author: Charles
  • Created at : 2026-06-14 09:00:00
  • Updated at : 2026-06-14 09:00:00
  • Link: https://charles2530.github.io/2026/06/14/ai-files-prerequisite-math-probability-distributions-and-expectation/
  • License: This work is licensed under CC BY-NC-SA 4.0.
Comments