本章回答什么 当每次只能从多个选项里试一个,而每个选项的平均收益未知时,怎样在“利用当前最优选项”和“探索尚未了解的选项”之间分配机会?本章用同一个固定 seed 的 10 臂任务比较 epsilon-greedy 与 UCB,并把估计、动作选择和指标串成最小实验。 Bandit 没有随动作变化的 state tran
-
强化学习:LLM 强化学习:RLHF、RLVR 与 GRPO
LLM 强化学习把一段 response 看成由 token action 组成的 trajectory:模型从 prompt 开始逐 token 采样,reward model、规则或 verifier 在结尾打分,再把结果变成 policy update。RLHF、RLVR、PPO 和 GRPO 的差异主要在 re
-
强化学习:动态规划、Monte Carlo 与 TD
本章回答什么 已经有了 Bellman 方程,怎样真正算出 value?本章用同一个 2×3 GridWorld 比较三条路径:Dynamic Programming(DP)枚举已知模型,Monte Carlo(MC)等待完整 episode,Temporal-Difference(TD)从单步样本 bootstrap
-
强化学习:连续控制与 SAC
本章回答什么 DQN 能对有限 action 取 $ max a Q s,a $,但电机力矩是连续值,无法逐个枚举。Soft Actor-Critic(SAC)用 reparameterized squashed Gaussian actor 产生连续动作,以 twin Q、replay buffer、target n
-
基础知识:价值函数、策略梯度与强化学习目标
return、value、Q 函数、advantage、policy gradient、PPO、GRPO 和 KL penalty 都在描述策略如何在随机轨迹里最大化长期收益。强化学习的难点在于奖励可能延迟,轨迹有随机性,策略一改,后面的数据分布也会跟着改。 Return:一条轨迹最后值多少钱 从时间 开始的折
-
基础知识:随机过程与马尔可夫性
马尔可夫、转移概率、trajectory、MDP 和 rollout 描述随机过程如何随时间推进。语言模型生成 token、机器人执行动作、世界模型预测未来、扩散模型逐步去噪,都可以先看成按时间展开的随机变量序列。 随机过程:一串随时间变化的随机变量 一个离散时间随机过程可以写成: $$ X 0,X 1,X 2, do
-
基础知识:谱分解、二阶近似与低秩结构
特征值、SVD、谱能量、Hessian、Taylor 近似和低秩结构用来分析方向结构和扰动敏感度。谱分解看矩阵能量集中在哪些方向,二阶近似看 loss 或模型分布对小扰动有多敏感。 特征值:一个方向被放大多少 如果一个方阵 满足: $$ Av= lambda v $$ 那么 是特征向量,$ lambda
-
基础知识:序列、位置编码与注意力掩码
token 序列、位置编码、causal mask、attention mask、temperature 和 KV cache 共同定义序列模型的信息流、位置感和生成概率。语言、视频和机器人轨迹都可以按顺序展开,只是元素分别是 token、帧或 patch、状态和动作;序列数学关心第 个元素能看见谁、怎样知道自
-
基础知识:缩放律、幂律与实验曲线
scaling law、log-log 曲线、Pareto frontier、ablation 和 loss curve 用来判断资源增加、模型变大、推理步数变多或速度质量权衡如何改变结果。这些图背后的数学通常不复杂,关键是看横轴、纵轴、尺度、误差范围和外推边界。 幂律:规模变大时按固定指数变化 常见缩放律可以写成:
-
基础知识:采样、估计与校准
Monte Carlo、估计器、方差、置信区间、acceptance rate、calibration 和 ECE 衡量采样结果的稳定性、误差范围和概率是否可信。许多模型目标写成期望,但系统只能采样;论文报告平均指标,部署还要看长尾;方法依赖 confidence,也要验证 confidence 是否对应真实成功率。