随机变量、分布、条件概率、期望、方差、似然和贝叶斯提供机器学习处理不确定性的共同语言。文本、图像、用户请求、机器人环境和训练数据都不是确定对象,概率论描述“可能发生什么”“多可能”“在什么条件下可能”。 随机变量:把不确定结果变成可计算对象 随机变量 把随机实验的结果映射成数值或类别。比如: 随机变量 可能取值
-
基础知识:优化、梯度与约束
loss、梯度下降、学习率、动量、Adam、约束优化和拉格朗日乘子共同构成训练算法的读法。模型训练可以先看成一个最小化问题: $$ min theta mathcal L theta $$ 其中 $ theta$ 是参数,$ mathcal L $ 是目标函数。训练过程会不断估计更新方向,再把参数往更低 loss 的地
-
基础知识:数值计算、复杂度与估算
论文里的短公式进入训练和推理系统后,会变成 FLOPs、bytes、精度、稳定性和复杂度问题。数值计算和复杂度把“公式能不能算、算得准不准、算得贵不贵”说清楚。 Big-O:看规模增长趋势 复杂度符号 $O cdot $ 描述输入规模变大时成本怎样增长,不给出精确时间。 图源:Wikimedia Commons: Co
-
基础知识:线性代数与几何直觉
AI 文章频繁使用向量、矩阵、投影、范数、秩和特征空间,因为模型需要把 token、图像 patch、机器人状态、动作、记忆放进向量空间,再用矩阵旋转、缩放、投影、混合和压缩这些表示。 向量是带方向的特征 一个 embedding 向量可以写成: $$ x= x 1,x 2, dots,x d in mathbb R
-
基础知识:潜变量、似然与生成模型目标
latent、prior、posterior、likelihood、ELBO、score matching、denoising loss 和 flow matching 都在描述生成过程:数据来自哪个分布、哪个隐藏状态,或哪条从噪声到样本的路径。公式里因此会同时出现可见变量 、潜变量 、噪声状态
-
基础知识:信息论、熵与分布距离
熵、交叉熵、KL 和互信息把模型输出的概率分布转成可优化、可比较的量。语言模型、扩散模型、蒸馏和 RLHF 的 loss 经常使用它们来衡量不确定性、编码代价以及两个分布之间的差异。 熵:不确定性有多大 离散分布 的熵写成: $$ H p =- sum i p i log p i $$ 如果分布很尖,大部分概率
-
基础知识:几何、视觉与三维空间
相机内参、外参、深度、视差、姿态、四元数、点云、对极几何、SE 3 和多视角几何共同描述像素、相机与真实三维位置之间的关系。机器人和世界模型需要这套语言,因为同一个物体会随相机位置、焦距、遮挡和深度变化投影成不同像素,动作还必须落回真实空间。 针孔相机:三维点怎样落到二维图像 最简相机投影可以写成: $$ begin
-
基础知识:动态系统、控制与状态空间
状态空间、动力学、稳定性、控制、规划和 MPC 描述系统如何随时间变化,以及动作如何把系统推向目标。世界模型与具身智能文章借这套语言连接状态预测、动作选择、安全约束和闭环反馈。 状态:描述系统当前足够信息的变量 状态可以写成 。它可能包含机器人位姿、关节角、速度、相机观测、任务进度,也可能是模型学出来的 la
-
基础知识:离散选择、Top-k 与稀疏路由
argmax、top-k、beam search、MCTS、router、gating、expert load、entropy 和 load balancing 都在处理有限预算下的离散选择。模型先给候选打分,再选择少数候选、归一化权重并重新分配计算预算:下一个 token、top-k expert、检索文档、候选轨迹
-
基础知识:微分、Jacobian 与梯度传播
Jacobian 描述输入朝某个方向轻微变化时,输出会朝哪里动、动多远。它把标量导数扩展到向量映射,也连接微积分、自动微分、误差传播和控制;神经网络、机器人控制和量化论文里的“小误差被 Jacobian 放大”,说的就是这个局部线性地图。 导数其实在做局部线性近似 一元函数在 附近变化时,有: $$ f x+