很多人第一次读 stereo matching,容易把它和 monocular depth 混在一起:都是输入图像,输出一张深度图。两者差异由问题假设决定。单目深度主要在一张图里利用纹理、透视和语义线索推断距离;双目深度先有一对同步、标定、校正过的左右图,再利用同一个 3D 点在两张图里的横向位移来三角测量。 双目匹配
-
基础知识:预训练目标与表示学习:模型到底被要求学什么
预训练目标不是训练脚本里的一行 loss。它在规定模型看见什么、预测什么、哪些差异要保留、哪些差异可以忽略。LLM 的 next-token、BERT/MAE 的 masked modeling、CLIP 的对比学习、扩散的 denoising、V-JEPA 的 latent prediction、VLA 的 beha
-
基础知识:生成与解码:模型给出概率后,系统怎样选 token
语言模型给出下一 token 分数以后,解码系统要把概率分布变成一段可用、可控、成本可承受的输出。 解码不是“让模型回答”的按钮。它是一条状态机:每一步先拿到 logits,再做格式 mask、重复惩罚、temperature 缩放、top-k/top-p 截断、采样或搜索,然后把选中的 token 写回上下文和 KV
-
基础知识:泛化、正则化与分布偏移:训练 loss 下降为什么不等于模型可用
训练集 loss 下降以后,模型仍未必真正学会任务。 优化回答的是“参数能不能把当前训练目标降下来”;泛化回答的是“这个规律能不能离开训练样本继续成立”;分布偏移回答的是“训练时看见的世界和真正使用时的世界是不是同一个世界”。这三件事连在一起,才决定模型是否可用。 如果你关心 causal、intervention、c
-
基础知识:数据与数据集基础:模型真正吃下去的不是“文件夹”
读到“我们用某数据集训练/评测”时,关键是判断这个结论是否可信。 数据集不是一个目录、一张表或若干 JSONL。它是一组样本定义、标签规则、来源记录、processor、split、过滤和版本共同构成的训练契约。只要契约说不清,后面的 loss、benchmark 和训练曲线都可能在回答错误问题。 需要用到概率分布与条
-
基础知识:模型蒸馏入门
模型蒸馏(Knowledge Distillation, KD)解决的是一个很实际的问题:已经有一个强但贵的 teacher model,能不能把它的行为、分布或中间表示压到更小、更快、更便宜的 student model 里。 需要用到熵、交叉熵与 KL比较 teacher/student 分布,用概率与期望理解 s
-
基础知识:读懂公式的最小数学:接口、概率、loss 和梯度
AI 文章里的公式需要读出对象、条件、shape、目标和近似边界,不能停在“符号我都见过”。 公式不是为了显得高级。好的公式通常在声明四件事:输入是什么,输出是什么,哪些变量可见,训练或推理在优化什么。读不懂公式时,最容易犯的错是急着背符号表;更好的办法是把它还原成模型接口和数据流。 公式阅读可以从这里开始;遇到向量、
-
训练:模型训练的完整链路:数据、目标、更新与证据
训练不是“把数据喂给模型,然后等 loss 下降”。更准确地说,训练是在控制三件事:模型看见什么数据,用什么目标判断对错,用多大的更新压力修改参数。只要这三件事没有对齐,loss 曲线再顺,也可能只是模型学会了错误捷径。 单个 training step、完整训练 run 和分布式执行要放进同一条链路读:梯度从哪里来,
-
量化:最小数学:格子、误差和输出保持
量化公式不应该被当成符号表背诵。它们大多在回答三件事: 读公式时先问:这个符号是权重、激活还是 KV cache;scale 是一整层共用还是每组共用;误差是在单个数上看,还是在矩阵乘输出上看。Hugging Face 的量化概念文档把量化拆成 scheme、granularity、technique,这个拆法很好:s
-
世界模型:基础:状态、动力学、观测与决策
世界模型学习环境怎样随时间和动作变化。它不必还原世界的全部细节,而要形成一套对下游消费方足够的内部状态和转移规律:规划器需要比较候选动作,策略学习需要在想象轨迹中估计回报,生成式模拟器需要产生连贯可见的未来,风险系统需要识别不确定和危险尾部。 世界模型的共同接口包括:观测与状态为何不同;历史怎样形成 belief;动作