当一个知识体系同时覆盖扩散模型、VLM、VLA、量化、训练、推理、世界模型与具身智能时,真正困难的往往不是“资料太少”,而是“资料太多而缺乏路径”。这份学习路径不是简单罗列章节,而是给出一条兼顾研究理解、工程实现和系统判断力的推进顺序。它尤其适合已经具备基础机器学习背景、希望在 3 到 12 个月内建立系统能力的人。
-
路线图:快速对照表
这一页把全站几个核心主题放到同一张地图里,目的不是做百科式罗列,而是帮助你形成一个更稳定的判断框架:这个方向究竟解决什么问题,输入和输出是什么,瓶颈发生在训练、推理、部署还是现实世界交互,学习时哪些数学对象必须看懂、哪些工程对象必须跟住。 如果把整站内容看成一个 AI 系统谱系,可以先用一句话概括: 这几个主题不是平行
-
路线图:常见技术决策与取舍
真实的模型系统建设,很少是“看到一个 SOTA 方法就直接上”。更多时候,团队面对的是一连串不完美选择:要不要换更大模型,还是先做检索?要不要做量化,还是先蒸馏?要不要追求一步生成,还是接受十几步但更稳?要不要端到端 VLA,还是保留分层控制?这些问题没有脱离场景的标准答案,但它们确实存在一组反复出现的决策模式。本文试
-
强化学习:verl 训练流程:从 rollout 到分布式更新
本章回答什么 verl 这一章负责回答系统问题:一个 prompt batch 如何经过分布式 rollout、reward、advantage、optimizer update 和 weight sync,最终成为下一版本的生成策略。它不重新推导 PPO 或 GRPO 公式,而是追踪公式依赖的字段由谁产生、在哪个 m
-
强化学习:Model-based RL 与世界模型
Model-based RL 显式使用环境模型预测动作后果,再用规划或策略学习选择动作。模型可以是已知规则,也可以从真实 transition 中学习;world model 是 learned model 的一种,通常在 latent space 中预测状态、reward 与终止。统一判断标准是模型是否改善 clos
-
强化学习:Actor-Critic、GAE 与 PPO
本章回答什么 REINFORCE 的 Monte Carlo return 方差很高,怎样用 critic bootstrap,又怎样在同一批 rollout 上做几次更新而不让新策略离采样策略太远?Actor-Critic 分开决策与估值,GAE 在 bias-variance 间插值,PPO 用 old logpr
-
强化学习:MDP、价值函数与 Bellman
本章回答什么 一个动作怎样改变未来,未来的好坏又怎样回到当前决策?本章只建立这件事所需的语言:MDP、trajectory、return、状态价值、动作价值、advantage,以及 Bellman expectation 和 Bellman optimality。算法如何从模型或样本求这些量,留到下一章。 读完后,你
-
量化:服务栈与硬件选择
量化放到服务系统里以后,需要按硬件、延迟、吞吐、成本和质量目标做取舍。具体 runtime 兼容性见 量化运行时与部署框架。 核心问题 量化服务选型真正要回答的是: 低比特带来的节省,是否能在你的硬件、runtime、请求分布和质量门槛下兑现成更低成本或更高容量。 这句话里每个词都重要。硬件决定 FP8/INT8/IN
-
量化:运行时与部署框架
量化 checkpoint 只有在 runtime 能把低比特格式、权重布局、KV cache、batching 和 kernel 路径接起来时,才会变成真实端到端收益。硬件和成本模型放在 量化服务栈与硬件选择,底层 kernel 细节放在 低精度与量化 Kernel。重点聚焦中间这层: 低比特模型怎样被运行时可靠地加
-
量化:多模态与 VLA 模型量化
量化在 LLM 上已相对成熟,但到了 VLM、视频模型、VLA 和具身系统,问题会明显复杂化。原因不只是模型更大,而是输入分布更杂、模块更多、对细粒度结构和时序稳定性的要求更高。一个在文本问答上还能接受的量化误差,到了文档理解、UI grounding 或机器人动作生成中,可能就会被放大成明显错误。因此,多模态与 VL