很多训练团队把精力放在模型、优化器、并行和混合精度上,最后却发现 GPU 利用率仍然不高。原因常常在输入管线:数据切片太碎、tokenizer 太慢、packing 太差、shuffle buffer 不合理、长样本让 padding 放大、恢复训练后数据游标错位。输入系统共同塑造训练统计分布、吞吐和可复现性。 训练消
-
训练:图片来源与授权
files/assets/images/training/ 中图片的来源链接记录如下。 这些图片均来自 Wikimedia Commons,具体授权条款以各文件页面为准。 训练专题曾经有一批概括图;现在不再在网页中使用。训练页里的方法图统一改为论文原图、论文项目图或明确来源的公共图。 文件清单 1. gradient-
-
训练:评测与消融设计
训练系统做大之后,最容易出现一种表面繁荣:实验很多、曲线很多、表格很多,但结论并不可靠。模型变好了,是因为目标函数有效,还是因为数据更多、batch 更大、训练更久、judge 偏好改变?训练评测与消融设计的目标,就是把“看起来变了”和“确实因这个改动变了”尽量区分开。 训练评测要把离线实验、训练稳定性、数据质量和线上
-
训练:分布式训练与 Checkpoint:让长跑能快、能省、能恢复
分布式训练不是“多放几张 GPU”。它要同时满足四件事:模型和激活放得下,GPU 不长期等通信或数据,checkpoint 不把训练主链拖死,中断后还能从同一条训练轨迹继续。前两件决定训练能不能跑快,后两件决定训练能不能跑完。 一次大模型训练长跑里,并行拓扑、通信、checkpoint 和恢复状态必须闭合。 框架分工放
-
训练:数据系统与吞吐优化
很多人把训练问题理解成“调优化器”。这只对了一小部分。在大模型训练里,优化器当然重要,但真正决定结果的往往是整套训练系统:数据如何清洗和混合,batch 如何组织,序列如何 packing,学习率如何调度,dataloader 能否持续喂满 GPU,checkpoint 与容错是否可靠。 训练数据系统和优化通常耦合在一
-
训练:数据质量、去重与治理
大模型训练里最贵的资源往往是高质量数据。训练数据需要控制重复、污染、版权风险、低信息密度、标签漂移和分布失衡;这些问题会让看似庞大的语料库变成效率低下甚至带偏模型的负担。数据质量、去重与治理,是现代训练系统中最容易被低估、但对最终能力和合规性影响极大的部分。 图源:Data Cards。原图表达数据集文档应覆盖来源、组
-
训练:集群运维与实验治理
当训练规模足够大之后,很多失败已经不再是“模型没学会”,而是“系统没组织好”。节点临时故障、对象存储抖动、sampler 状态丢失、实验配置漂移、checkpoint 写爆带宽、多个团队抢同一批 GPU,这些问题最后都会反映到训练效率、复现能力和研究迭代速度上。 训练系统里常被低估的一层,是如何把昂贵训练作业组织成可启
-
思考探索:世界模型现状:从视频模拟到工程闭环
世界模型这几年变成了一个很热的词,但它正在同时指向两件并不完全相同的东西: 1. 会生成可交互世界的外部模拟器 ,例如从文本生成一个能走进去探索的环境; 2. 能帮助智能体做决策的内部预测器 ,例如在机器人执行前预测动作后果、风险和成功概率。 这条工程路线的价值,是把这两个方向重新拉回工程地面:如果模型最后要服务机器人
-
思考探索:XR2 Gen 2:端侧 AI 与量化部署
先不谈指标,先想一个动作:你戴上 Meta Quest 3,打开彩色透视,低头看桌面,抬手点一个悬浮按钮。这个动作不到一秒,但头显要同时接收多路相机画面、估计头和手的位置、把真实世界和虚拟画面叠在一起、给左右眼渲染高分辨率画面、维持无线连接,还可能并发运行语音识别、场景理解或应用侧视觉模型。 图源:用户提供图片。原图表
-
思考探索:具身智能现状:VLA、数据工厂与真实闭环
具身智能现在最迷人的地方,也是最容易误判的地方,是 demo 看起来越来越像“机器人真的懂了”。但系统化梳理后的提醒很清楚:真正的问题不只是模型会不会看图出动作,而是它有没有任务状态、会不会拒绝无效指令、能不能从失败中恢复,数据是不是太干净,评测是不是只看了最终状态。 图源:Wikimedia Commons: Hyd