训练
2026
23
- 思考探索:具身智能的数据鸿沟:先对齐,再扩规模
- 强化学习:LLM 强化学习:RLHF、RLVR 与 GRPO
- 基础知识:缩放律、幂律与实验曲线
- 基础知识:梯度估计、离散变量与训练信号
- 知识问答:训练与对齐 QA
- 基础知识:预训练目标与表示学习:模型到底被要求学什么
- 训练:模型训练的完整链路:数据、目标、更新与证据
- 世界模型:高效训练完整实验报告样例
- 世界模型:高效训练路线图
- 世界模型:动作条件视频世界模型端到端训练案例
- VLM/VLA:世界模型高效训练接口
- VLM/VLA:架构:视觉证据怎样进入语言模型
- 训练:W&B:训练实验追踪与证据链治理
- 训练:稳定性与故障排查
- 训练:Scaling Law 与训练经济学
- 训练:Scaling、课程学习与数据配比
- 训练:预训练、微调与对齐:把能力、行为和偏好分开看
- 训练:偏好数据与对齐失效
- 训练:后训练数据引擎与 Judge 模型
- 训练:目标函数、优化器与 LR 日程:训练压力怎样变成参数轨迹
- 训练:MTP 与投机解码
- 训练:Megatron、DeepSpeed 与 FSDP:训练栈选型先拆账
- 训练:低比特训练与数值格式:误差会被写回参数
2025
12
1