世界模型方向的高频问题不靠背 PlaNet、Dreamer、JEPA、Genie、WAM 这些名字,而要讲清:模型预测什么、动作如何进入、效率来自哪里、什么证据能证明它可用于规划,什么证据只能说明视频生成或 demo 形态。 基础定义与能力边界 Q:世界模型到底是什么? 面试回答。 世界模型是对环境动态的内部模型,用来
-
知识问答:多模态与生成模型 QA
VLM、视觉连接器、扩散模型、视频生成和多模态评测的高频问题,需要和世界模型、具身智能问题分开读:世界模型见 世界模型 QA,VLA 与机器人闭环见 具身智能与 VLA QA。 VLM 与多模态表示 Q:VLM 和纯文本 LLM 的核心差别是什么? 面试回答。 纯文本 LLM 的输入主要是 token 序列;VLM 需
-
知识问答:训练与对齐 QA
预训练、微调、对齐、优化器、稳定性、分布式训练和实验治理的高频问题,需要说清训练目标、数据流、公式含义和工程取舍。 预训练与训练基础 Q:大语言模型预训练到底在学什么? 面试回答。 主流 decoder-only LLM 的预训练目标是 next-token prediction:给定前面的 token,预测下一个 t
-
知识问答:RAG、Agent 与评估 QA
RAG、embedding、rerank、Agent、tool calling、LLM-as-judge、幻觉、安全和在线评估的高频问题,经常卡在三类混淆:检索和生成混淆、格式正确和事实正确混淆、demo 和线上可靠性混淆。 RAG 与检索 Q:RAG 解决的核心问题是什么?它不能解决什么? 面试回答。 RAG 的核心
-
知识问答:算子与性能 QA
GEMM、attention kernel、CUDA/Triton、FlashAttention、roofline、MFU 和 profiling 的高频问题,需要把局部 kernel 加速、端到端吞吐、数值正确性和维护成本分开讲。 GPU 与矩阵计算基础 Q:为什么大模型里 GEMM 这么核心? 面试回答。 Tran
-
知识问答:推理服务与量化 QA
LLM 推理、服务系统、KV cache、batching、投机解码、运行时和量化的高频问题,都要把 prefill、decode、显存、吞吐、尾延迟和质量回归分开讲。 推理基础与服务指标 Q:训练和推理为什么要分开看? 面试回答。 训练的目标是把参数学出来,核心瓶颈是数据、loss、优化器、反向传播、通信和收敛稳定性
-
知识问答:基础与 Transformer QA
机器学习基础、Transformer、tokenizer、attention、位置编码和解码策略的高频问法,需要先回答主干,再补公式、机制拆解、追问和边界。 机器学习与深度学习基础 Q:机器学习和深度学习的核心差别是什么? 面试回答。 机器学习的核心是从数据中学习函数 $f theta x $,让输入 映射到预
-
论文专题讲解:vLLM / PagedAttention:为什么 KV cache 需要分页管理
论文题名: Efficient Memory Management for Large Language Model Serving with PagedAttention。 作者: Woosuk Kwon、Zhuohan Li、Siyuan Zhuang、Ying Sheng、Lianmin Zheng、Cody H
-
论文专题讲解:Lance:统一多模态模型,为什么对世界模型有启发
论文题名: Lance: Unified Multimodal Modeling by Multi-Task Synergy。 作者: Fengyi Fu、Mengqi Huang、Shaojin Wu、Yunsheng Jiang、Yufei Huo、Hao Li、Yinghang Song、Fei Ding、Jia
-
论文专题讲解:Emu3.5:原生多模态模型如何变成世界学习器
论文题名: Emu3.5: Native Multimodal Models are World Learners。 作者: Yufeng Cui、Honghao Chen、Haoge Deng、Xu Huang、Xinghang Li、Jirong Liu、Yang Liu、Zhuoyan Luo、Jinsheng