QLoRA 很容易被一句话误导:用 4bit 训练大模型。更准确的说法是: 冻结的底座模型用 4bit 存储,训练时只更新一小组 LoRA adapter;梯度穿过量化底座流向 adapter,但底座权重本身不做全量更新。 QLoRA 可以显著省显存,但它和 PTQ、QAT、全量低比特训练不是一回事。 先把显存账拆开
-
量化:QAT、Kernel 与 KV Cache
QAT 、 kernel 和 KV cache quantization 是三件不同的事: QAT 解决模型怎样适应量化误差, kernel 决定低比特是否真的跑得快, KV cache quantization 解决长上下文推理里的动态显存和带宽。 核心问题 量化落地最容易出错的地方,是把“模型能承受低比特误差”“低
-
量化:PTQ、GPTQ、AWQ 与 SmoothQuant:先找瓶颈,再分误差预算
量化不是把 float16 文件改成 int4 文件。它真正做的是:用更少的离散格子近似原来的连续数值,同时让模型质量、服务延迟和长尾任务尽量不坏。文件变小只说明存储少了;上线成功还要证明低比特 kernel 命中、请求分布匹配、质量分桶没有退化。 更实用的问题是: 量化到底在保护哪类误差,省下的成本又落在权重、act
-
量化:FP8 与混合精度推理:它不是一个 dtype 开关
FP8 在服务里的价值,是把最吃带宽、最适合 Tensor Core 的大块矩阵计算放到低精度路径上,同时把归一化、softmax、残差、输出头、KV cache、坐标或动作头这些敏感位置留在更高精度或更谨慎的量化策略里。 所以判断 FP8 值不值得上,先别问“能不能压到 8 bit”。更该问四件事:热路径是不是 GE
-
量化:评测与部署清单
量化工作最常见的问题是离线评测太乐观、线上指标没对齐、精度和系统收益没有同时看。 因此这一页给出一个更像 checklist 的结构,帮助把量化从论文实验推进到真实部署。 图源:SmoothQuant。原图表达 activation outlier 可以通过等价缩放迁移到权重侧,让 W8A8 更可行;读图重点是:量化验
-
量化:方法对照表
量化方法对比要回答三个工程问题:误差主要出现在权重、激活、KV cache,还是量化 kernel 和调度兼容性上;某种方法“更准”到底是因为二阶补偿、通道保护、平滑激活,还是训练时已经让模型适应了量化噪声;真实线上收益到底来自显存下降、吞吐增加、单卡可部署,还是仅仅减少了模型文件大小。 量化最容易被误解成“把 16
-
量化:激活离群值:为什么量化常常败在 activation 上
量化听起来像一个存储问题:把 FP16/BF16 权重换成 INT8/INT4,显存立刻下降。但真正让低比特部署翻车的,往往是 activation。权重在推理前已经固定,可以离线统计、分组、搜索;activation 是每个 prompt、每张图、每段上下文现场产生的动态张量。校准集没有覆盖到的输入,可能在某一层某几
-
论文专题讲解:Embodied World Model Survey:具身世界模型综述
论文题名: A Comprehensive Survey on World Models for Embodied AI。 作者: Xinqing Li、Xin He、Le Zhang、Min Wu、Xiaoli Li、Yun Liu。 机构: This work was supported in part by th
-
论文专题讲解:V-JEPA:视频潜变量预测表征
论文题名: Revisiting Feature Prediction for Learning Visual Representations from Video。 作者: Adrien Bardes、Quentin Garrido、Jean Ponce、Xinlei Chen、Michael Rabbat、Yann
-
论文专题讲解:Towards Video World Models:视频世界模型五个门槛
论文题名: Towards Video World Models。 作者: Xun Huang。 机构: 作者个人技术博客;原文未给出机构署名。 时间 / 主题: 2025-07;世界模型。 arXiv / 官方报告: arXiv:未找到专门条目;官方原文:xunhuang.me/blogs/world model.h