论文题名: Beyond Language Modeling: An Exploration of Multimodal Pretraining。 作者: Shengbang Tong、David Fan、John Nguyen、Ellis Brown、Gaoyue Zhou、Shengyi Qian、Boyang Z
-
论文专题讲解:BAGEL:交错多模态预训练中的世界建模涌现
论文题名: Emerging Properties in Unified Multimodal Pretraining。 作者: Chaorui Deng、Deyao Zhu、Kunchang Li、Chenhui Gou、Feng Li、Zeyu Wang、Shu Zhong、Weihao Yu、Xiaonan Ni
-
论文专题讲解:GPU Utilization:为什么 100% 不等于训练跑满
论文题名: GPU Utilization is a Misleading Metric。 作者: Trainy。 机构: Trainy。 时间 / 主题: 2025-02;高效训练。 arXiv / 官方报告: arXiv:未找到专门条目;官方材料:www.trainy.ai/blog/gpu-utilization
-
论文专题讲解:InCoder-32B:工业代码基础模型与执行验证训练
论文题名: InCoder-32B: Code Foundation Model for Industrial Scenarios。 作者: Jian Yang、Wei Zhang、Jiajun Wu、Junhang Cheng、Shawn Guo、Haowen Wang、Weicheng Gu、Yaxin Du、Jo
-
论文专题讲解:MapAnything:统一前向 Metric 3D 重建骨干
论文题名: MapAnything: Universal Feed-Forward Metric 3D Reconstruction。 作者: Nikhil Keetha、Norman Müller、Johannes Schönberger、Lorenzo Porzi、Yuchen Zhang、Tobias Fisch
-
论文专题讲解:Score SDE:把扩散模型写成连续时间生成过程
论文题名: Score-Based Generative Modeling through Stochastic Differential Equations。 作者: Yang Song、Jascha Sohl-Dickstein、Diederik P. Kingma、Abhishek Kumar、Stefano E
-
论文专题讲解:VO-DP:RGB-only 扩散策略怎样借用语义和几何特征
论文题名: VO-DP: Semantic-Geometric Adaptive Diffusion Policy for Vision-Only Robotic Manipulation。 作者: Zehao Ni、Yonghao He、Lingfeng Qian、Jilei Mao、Fa Fu、Wei Sui、Hu
-
论文专题讲解:AnyFlow:任意步视频扩散蒸馏
论文题名: AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation。 作者: Yuchao Gu、Guian Fang、Yuxin Jiang、Weijia Mao、Song Han、Han Cai、Mike Zheng
-
思考探索:读懂 Fast-FoundationStereo:从双目几何到高效推理
Fast-FoundationStereo 的“推理”指机器人、AR、自动驾驶和工业视觉里的实时稠密深度感知。模型每慢几十毫秒,系统看到的世界就会滞后一截;模型每错一块边界,后面的避障、抓取或空间理解就可能跟着错。 Fast-FoundationStereo 最值得读的地方,不只是“它比 FoundationStere
-
基础知识:模型压缩、剪枝与 NAS:先问省的是哪张账
很多模型压缩项目的第一版都会遇到一个尴尬结果:参数量少了,模型文件小了,论文表里的 MACs 也降了,但线上请求并没有明显变快,P99 甚至更差。原因通常是压缩方法改的是一张账,真实系统卡的是另一张账。 模型压缩要先固定具体成本账,再把方法放回数据流和硬件路径里看。它是在质量、成本和可部署结构之间重新设计模型。 需要用