整理 Hexo、GitHub Pages 与 Redefine 主题搭建过程中的配置步骤、评论系统和常见问题。
-
Sticky
-
论文专题讲解:PixelDiT:无 VAE 的像素空间 DiT
论文题名: PixelDiT: Pixel Diffusion Transformers for Image Generation。 作者: Yongsheng Yu、Wei Xiong、Weili Nie、Yichen Sheng、Shiqiu Liu、Jiebo Luo。 机构: NVIDIA、University
-
论文专题讲解:LingBot-VA 2.0:原生视频-动作预训练
论文题名: Native Video-Action Pretraining for Generalizable Robot Control。 作者: Qihang Zhang、Lin Li、Luyao Zhang、Shuai Yang、Yiming Luo、Shuaiting Li、Ruilin Wang、Junke
-
思考探索:具身智能的数据鸿沟:先对齐,再扩规模
“跨越数据鸿沟”最值得保留的判断,不是把数据说成万能药,而是把数据问题拆成了一个更硬的工程问题:机器人数据只有在表示、动作、任务和评测都能对齐之后,规模才会变成能力。否则,更多小时数可能只是把更多坐标系、更多动作接口、更多噪声和更多伪相关塞进同一个模型。 这也是为什么我更愿意把当前具身智能的瓶颈写成: 这里的“对齐”不
-
论文专题讲解:LongLive-2.0:NVFP4 长视频生成基础设施
论文题名: LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation。 作者: Yukang Chen、Luozhou Wang、Wei Huang、Shuai Yang、Bohan Zhang、Yicheng Xiao、Ruiha
-
论文专题讲解:DeltaQuant:视频扩散的 4-bit core-delta 量化
论文题名: DeltaQuant: 4-bit Video Diffusion Models with Spatiotemporal Delta Smoothing。 作者: Xingyang Li、Samuel Tesfai、Zhekai Zhang、Haocheng Xi、Shuo Yang、Lvmin Zhang
-
思考探索:从生成视频到维护世界:重建为什么是自动驾驶世界模型的状态接口
关注的问题。 自动驾驶世界模型如果不能只靠“视频看起来真”来证明自己,那么 3D / 4D 重建到底补上了哪一块? 这份 PPT 最值得保留的判断,是把世界模型从“生成一段视频”拉回“维护一个世界”。在自动驾驶里,一段未来视频可以纹理清楚、运动平滑、灯光合理,却仍然没有维护正确的世界状态:车辆被遮挡后可能停止演化,换一
-
思考探索:世界模型该预测什么:答案取决于谁消费未来
把 PlaNet、Dreamer、V-JEPA 和 LingBot-World 放在一起,最先出现的冲突是:它们预测的对象不同,却都被称作世界模型。于是,“像素生成和 latent dynamics 谁更接近真正的世界模型”这个争论就问错了方向。 一段高清未来视频很容易检查,却可能没有严格响应动作;Dreamer 的
-
思考探索:世界模型是什么:从预测画面到承受行动后果
关注的问题。 当视频生成、3D 场景、机器人策略和强化学习都在使用“世界模型”这个词时,怎样给它一个既不过宽、也不把技术路线排除在外的定义? “世界模型”正在变成 AI 里最容易产生误会的词之一。能生成一段视频的模型、可编辑的 3D 场景、物理仿真器、Dreamer 一类的 latent dynamics,以及带视觉输
-
思考探索:读完 12 份技术报告:前沿模型正在变成受约束的闭环
把 12 份技术报告的目录并排,会看到一个反常现象:模型能力越强,报告花在数据、cache、rollout、工具环境和安全控制上的篇幅越多。 checkpoint 仍然重要,但它已经不足以描述一个前沿模型的真实能力。 同一份权重接入不同的 KV cache、thinking budget、工具环境或安全控制,会表现出显