ByteNoteByteNote
视频蒸馏补上帧级老师,RL 推理走 FP4 快五倍
字

字节笔记本

2026年10月7日 · 约 2 分钟读完

视频蒸馏补上帧级老师,RL 推理走 FP4 快五倍

API中转
¥120

今日 Hugging Face 论文榜双作,一篇管生成侧的蒸馏质量,一篇管训练侧的推理成本,都指向同一件事:把贵的环节变便宜,同时不掉质量。

两篇论文封面图

DuoMatching:联合之外再盯单帧

Jiahao Zhan 等人的 DuoMatching(arXiv:2610.03543,今日榜 39 赞第 2 位)处理少步流式视频生成的蒸馏。分布匹配蒸馏只对齐帧的联合分布,结果是动态还行但单帧画质与语义对齐总差一口气。

框架加了两个东西:一是边缘分布匹配目标,用图像生成器当帧级老师,把单帧质量单独盯起来;二是两个配件,LatentBridge 弥合视频学生与图像老师之间的潜空间差异,潜变采样把监督摊到各个时间片段,避免梯度挤在同一段。结果:画质、构图与语义对齐全面改善,运动动态不受损,人类偏好对比各基线的胜率超过八成。项目页已开放,代码链接暂未见。

TRACE:让量化在训练时就知道推理的疼

双目标与 FP4 图解

Xin Wang 等人的 TRACE(arXiv:2610.07767,17 赞)盯的是强化学习后训练最烧钱的部分:rollout 生成。低精度 FP4 rollout 是现成答案,但既有方法把训练路径与推理路径的量化精度分开优化,两条路径之间的差距没人管。TRACE 的思路很巧:用 rollout 侧的量化结果反过来指导训练侧的 FP4 取整决策,直接压缩两条量化路径的差异;再按需缓存深层尾数与缩放信息,降低存储与通信开销。四个大 MoE 模型、推理编码与长程 RL 任务上,TRACE 在权重激活与 KV 缓存全 FP4 的 rollout 下匹配 BF16 性能,最高提速 5.4 倍,最终 FP4 结果也优于先 BF16 训练再事后量化。

放在一起读

一篇让视频生成的老师更称职,一篇让 RL 的账单缩到五分之一。与站内视频线(FrameMorrow 选帧、Kandinsky 开源)和训练线(Pivot-SD 落子)各自接续:省算力这件事,已经从工程 trick 升级为方法学。

相关文章

分享: