今日概览
- 把扩散去噪当成状态估计而非解ODE:DiFA借卡尔曼滤波的思路,在推理时融合反向轨迹上的历次预测来校正每一步,训练-free、直接挂现有模型,CIFAR-10/ImageNet上多项指标改善——但摘要只给了定性说法。
- 让评审别只打一个分,把文字反馈留下来当经验:LLM-as-a-Coach把评审的rubric判断蒸馏成可迁移的「经验知识」再喂回策略,针对的正是写作、对话这类无法验证对错、GRPO/RLHF最吃力的场景。
- 一个可穿戴相机,同时拿到「看的人」和「被看的景」:ReViV从单目第一视角视频一次前馈同时重建viewer(相机/注视/身体/手)与view(场景深度)的4D表示,多个benchmark上SOTA,代码模型全开源。
重点关注
01 图像生成 把去噪当成滤波问题,能白捡多少质量?
主流扩散推理默认每一步的预测都是准的,本质上是在解一个常微分方程(ODE),把生成当纯数值积分。DiFA的反转在于:既然每步去噪都带统计不确定性,那不如把它当成一个状态估计问题——借鉴卡尔曼滤波的思路,把反向轨迹上历次预测当作彼此相关的「观测」,按结构一致性和噪声水平的匹配度加权,融合成一个时间上的共识估计;再加一个偏差引导机制,防止这种平均把细节磨平。最实际的一点是训练-free:不用重训、不改模型,直接挂到现有扩散模型的采样过程上就能用。CIFAR-10和ImageNet上FID、IS、FD-DINOv2几个指标都有改善,但摘要只给了「significant improvement」的定性说法,没给具体数字,也没说在不同模型架构上的迁移表现。这类推理时的采样trick历来收益边界不好说——有的模型上明显、有的几乎白干,值不值得上还得看它对你手上那个具体模型的实际增益。
原文:DiFA: Inference-Time Forward-Process Alignment for Diffusion Models
02 训练优化 评审的rubric理由,本该当训练信号留下来
在写作、对话这类没有标准答案的任务上做RL,评审模型本来会给出一整套rubric打分和理由,但训练时这些文字全被压成一个奖励数值喂给策略。这篇的做法是把评审从「打分者」改成「教练」:让它把对每条回答的判断整理成可迁移的「经验知识」——具体好在哪、差在哪、下次怎么改——再通过on-policy的方式让策略把这些经验内化。作者称这种更高带宽的反馈能保留高质量回答之间的细微偏好差异,在训练分布之外泛化更好,也更不容易被reward hacking钻空子。方向是合理的:post-training里GRPO/RLHF最吃力的正是这类无法验证对错的场景,密集的文字监督确实比稀疏标量信息量大。但摘要没给具体量级和对比基线的细节,经验知识如何蒸馏、成本多大,需要看全文确认。
原文:LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks
03 多模态 一个可穿戴相机,同时拿到「看的人」和「被看的景」
从第一视角视频做重建,场景和人往往被拆成两套pipeline——一套算相机轨迹和深度,一套算身体和手部动作,可这两件事本来强耦合。ReViV把它们合进一个前馈网络:从单目RGB视频同时输出viewer(相机轨迹、注视方向、全身和手部动作)和view(场景深度)的4D表示,还不依赖预先算好的相机轨迹这类额外输入。做法是把所有模态信号当成一个联合概率分布来学,用掩码生成式Transformer一次性推理,速度比分任务拼起来更快。在HoloAssist、HOT3D、Aria Digital Twin等多个benchmark上做到SOTA,代码和模型全开源,ECCV接收。对做AR/具身数据采集的团队,这意味着一个便宜的可穿戴相机就能拿到viewer+view的整体4D,不用再维护两套流水线——不过整体精度和鲁棒性具体好到什么程度,还得看目标场景实测。
原文:ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video
