滤波修正扩散采样,单相机重建人景

今日概览

  • 把扩散去噪当成状态估计而非解ODE:DiFA借卡尔曼滤波的思路,在推理时融合反向轨迹上的历次预测来校正每一步,训练-free、直接挂现有模型,CIFAR-10/ImageNet上多项指标改善——但摘要只给了定性说法。
  • 让评审别只打一个分,把文字反馈留下来当经验:LLM-as-a-Coach把评审的rubric判断蒸馏成可迁移的「经验知识」再喂回策略,针对的正是写作、对话这类无法验证对错、GRPO/RLHF最吃力的场景。
  • 一个可穿戴相机,同时拿到「看的人」和「被看的景」:ReViV从单目第一视角视频一次前馈同时重建viewer(相机/注视/身体/手)与view(场景深度)的4D表示,多个benchmark上SOTA,代码模型全开源。

重点关注

01 图像生成 把去噪当成滤波问题,能白捡多少质量?

主流扩散推理默认每一步的预测都是准的,本质上是在解一个常微分方程(ODE),把生成当纯数值积分。DiFA的反转在于:既然每步去噪都带统计不确定性,那不如把它当成一个状态估计问题——借鉴卡尔曼滤波的思路,把反向轨迹上历次预测当作彼此相关的「观测」,按结构一致性和噪声水平的匹配度加权,融合成一个时间上的共识估计;再加一个偏差引导机制,防止这种平均把细节磨平。最实际的一点是训练-free:不用重训、不改模型,直接挂到现有扩散模型的采样过程上就能用。CIFAR-10和ImageNet上FID、IS、FD-DINOv2几个指标都有改善,但摘要只给了「significant improvement」的定性说法,没给具体数字,也没说在不同模型架构上的迁移表现。这类推理时的采样trick历来收益边界不好说——有的模型上明显、有的几乎白干,值不值得上还得看它对你手上那个具体模型的实际增益。

「把采样当解ODE」这个默认视角丢掉了去噪的不确定性,DiFA用滤波思路把它补回来,且不用重训训练-free意味着几乎零迁移成本,值得在自己的采样管线上跑个A/B看看真实收益但推理时trick跨模型迁移性存疑,摘要缺具体数字,别指望它是稳定的免费午餐。

02 训练优化 评审的rubric理由,本该当训练信号留下来

在写作、对话这类没有标准答案的任务上做RL,评审模型本来会给出一整套rubric打分和理由,但训练时这些文字全被压成一个奖励数值喂给策略。这篇的做法是把评审从「打分者」改成「教练」:让它把对每条回答的判断整理成可迁移的「经验知识」——具体好在哪、差在哪、下次怎么改——再通过on-policy的方式让策略把这些经验内化。作者称这种更高带宽的反馈能保留高质量回答之间的细微偏好差异,在训练分布之外泛化更好,也更不容易被reward hacking钻空子。方向是合理的:post-training里GRPO/RLHF最吃力的正是这类无法验证对错的场景,密集的文字监督确实比稀疏标量信息量大。但摘要没给具体量级和对比基线的细节,经验知识如何蒸馏、成本多大,需要看全文确认。

无ground truth的开放任务是RLHF最弱的一环,把评审的文字理由留下来当训练信号是个值得试的方向宣称的泛化更好、抗reward hacking是这类方法最该验证的点,别只看主指标对做写作/对话类post-training的团队有参考价值,但落地成本和实现细节需看全文。

03 多模态 一个可穿戴相机,同时拿到「看的人」和「被看的景」

从第一视角视频做重建,场景和人往往被拆成两套pipeline——一套算相机轨迹和深度,一套算身体和手部动作,可这两件事本来强耦合。ReViV把它们合进一个前馈网络:从单目RGB视频同时输出viewer(相机轨迹、注视方向、全身和手部动作)和view(场景深度)的4D表示,还不依赖预先算好的相机轨迹这类额外输入。做法是把所有模态信号当成一个联合概率分布来学,用掩码生成式Transformer一次性推理,速度比分任务拼起来更快。在HoloAssist、HOT3D、Aria Digital Twin等多个benchmark上做到SOTA,代码和模型全开源,ECCV接收。对做AR/具身数据采集的团队,这意味着一个便宜的可穿戴相机就能拿到viewer+view的整体4D,不用再维护两套流水线——不过整体精度和鲁棒性具体好到什么程度,还得看目标场景实测。

单目第一视角视频一次性重建「人」(相机/注视/身体/手)加「景」(深度),省掉拼两套pipeline的工程量不依赖预算好的相机轨迹、单前馈架构推理更快,对实际数据采集更友好代码模型全开源且ECCV接收,做AR/具身数据的可以直接上手验证。
滤波修正扩散采样,单相机重建人景

也值得关注

04
普林斯顿的RL综述,从经典算法一路铺到基础模型时代 训练优化适合想系统补一遍RL脉络、看清它怎么长成今天post-training主力的人。链接
05
用CoT推理来稳定RLHF里的价值冲突处理 安全对齐从几何视角解释标量奖励下模型为什么会在冲突价值间摇摆。链接
06
把Mamba/状态空间模型做成自适应神经算子来解PDE AI for Science主打任意几何和多种网格上的求解(ICLR)。链接
07
工业视频异常检测,用object-centric跟踪加VLM推理 多模态冲的是通用VLM在真实工业场景里漏检、说不清异常的问题。链接
08
从航拍图生成可路由的行人路网 机器人难点不是「检测哪里有人行道」而是补全被遮挡、隐式定义的连通关系,用RL来处理这种复杂连通性。链接