WorldTrace让场景召回提升19.5%

今日概览

  • WorldTrace把长视频失忆变成可寻址问题:它为压缩记忆槽分配训练分布内的虚拟位置,两条路线将LoopBench时间一致性和情节召回分别提升15.5%和19.5%。
  • Modular TTT让测试时学习组件可拆解复用,通过DAG表示快速权重、损失函数和学习率;410M与1.45B模型在100B token训练后达到与Gated DeltaNet相当的表现。
  • ReASearch把搜索决策交给同一个Agent。 它统一评估、诊断、编辑与停止,在14项任务中大多优于专用系统,相对强基线提升2%至40%,但验证纪律仍需核查。

重点关注

01 视频生成 走出训练时域,世界模型为什么突然「认不出」旧场景?

交互式视频一旦走出训练见过的时域,模型即使保存着旧画面,也可能突然找不到它们。这篇工作的亮点,是把长期一致性从「上下文不够长」重新定义成「记忆无法准确寻址」:KV缓存(注意力保存的历史键值)还在增长,但RoPE(旋转位置编码)的时间偏移已经超出训练范围,注意力因此难以取回正确画面。更麻烦的是,直接压缩经过位置旋转的缓存,会把相位不兼容的内容平均在一起,相当于记忆还没用就先被搅乱了。WorldTrace不需要重新训练,而是给每个压缩后的记忆槽分配一个训练分布内、彼此不同的虚拟位置,让模型重新知道该去哪里找。它一条路线压缩连续历史以维持时间连贯,另一条路线在场景切换时原样保存「地标」,用于绕远后重访旧场景。摘要报告,在专门测试长途绕行后场景重建的LoopBench上,两种路线分别将时间一致性和情节召回提升15.5%与19.5%。这给长时程世界模型提供了一个很具体的工程抓手:扩展缓存之前,先确认位置编码和压缩方式有没有让旧记忆变得不可访问;不过这些收益能否延伸到更复杂的交互和更长时域,还需要看全文与更多场景验证。

长期视频一致性的瓶颈可能是记忆寻址,而不只是缓存容量压缩位置编码后的缓存时,应避免混合不兼容的位置相位开发长时程世界模型时,值得单独测试「绕行后重访场景」的召回能力

02 模型架构 别再把每个TTT变体都写成一套新架构

测试时训练(TTT)的问题不只是方法多,而是每种方法往往被硬编码成独立架构,很难判断性能究竟来自哪一处设计。Modular TTT把内部学习器表示为有向无环图,将快速权重、损失函数、学习率等变成可单独替换和归因的组件。摘要中的消融结果也颇为务实:较小的初始学习率、权重衰减和单层非线性有帮助,更深的快速权重网络与归一化反而可能因激活过大而拖累效果。基于这些结论训练的410M和1.45B参数模型,在100B token上取得了与Gated DeltaNet相当的训练损失和基准表现。对研究与工程团队而言,真正值得关注的不是又一个TTT变体,而是一套能复用实验组件、减少重复实现的运行时学习接口,不过其组合能力和工程成本仍需看全文确认。

评估TTT方法时应拆开快速权重与内部学习规则,避免只比较整套架构更深、更复杂的内部网络未必更好,控制激活规模可能更关键统一模块化表示的价值在于加快消融与复用,而非单次榜单提升

03 Agent ReASearch把外层搜索收进同一个Agent循环

优化提示词、程序和机器学习工作流,通常需要一套外层算法决定试什么、怎么改以及何时停止。ReASearch把这些决策交给同一个工具型Agent:它会评估结果、诊断失败、分配预算,并借助持久记忆调整后续搜索策略。用同一套Agent循环处理14项不同任务时,其表现大多优于专用优化系统,相对强基线提升2%至40%,部分结果还超过了此前人工已知最佳方案。真正值得关注的是这种统一接口能否跨任务迁移,而风险也在同一处:当提案、评估和停止决策集中于一个Agent,是否仍能保持稳定的验证纪律,需要看全文中的实验设计才能确认。

优化系统可以把搜索策略内化到Agent,而不只让Agent充当方案生成器统一循环若能跨领域复用,可减少为每类任务定制外层算法的成本评估权与修改权集中后,应优先检查验证机制和预算控制是否可靠
WorldTrace让场景召回提升19.5%

也值得关注

04
当模型规模与数据量并非独立影响损失时,传统缩放律在数据稀缺和过度训练区间的预算判断可能需要重算。 训练优化Skaling尝试结合Chinchilla指数与Kaplan耦合关系。链接
05
统一图像修复模型不应等到主干网络才感知退化类型,token化阶段本身也可以随空间不均匀的损伤而变形。 图像生成该工作提出退化感知的可变形token化方法。链接
06
为社交机器人选择基础模型时,通用榜单覆盖不了实时具身互动,社区评测框架需要把现场约束纳入选型依据。 评测论文主张为社交机器人建立社区评测框架。链接
07
视觉语言模型若能一次剪枝、无需重训且不绑定具体任务,受限设备上的部署成本可能显著下降。 推理加速Prune Once探索免重训、任务无关的视觉语言模型剪枝。链接
08
现成Diffusion Transformer能否免训练扩展到高分辨率,决定高分辨率生成是否必须重新支付训练成本。 图像生成HRDiT面向现成DiT模型探索免训练高分辨率生成。链接
09
自然图像损坏下的鲁棒性不只存在于最终表示中,显式识别并重整模型内部计算路径提供了新的分析尺度。 可解释性该工作从抑制与多样化内部路径入手研究损坏鲁棒性。链接
10
让系统自主发现加速器调试算法,有望减少光源设计变更后由专家反复重写调试流程的成本。 AI for Science研究将算法自主发现用于加速器模拟调试。链接

今日观察

Modular TTT、可寻址视频记忆与ReASearch指向同一种系统设计变化:运行时学习、长期视觉检索和搜索决策不再只是模型内部难以检查的隐式行为,而被暴露成可以配置、记录和独立评测的操作机制。基础模型仍然决定能力上限,但真正拉开系统差异的,可能是一套覆盖快速权重、记忆地址和搜索过程的显式运行时控制面。缺少分层记录时,整体指标即使上升,也无法判断收益来自参数更新、记忆命中还是更好的评估决策。下一轮实验应为这三层分别建立日志与指标:记录快速权重更新轨迹、记忆地址命中率和搜索评估历史,并在总分之外逐层做消融。