今日概览
- WorldTrace把长视频失忆变成可寻址问题:它为压缩记忆槽分配训练分布内的虚拟位置,两条路线将LoopBench时间一致性和情节召回分别提升15.5%和19.5%。
- Modular TTT让测试时学习组件可拆解复用,通过DAG表示快速权重、损失函数和学习率;410M与1.45B模型在100B token训练后达到与Gated DeltaNet相当的表现。
- ReASearch把搜索决策交给同一个Agent。 它统一评估、诊断、编辑与停止,在14项任务中大多优于专用系统,相对强基线提升2%至40%,但验证纪律仍需核查。
重点关注
01 视频生成 走出训练时域,世界模型为什么突然「认不出」旧场景?
交互式视频一旦走出训练见过的时域,模型即使保存着旧画面,也可能突然找不到它们。这篇工作的亮点,是把长期一致性从「上下文不够长」重新定义成「记忆无法准确寻址」:KV缓存(注意力保存的历史键值)还在增长,但RoPE(旋转位置编码)的时间偏移已经超出训练范围,注意力因此难以取回正确画面。更麻烦的是,直接压缩经过位置旋转的缓存,会把相位不兼容的内容平均在一起,相当于记忆还没用就先被搅乱了。WorldTrace不需要重新训练,而是给每个压缩后的记忆槽分配一个训练分布内、彼此不同的虚拟位置,让模型重新知道该去哪里找。它一条路线压缩连续历史以维持时间连贯,另一条路线在场景切换时原样保存「地标」,用于绕远后重访旧场景。摘要报告,在专门测试长途绕行后场景重建的LoopBench上,两种路线分别将时间一致性和情节召回提升15.5%与19.5%。这给长时程世界模型提供了一个很具体的工程抓手:扩展缓存之前,先确认位置编码和压缩方式有没有让旧记忆变得不可访问;不过这些收益能否延伸到更复杂的交互和更长时域,还需要看全文与更多场景验证。
原文:Addressable Memory for Video World Models
02 模型架构 别再把每个TTT变体都写成一套新架构
测试时训练(TTT)的问题不只是方法多,而是每种方法往往被硬编码成独立架构,很难判断性能究竟来自哪一处设计。Modular TTT把内部学习器表示为有向无环图,将快速权重、损失函数、学习率等变成可单独替换和归因的组件。摘要中的消融结果也颇为务实:较小的初始学习率、权重衰减和单层非线性有帮助,更深的快速权重网络与归一化反而可能因激活过大而拖累效果。基于这些结论训练的410M和1.45B参数模型,在100B token上取得了与Gated DeltaNet相当的训练损失和基准表现。对研究与工程团队而言,真正值得关注的不是又一个TTT变体,而是一套能复用实验组件、减少重复实现的运行时学习接口,不过其组合能力和工程成本仍需看全文确认。
原文:Modular TTT: Rethinking Test-Time Training as Composable Modules
03 Agent ReASearch把外层搜索收进同一个Agent循环
优化提示词、程序和机器学习工作流,通常需要一套外层算法决定试什么、怎么改以及何时停止。ReASearch把这些决策交给同一个工具型Agent:它会评估结果、诊断失败、分配预算,并借助持久记忆调整后续搜索策略。用同一套Agent循环处理14项不同任务时,其表现大多优于专用优化系统,相对强基线提升2%至40%,部分结果还超过了此前人工已知最佳方案。真正值得关注的是这种统一接口能否跨任务迁移,而风险也在同一处:当提案、评估和停止决策集中于一个Agent,是否仍能保持稳定的验证纪律,需要看全文中的实验设计才能确认。
原文:The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

也值得关注
今日观察
Modular TTT、可寻址视频记忆与ReASearch指向同一种系统设计变化:运行时学习、长期视觉检索和搜索决策不再只是模型内部难以检查的隐式行为,而被暴露成可以配置、记录和独立评测的操作机制。基础模型仍然决定能力上限,但真正拉开系统差异的,可能是一套覆盖快速权重、记忆地址和搜索过程的显式运行时控制面。缺少分层记录时,整体指标即使上升,也无法判断收益来自参数更新、记忆命中还是更好的评估决策。下一轮实验应为这三层分别建立日志与指标:记录快速权重更新轨迹、记忆地址命中率和搜索评估历史,并在总分之外逐层做消融。