今日概览
- 约束harness编辑可换取有限但可迁移的收益,RRSI在演化数据划分上最高提升14.1分,在五个分布外基准上最高提升4.7分,同时减少30%的策略token消耗。
- WorldCrafter按目标相机视角压缩历史:它将多视图观察读成固定数量的视角相关token,无需显式的基于深度的对应关系;摘要报告其可改善分钟级探索的长时一致性与相机控制。
- 逐token纠错可能降低标注成本并保留模型分布。onPanda在很大程度上保留模型自身的生成分布;一项小规模对照研究显示,相较人工后编辑,中位标注耗时降低52%。
重点关注
01 Agent高分Harness,可能只是记住了基准
同分布评测上的高分,可能掩盖Agent harness把训练任务「写进系统」的过拟合风险。RRSI没有继续追求更多候选改动,而是给自动迭代加上约束:用随时间调整的预算限制一次打包的编辑数量,并根据演化历史鼓励探索尚未尝试的路径。候选进入选择阶段后,批评器会筛掉过于贴合特定基准的方案,剪枝器则移除收益太小、成本太高或已经失效的改动,留下更可能复用的机制。结果需要分开看:在用于演化的数据划分上最高提升14.1分,但在五个分布外基准上最高只提升4.7分,说明迁移收益存在,却远非「能力飞跃」。更实用的信号是,正则化后的harness比无约束演化少消耗30%的策略token,表明克制编辑不仅有助于泛化,也能降低运行成本。对正在自动优化Agent提示词、工具链和控制流的团队而言,真正值得复制的不是递归改写本身,而是把泛化审查、成本约束和失效机制清理纳入选择流程。
原文:RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
02 视频生成 相机先提问,记忆再压缩:分钟级世界探索为何更稳?
保存得越多未必记得越好,真正关键的是下一次从哪个视角观察。WorldCrafter让目标相机视角参与历史压缩,把多视图证据读成固定数量、专门服务于目标视角的token,再交给视频生成器去噪。它不依赖显式深度建立跨视角对应,而是让记忆编码器与视角条件读取模块联合学习「这次该取出什么」,很适合生成模型有限的上下文预算。结合近期时间上下文与少步蒸馏后,该方法能从单张图片或文本提示持续探索场景。摘要报告其在静态和动态场景中改善了长时一致性与相机控制,并保持分钟级探索的视觉质量;这个结果很值得关注,但泛化范围和具体优势仍需看全文与更多场景验证。
原文:WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory
03 训练优化 改掉第一个错token,比重写整段更懂模型
人工标注模型回答时,整段重写不仅慢,还容易把数据变成人类写作样本。onPanda让标注者定位第一个不合适的token,修正后从新前缀继续生成,反复迭代到结果可用。由于最终文本大部分仍由模型采样产生,这类数据更贴近模型自身的生成分布,适合构造on-policy SFT、偏好数据和Agent交互轨迹。每次修正还会自然留下错误token、正确替代及其精确位置,直接形成细粒度的正负样本。在小规模对照研究中,相较人工后编辑,中位标注耗时降低52%,但这更适合作为早期效率信号,通用收益仍需更大规模验证。
