RRSI五个分布外基准最高提升4.7分

今日概览

  • 约束harness编辑可换取有限但可迁移的收益,RRSI在演化数据划分上最高提升14.1分,在五个分布外基准上最高提升4.7分,同时减少30%的策略token消耗。
  • WorldCrafter按目标相机视角压缩历史:它将多视图观察读成固定数量的视角相关token,无需显式的基于深度的对应关系;摘要报告其可改善分钟级探索的长时一致性与相机控制。
  • 逐token纠错可能降低标注成本并保留模型分布。onPanda在很大程度上保留模型自身的生成分布;一项小规模对照研究显示,相较人工后编辑,中位标注耗时降低52%。

重点关注

01 Agent高分Harness,可能只是记住了基准

同分布评测上的高分,可能掩盖Agent harness把训练任务「写进系统」的过拟合风险。RRSI没有继续追求更多候选改动,而是给自动迭代加上约束:用随时间调整的预算限制一次打包的编辑数量,并根据演化历史鼓励探索尚未尝试的路径。候选进入选择阶段后,批评器会筛掉过于贴合特定基准的方案,剪枝器则移除收益太小、成本太高或已经失效的改动,留下更可能复用的机制。结果需要分开看:在用于演化的数据划分上最高提升14.1分,但在五个分布外基准上最高只提升4.7分,说明迁移收益存在,却远非「能力飞跃」。更实用的信号是,正则化后的harness比无约束演化少消耗30%的策略token,表明克制编辑不仅有助于泛化,也能降低运行成本。对正在自动优化Agent提示词、工具链和控制流的团队而言,真正值得复制的不是递归改写本身,而是把泛化审查、成本约束和失效机制清理纳入选择流程。

评估harness自动优化时,应把同分布成绩与分布外成绩分开报告限制单轮编辑规模并追踪探索历史,有助于减少面向基准的堆叠式改动部署决策应同时考察迁移收益和策略token成本,而不是只看最高增分

02 视频生成 相机先提问,记忆再压缩:分钟级世界探索为何更稳?

保存得越多未必记得越好,真正关键的是下一次从哪个视角观察。WorldCrafter让目标相机视角参与历史压缩,把多视图证据读成固定数量、专门服务于目标视角的token,再交给视频生成器去噪。它不依赖显式深度建立跨视角对应,而是让记忆编码器与视角条件读取模块联合学习「这次该取出什么」,很适合生成模型有限的上下文预算。结合近期时间上下文与少步蒸馏后,该方法能从单张图片或文本提示持续探索场景。摘要报告其在静态和动态场景中改善了长时一致性与相机控制,并保持分钟级探索的视觉质量;这个结果很值得关注,但泛化范围和具体优势仍需看全文与更多场景验证。

长时世界模型不必原样保存历史,可以围绕目标视角动态压缩固定数量的视角相关token,为有限上下文预算提供了清晰接口分钟级探索已显出潜力,但不能仅凭摘要推断其适用于所有动态环境

03 训练优化 改掉第一个错token,比重写整段更懂模型

人工标注模型回答时,整段重写不仅慢,还容易把数据变成人类写作样本。onPanda让标注者定位第一个不合适的token,修正后从新前缀继续生成,反复迭代到结果可用。由于最终文本大部分仍由模型采样产生,这类数据更贴近模型自身的生成分布,适合构造on-policy SFT、偏好数据和Agent交互轨迹。每次修正还会自然留下错误token、正确替代及其精确位置,直接形成细粒度的正负样本。在小规模对照研究中,相较人工后编辑,中位标注耗时降低52%,但这更适合作为早期效率信号,通用收益仍需更大规模验证。

逐token纠错有望同时减少人工成本,并在很大程度上保留模型生成分布修正记录天然提供带精确位置的正负监督小规模对照研究中相较人工后编辑的中位标注耗时降低52%,暂不宜外推为普遍结论
RRSI五个分布外基准最高提升4.7分

也值得关注

04
GameHorizon把离线能力分数与真实游戏中的逐步失败纳入同一套多时间尺度评测 评测数据覆盖21款游戏、5000小时专家录像,并执行超过100万次模型调用。链接
05
Jev-Mem用轻量控制平面管理记忆路由、预算分配与停止判断 Agent系统仅在复杂推理时调用慢速模型,并在LoCoMo上同时报告效果与延迟收益。链接
06
移除专用harness后,Harness-Zero仍将宏平均任务成功率从23.3%提高至44.3% 训练优化它尝试把harness诱导出的行为蒸馏进模型权重。链接
07
D-RAC相较使用前沿LLM的Agent式分块,让分块阶段的输出token减少95.7% 检索它先用多模态模型把页面转换为检索友好的Markdown,再让分块模型规划确定性文本单元的ID。链接
08
更换更强生成工具后,VideoGen-Agent无需重新训练即可把VABench得分从75.6提高至86.1 视频生成Agent学习协调增强、生成与验证工具。链接
09
ACLArena从模型与token层面分析多阶段后训练中的遗忘 训练优化研究比较多教师同策略蒸馏(on-policy distillation)、自蒸馏微调与模型合并;其方案另将高质量轨迹离线回放和经RL专门化的路由LoRA专家结合。链接
10
Complex KDA用单次对角加秩一更新表达二维旋转 模型架构方法只扩展门控与delta系数的取值范围,同时保留非扩张性与原有计算结构。链接
11
KernelBench官方检查漏掉16.9%的有独立证据故障 评测该结果来自对188道题注入的10303个可编译故障,其中精度故障漏检率达到78.6%。链接
12
EvidenT在生成答案前用确定性词汇对齐核验检索证据 检索在约500个真实企业查询中,相较提示词基线,命中金标准来源的比例平均提高29%。链接
13
ARPS在LIBERO-Plus零适配迁移中达到87.3%的成功率 机器人动作专家只读取面向未来、与动作相关的紧凑预测状态,结果比Fast-WAM高39.2个百分点。链接
14
相近的建议修改率不能决定医疗模型authority gap的大小或正负 评测AuthEval将模型建议与本地服务的最终选择分开评分。链接