今日概览
- 论文转海报工作流可通过反馈递归改进:接入学习后的DesignHarness后,7种代码Agent与模型配置均获得提升,平均得分从54.99升至67.39;目前证据限于论文转海报任务。
- Evoke将持久世界状态移出生成上下文,用外部状态库、长时教师监督和3步学生模型兼顾长期一致性与低延迟生成。
- 复合选项错误可能源于组合机制,而非知识不足。模型判断原子命题,整数规划负责AND、OR和NOR等逻辑约束,两个数据集的Macro-F1均提升约29点。
- Intern-S2-Preview尝试统一科学Agent训练管线:397B主干结合多模态训练与4B记忆解码器,为长任务链和低成本领域适配提供底座。
重点关注
01 论文转海报:递归反馈让7种配置都获益
在论文转海报任务中,AutoDesign把静态DesignHarness变成可根据产出反馈递归改进的对象。元优化器依据每轮rollout反馈,引导代码Agent递归修改DesignHarness。接入学习后的DesignHarness后,7种受控代码Agent与模型配置均获得提升,平均得分从54.99升至67.39。它在覆盖5个学科、100篇论文的PosterBench上拿到78.32分,比闭源商业系统Claude Design高7.45分。这组结果并不能证明工作流普遍比模型更重要,但说明在论文转海报这个任务边界内,递归优化harness能为不同配置带来一致增益。一次完全自主运行能在40分钟内完成253次工具调用和11轮编辑,成本低于3美元,并在人评中达到平均会议海报质量;盲测偏好也位居第一。现在还不能据此断言这套方法能泛化到所有设计任务,但对构建长链路设计Agent的团队来说,可以优先验证递归反馈机制能否在目标明确、评价稳定的任务中复现这种跨配置增益。
原文:AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
02 视频生成:把记忆搬出生成器,世界模型终于能持续在线了
世界模型要长期在线,通常得在记忆容量和响应速度之间交税;Evoke最有意思的地方,是把这笔账从模型能力问题改写成系统架构问题。它将场景几何存入按相机索引的外部状态库,每次只取回当前视角需要的信息,因此交互时间再长,生成器自身的上下文也不必持续膨胀。与此同时,教师模型通过分块、远程帧检索和线性注意力全局状态接受长时监督,再通过在自生成rollout下应用30秒分布匹配目标,将抗长期漂移与响应式条件控制迁移给仅需3步生成的学生模型。这样一来,持久记忆、长时监督与低延迟生成被拆成可独立扩展的模块,在线世界模型的设计重点也从「塞下更多历史」转向「维护并检索一个持续演化的世界状态」。不过在单张H200上生成1.5秒片段仍需2.11秒,距离严格实时还有一步,但这套状态与生成解耦的架构可能比「视频能生成多久」更值得做世界模拟、游戏和具身智能的团队关注。
原文:Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
03 推理:模型明明判断都对,为什么还是会选错?
模型可能已经判断对每个原子命题,却仍在AND、OR或NEITHER/NOR的组合处出错——问题未必是知识不足,而可能是答案表示方式出了问题。这项工作干脆不让模型处理复合选项:先把选项拆成原子判断,为相互对立的假设打分,再由带逻辑约束的整数规划组合成最终答案。这个分工很值得复用:模型负责有不确定性的语义判断,确定性的逻辑一致性则交给求解器。在两个数据集上,Macro-F1分别从48.3提升到77.0、从47.0提升到75.6,NEITHER/NOR上的增益尤其明显。不过,这种方法的上限取决于原子拆解是否准确、分数是否校准良好,其鲁棒性还需要看全文和更多场景验证。
04 AI for Science:把科学工作流塞进一个模型,就算「科学基础模型」了吗?
科学Agent正在从读论文、调用工具,走向同时处理文档、图像、时间序列,并在长任务链中持续推进。Intern-S2-Preview的核心不只是397B参数,而是把科学多模态预训练、监督微调、多任务强化学习和在线蒸馏串成统一管线,再用带离策略校正的部分rollout、长度调节等技术稳住训练。架构上,它为时间序列增加数值预测能力,同时另设4B记忆解码器,让冻结的397B主干快速适配特定领域。
从摘要披露的结果看,记忆扩展将生物学指令任务平均分从56.92提升到60.32,说明「不改主干即可专业化」有实际潜力。但所谓「可迁移的科学底座」是否成立,仍取决于它能否低成本进入未参与训练的新学科;否则,这更像是把多个科学工作流汇入同一套规模化工程,需要看全文和跨领域迁移实验才能判断。

也值得关注
今日观察
今天几项长时程工作恰好覆盖了系统生命周期的不同断点:AutoDesign优化任务开始前后的执行框架,Evoke与LycheeMemory V2管理运行中的世界状态和历史证据,PlayWorld则让Agent用长程目标验收最终行为。这些工作不应仅凭共同使用「long-horizon」就被归为同一趋势,因为它们解决的是执行流程、状态维护、证据沉淀和结果验收等不同问题,改进也可能在统一的端到端分数中互相掩盖。对工程团队更有用的行动,是为下一轮实验分别建立流程版本、状态保真和目标完成三套指标,并逐项进行消融与回归测试。