AI4AI升至71.21%,AskChem索引240万论断

今日概览

  • PhiZero把物理变化变成离散语言:世界模型先推理状态变化、再渲染视频,让动力学有望成为可检查、可组合的中间表示。
  • AskChem交付带出处的论断,而非论文列表,已从14.7万篇论文中索引240万条论断,试图压缩科研中的检索、核验与综合链路。
  • Metis把Agent记忆推进模型内部。它通过可演化记忆状态与记忆注意力实现无梯度在线更新,但是否优于外部模块仍需按任务验证。
  • Frontis-MA1拆分AI4AI的两笔增益:在单张RTX 4090、每项任务12小时的条件下,模型训练与搜索框架将MLE-Bench Lite成绩从39.39%分阶段提升至71.21%。

重点关注

01 模型架构 会画下一帧,不等于会表达物理规律

预测像素追求的是「接下来长什么样」,表达物理变化则要回答「世界为什么这样演化」。PhiZero把两者拆开:先从真实世界视频中自监督学习一种紧凑、离散的「物理语言」,用它描述世界状态如何变化,再把推理出的变化渲染成视频。这种「先推理、后渲染」的架构让物理规律不必继续隐含在高维像素预测器里,而可能成为可检查、可组合、可复用的中间表示。摘要称,该方法在生成与理解基准上展现了物理一致性,并可用于交互式世界建模、细粒度动作条件模拟和零样本运动迁移。真正令人兴奋的不是视频是否更逼真,而是世界模型或许开始拥有一种显式表达「发生了什么」的接口。至于这种物理语言是否真的可被人类解释、能否跨场景稳定复用,以及它比纯像素路线强多少,还需要看全文和具体实验确认。

评估世界模型时,除了画面质量,还应检查其状态变化能否被显式表示和追踪「先推理、后渲染」可能让模拟结果更容易调试、控制和复用物理语言的可解释性与跨场景泛化能力,是判断这条路线能否落地的关键。

02 AI for Science 搜索结果从论文变成「可核验论断」,科研工作流会怎样改变?

一个化学问题的回答要真正可用,检索结果需要同时交付结论、出处和可定位的原文证据。AskChem把检索单位改成原子化、带类型的论断,每条都绑定DOI及原文引句或明确的证据位置,并通过分类体系和证据图支持进一步综合。目前系统从14.7万篇论文中索引了240万条论断,还提供网页、REST、SDK和MCP接口,意味着Agent可以直接围绕证据链工作,而不只是在搜索结果页上挑文章。摘要报告称,接入AskChem后,GPT-5.5生成结果中的DOI可解析率从无检索时的88.3%升至100%,但论断抽取是否准确、证据关系是否可靠,仍需看全文和更细的评测。对科研工具团队而言,值得关注的不是又多了一个搜索入口,而是「检索—核验—综合」这段人工链路能否被压缩成可审计的基础设施。

评估科研检索产品时,应检查交付物能否直接追溯到原文证据为科研Agent设计流程时,可优先采用结构化论断而非整篇论文作为上下文单位DOI可解析率改善了引用可用性,但论断抽取和证据关联的准确性仍需单独验证。

03 Agent 记忆该留在模型外,还是长进基础模型?

Agent记忆通常由向量数据库、检索器等外部模块负责,Metis则把它重新定义为基础模型的原生能力。它在模型骨干中加入可持续演化的记忆状态,并通过「记忆注意力」读取被压缩的历史信息,让存储与调用都能参与端到端训练。部署时模型权重保持冻结,在线更新记忆不需要梯度,只需一次前向计算,这可能简化训练与推理系统的边界。论文摘要称其已展示原生记忆能力,但没有提供足够数字判断收益究竟来自架构、训练数据还是额外计算。对Agent团队而言,这条路线值得关注,不过「原生记忆」能否胜过成熟、可审计且易替换的外部模块,仍需在具体任务中验证。

原生记忆可能让存储与调用进入端到端优化,而不再只是外挂检索冻结权重、仅靠前向计算更新记忆,有望降低在线维护复杂度选型时应比较任务效果、成本与可控性,不能仅凭「原生」标签判断优劣。

04 代码智能 12小时预算里的两笔增益:模型训练与搜索框架

在单张RTX 4090、每项任务12小时的约束下,基础模型在MLE-Bench Lite上得到39.39%,35B模型配合搜索框架后达到60.61%,再加入经验先验和异步搜索后升至71.21%。OpenMLE将任务环境、执行反馈、算子训练与长程搜索纳入开放栈,以实际运行结果驱动程序改进和组合。分阶段成绩说明,在固定资源下,模型训练、经验先验和搜索机制都可能影响最终表现;留出测试也显示模型训练与搜索框架能分别带来增益。不过,这些数字来自Lite版本和特定预算,各部分的独立贡献仍需结合消融实验判断,也不能直接外推到更广泛的机器学习工程任务。

在固定算力与时间预算下,应分别衡量模型训练和搜索框架的收益从60.61%到71.21%的提升表明经验先验与异步搜索值得单独评估Lite基准上的显著提升仍需在更多任务和完整评测中验证。

也值得关注

05
SkillRise把跨任务可复用技能纳入统一强化学习框架 Agent重点观察Agent训练能否摆脱每道任务各练各的低复用模式。链接
06
SpatialCLI先借助专用空间工具看清关键细节,再尝试脱离工具推理 多模态为通用VLM与视觉专家之间的能力错配提供一条蒸馏路径。链接
07
StatePlay把显式状态重新放回可交互生成的核心 视频生成游戏世界模型若只生成逼真画面,仍可能违反血量、技能与终局规则。链接
08
MemHarness主张根据当前状态重构记忆,而非原样回放历史经验 Agent直接回应检索记忆与现实决策不匹配的问题。链接
09
冻结的语音纠错器只需读取一份可控更新的领域记忆文件 Agent为无需重训的流式ASR适配提供轻量方案。链接
10
Flux-OPD让上下文随学生能力演化,以持续提供监督 训练优化它适用于缺少可验证奖励的开放任务,但动态教师也会带来训练目标漂移。链接
11
ACE-Data-0同步采集第一视角、全身动作、操作、物体状态、声音与触觉 机器人试图从数据源头补齐具身学习的模态碎片化。链接
12
Chimera为图像、视频和多模态条件设计混合扩散骨干与规模法则 图像生成重点在于绕开全注意力面对高分辨率和长序列时的二次成本。链接
13
MADRS流程面向临床试验辅助抑郁量表评估 AI for Science其价值在于提高标准化程度与可审计性,而不是实现自动诊断。链接

今日观察

今天多项工作正在把模型外部的临时脚手架变成可学习、可验证的系统对象:SpatialCLI把专用视觉工具教给模型后尝试撤掉工具,SkillRise把零散经验收束为跨任务技能,Metis把外接记忆推进到基础模型内部,PhiZero则把隐含在像素中的动力学抽成物理语言。

共同信号不是「模型要包办一切」,而是团队需要重新决定哪些能力应在推理时外挂、哪些值得通过训练内化。外挂模块通常更容易更新、替换和审计,内化能力则可能减少调用延迟、接口故障与运行时依赖,但会把能力更新转化为数据建设和训练成本。两者并非单向替代关系,成熟系统更可能依据任务风险、变化频率与验证要求采用不同组合。

具体行动上,可为候选能力建立一张「外挂—内化」评估表,分别测量调用延迟与故障率、能力更新所需的数据和训练成本,以及外部模块提供的可检查性,再用同一任务集做端到端对照实验后决定架构。