今日概览
- PhiZero把物理变化变成离散语言:世界模型先推理状态变化、再渲染视频,让动力学有望成为可检查、可组合的中间表示。
- AskChem交付带出处的论断,而非论文列表,已从14.7万篇论文中索引240万条论断,试图压缩科研中的检索、核验与综合链路。
- Metis把Agent记忆推进模型内部。它通过可演化记忆状态与记忆注意力实现无梯度在线更新,但是否优于外部模块仍需按任务验证。
- Frontis-MA1拆分AI4AI的两笔增益:在单张RTX 4090、每项任务12小时的条件下,模型训练与搜索框架将MLE-Bench Lite成绩从39.39%分阶段提升至71.21%。
重点关注
01 模型架构 会画下一帧,不等于会表达物理规律
预测像素追求的是「接下来长什么样」,表达物理变化则要回答「世界为什么这样演化」。PhiZero把两者拆开:先从真实世界视频中自监督学习一种紧凑、离散的「物理语言」,用它描述世界状态如何变化,再把推理出的变化渲染成视频。这种「先推理、后渲染」的架构让物理规律不必继续隐含在高维像素预测器里,而可能成为可检查、可组合、可复用的中间表示。摘要称,该方法在生成与理解基准上展现了物理一致性,并可用于交互式世界建模、细粒度动作条件模拟和零样本运动迁移。真正令人兴奋的不是视频是否更逼真,而是世界模型或许开始拥有一种显式表达「发生了什么」的接口。至于这种物理语言是否真的可被人类解释、能否跨场景稳定复用,以及它比纯像素路线强多少,还需要看全文和具体实验确认。
原文:PhiZero: A World Model Built Around Physical Language
02 AI for Science 搜索结果从论文变成「可核验论断」,科研工作流会怎样改变?
一个化学问题的回答要真正可用,检索结果需要同时交付结论、出处和可定位的原文证据。AskChem把检索单位改成原子化、带类型的论断,每条都绑定DOI及原文引句或明确的证据位置,并通过分类体系和证据图支持进一步综合。目前系统从14.7万篇论文中索引了240万条论断,还提供网页、REST、SDK和MCP接口,意味着Agent可以直接围绕证据链工作,而不只是在搜索结果页上挑文章。摘要报告称,接入AskChem后,GPT-5.5生成结果中的DOI可解析率从无检索时的88.3%升至100%,但论断抽取是否准确、证据关系是否可靠,仍需看全文和更细的评测。对科研工具团队而言,值得关注的不是又多了一个搜索入口,而是「检索—核验—综合」这段人工链路能否被压缩成可审计的基础设施。
原文:AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
03 Agent 记忆该留在模型外,还是长进基础模型?
Agent记忆通常由向量数据库、检索器等外部模块负责,Metis则把它重新定义为基础模型的原生能力。它在模型骨干中加入可持续演化的记忆状态,并通过「记忆注意力」读取被压缩的历史信息,让存储与调用都能参与端到端训练。部署时模型权重保持冻结,在线更新记忆不需要梯度,只需一次前向计算,这可能简化训练与推理系统的边界。论文摘要称其已展示原生记忆能力,但没有提供足够数字判断收益究竟来自架构、训练数据还是额外计算。对Agent团队而言,这条路线值得关注,不过「原生记忆」能否胜过成熟、可审计且易替换的外部模块,仍需在具体任务中验证。
原文:Metis: Memory Foundation Model
04 代码智能 12小时预算里的两笔增益:模型训练与搜索框架
在单张RTX 4090、每项任务12小时的约束下,基础模型在MLE-Bench Lite上得到39.39%,35B模型配合搜索框架后达到60.61%,再加入经验先验和异步搜索后升至71.21%。OpenMLE将任务环境、执行反馈、算子训练与长程搜索纳入开放栈,以实际运行结果驱动程序改进和组合。分阶段成绩说明,在固定资源下,模型训练、经验先验和搜索机制都可能影响最终表现;留出测试也显示模型训练与搜索框架能分别带来增益。不过,这些数字来自Lite版本和特定预算,各部分的独立贡献仍需结合消融实验判断,也不能直接外推到更广泛的机器学习工程任务。
也值得关注
今日观察
今天多项工作正在把模型外部的临时脚手架变成可学习、可验证的系统对象:SpatialCLI把专用视觉工具教给模型后尝试撤掉工具,SkillRise把零散经验收束为跨任务技能,Metis把外接记忆推进到基础模型内部,PhiZero则把隐含在像素中的动力学抽成物理语言。
共同信号不是「模型要包办一切」,而是团队需要重新决定哪些能力应在推理时外挂、哪些值得通过训练内化。外挂模块通常更容易更新、替换和审计,内化能力则可能减少调用延迟、接口故障与运行时依赖,但会把能力更新转化为数据建设和训练成本。两者并非单向替代关系,成熟系统更可能依据任务风险、变化频率与验证要求采用不同组合。
具体行动上,可为候选能力建立一张「外挂—内化」评估表,分别测量调用延迟与故障率、能力更新所需的数据和训练成本,以及外部模块提供的可检查性,再用同一任务集做端到端对照实验后决定架构。