今日概览
- 13项技能让论文Agent留下可复核证据,Spark-to-Paper将捏造内容检出率从14%提高到92%,引用有效率达到99.5%。
- 弱模型不改参数也能把平均表现从0.49提升至0.91:AI4AI由强模型在测试时构建代码、路由和格式约束组成的执行框架。
- 安全评测开始批量合成对抗工具环境。ToolHazard自动寻找注入点并生成环境专属载荷,但场景规模不能替代业务代表性。
- StateFlow以世界记忆和渲染反馈组织3D预演,在状态访问阶段把相机计划修正为视觉上可行的轨迹。
重点关注
01 Agent|13项技能让自动写论文留下证据
让AI写出一篇像论文的长文本早已不稀奇,真正难的是让每条结论经得起追问。Spark-to-Paper把研究拆成13项可组合技能,覆盖文献检索、实验执行、按证据修订主张和可编辑制图,并直接运行在现有编码助手中。它先确定实验需要提供哪些证据,再观察结果、修改甚至放弃原有主张,避免成稿反过来挑选有利数据。系统结合确定性完整性检查与自我审查,并限制反复实验持续否定原始目标的「自我反驳循环」。
摘要报告,在8个受控研究主题中,完整审查栈把捏造内容的检出率从单轮草稿的14%提高到92%,同时达到99.5%的引用有效率和96.4%的图表可编辑率。每篇论文平均消耗1190万token、成本8.1美元、耗时3.2小时,这组数字让它更像可实际运行的研究流水线,而非昂贵的演示项目。不过样本只有8个主题,指标定义、任务难度和失败案例仍需看全文确认。对构建研究Agent的团队来说,最值得复用的设计原则很明确:先让每个环节留下可复核证据,再讨论最终论文写得像不像真的。
原文:Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill
02 推理|不改参数,弱模型的表现也能接近翻倍
把弱模型的平均表现从0.49拉到0.91,这次靠的不是重新训练,而是让强模型在测试前搭好一套执行框架。强模型用5%的数据反复调试流程,把不稳定的推理转移到确定性代码、任务路由和严格的答案格式中,再交给弱模型执行。真正意外的是,提升主要不是来自让弱模型「想得更久」,而是重新设计了它所处的推理环境。但这也留下一个关键疑问:执行框架究竟沉淀了可复用的任务结构,还是强模型在前置阶段已经替弱模型完成了大部分推理;目前结果仅来自四个心智理论基准,泛化能力还需看全文和更多任务验证。因此,评估这类方案不能只比较目标模型的单次调用价格,还要计入强模型构建、验证和维护执行框架的成本。
原文:AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses
03 安全对齐|自动生成攻击场景成为新流水线
Agent安全评测的生产方式正在变化:过去靠人工搭建环境、预先放置少量提示注入,如今可以批量合成带状态、可执行的对抗工具环境。ToolHazard通过环境模拟器、攻击者Agent和用户模拟器,自动寻找可行的注入点、生成环境专属攻击载荷,并构造与状态关联的长流程任务。这让工程团队有机会把环境合成接入持续测试,将不同工具、权限组合和注入位置纳入测试矩阵。摘要披露的实验显示,注入时机与位置会影响攻击效果,而生成的对齐数据能在两个基准上提高安全性,同时保留正常任务能力。不过,自动生成的场景是否贴近真实业务流程仍需看全文和实际验证,不能把场景数量直接当作评测质量。
04 多模态|StateFlow用渲染反馈访问3D世界状态
StateFlow把场景元素和相机配置保存在持久、结构化的3D状态中,并通过构建、演化和访问三个阶段组织预演流程。构建阶段将2D内容提升为连贯的3D世界;演化阶段保留世界记忆,将用户意图转成结构化状态变化;访问阶段利用渲染反馈反思,把相机计划修正为视觉上可行的轨迹,而非只依赖VLM语义。最终视觉质量则是另一层问题——框架仍借助现成视频模型提升画面,因此实验中的高质量结果不能直接等同于状态层本身的能力。对预演工具团队而言,更值得验证的是世界记忆在多轮演化后能否保持一致,以及渲染反馈能否稳定改善相机轨迹;这两项应与成片画质分开评估。
原文:StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization

也值得关注
今日观察
Spark-to-Paper、AI4AI和ToolHazard分别把能力承载、能力迁移和安全评测推向模型外部:十三项可组合技能与审查栈决定论文Agent能否保留证据,强模型搭建的执行框架决定弱模型能完成什么任务,而工具权限、环境状态和注入位置则决定攻击者能够利用哪些路径。这意味着能力提升与攻击面扩张正在同一层发生;仅记录底层模型版本,既无法解释性能为何变化,也无法定位风险从何处进入。团队应把技能定义、状态传递协议、工具权限和环境输入纳入统一版本管理,并为每次变更运行覆盖正常任务与恶意状态的回归测试;下一步可先选一条关键Agent流程,建立脚手架清单、最小权限基线和对应的红队用例。