今日概览
- 深度研究agent真正的改进杠杆,是「验证比发现便宜」这个差价,而非更强的基座——AREX留住已部分验证的中间状态、只补没站住的约束,4B模型就打平了更大的对手。
- 逼模型把空间答案写成文字,测到的可能是文字转译而非空间能力:ProVisE改让图像生成模型直接在像素里作答,一放开接口,它就追平了文字输出的VLM。
- coding agent榜单的高分,有多少是背出来的?腾讯WorkBuddy把每道题从真实commit反编译而来、做成抗污染,还因四个子集打分标准不同、干脆拒绝给一个总平均分。
- 大部分线性注意力配25%softmax,视频生成单卡快3.2倍。SANA-Video 2.0用四分之一的softmax锚点补回全局依赖,单张H100出到720p——只是「匹配full-softmax质量」这句仍需实测盯住。
重点关注
01 Agent 验证比发现便宜,深度研究agent的改进杠杆就在这个差价上
深度研究要找的是同时满足一堆约束的答案,这种答案搜起来很贵;但反过来,验证一个候选答案往往能拆成一条条便宜的检查——哪个约束没满足,逐条对一下就知道。AREX抓的就是这个「发现贵、验证便宜」的不对称:与其一味搜得更久,不如把已经部分验证过的中间状态留着,用它引导下一轮只去补那些还没站住的约束。具体是内外两层循环——内层搜证据、拼一个临时答案,外层逐条审这个答案、挑出没证实的说法,再发起有针对性的补充研究;为了能跑很长的任务链,它还学了个自压缩历史的工具,把越滚越长的交互记录压成一个只保留「已验证证据+未决约束」的改进状态,不靠外部模型来做总结。效果上,一个4B稠密模型和一个122B总参数、激活约10B的MoE(混合专家)模型,在BrowseComp、HLE等深度检索与推理benchmark上都超过了同量级baseline,还能跟激活参数更多的模型掰手腕。真正值得记住的不是「recursively self-improving」这个大词——那部分最容易被高估——而是它把杠杆压在「验证比发现便宜」这个结构性差价上,而不是换个更强的基座。
原文:AREX: Towards a Recursively Self-Improving Agent for Deep Research
02 评测 逼模型把空间答案写成文字,测的可能不是空间能力
现有的空间推理benchmark几乎都逼模型把答案写成坐标、选项或一段文字。可空间认知本来是「指方向、圈区域、画路径」的事——强行序列化成文字,你测到的可能是模型的文字转译能力,而不是空间能力本身。这篇的ProVisE换了个接口:让图像生成模型直接在生成的像素里作答,再把画出来的答案解析成能对齐原指标的结构化预测。意外的是,当空间答案能这样直接画出来时,图像生成模型的表现追平了文字输出的VLM(视觉语言模型),只有到了需要组合式空间推理的任务,后者才明显占优。对做评测的人,落点很硬:你用什么接口问,很大程度上决定了你到底在测什么。
原文:Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
03 代码智能 coding agent榜单的高分,有多少是背出来的?
大多数coding agent的benchmark是拿公开issue文本改一改,而模型训练时很可能早已见过这些文本——榜单分数里混着记忆,分不清是真会做还是背过。腾讯WorkBuddy Bench的差异全在「题目怎么造」:每道题都从一个真实的commit、PR或业务场景反向工程而来,再改写成一句口语化、带角色扮演的请求,让你没法靠搜索原issue倒推答案,覆盖Code、Web、Office、Security四个域。关键是它抗污染不靠保密——题目、环境镜像、测试、参考解全部公开,靠的是这套构造方法加上版本管理,第三方能自己重跑审计。它甚至因为四个子集打分标准不同,就干脆不给一个总平均分,这种克制反而比一个漂亮的综合数字更可信。对从业者,它更像一把尺子:下次看coding agent榜单,先问一句这些题会不会早已泄进训练集。
04 视频生成 线性注意力省算力却掉质量,这次用25%的softmax补回来
线性注意力对长视频生成一直很诱人——序列越长越省算力,但它缺了softmax那种全局的token交互,表达力总差一口气。SANA-Video 2.0没走纯线性,而是三份门控线性注意力配一份softmax「锚点」,用25%的softmax把全局依赖补回来,论文的降分辨率代理实验说这个比例是质量和效率的最优平衡。整套混合架构从头训练,而不是把预训练模型硬掰成线性,单张H100上能出到720p,推理比同规模的full-softmax基线快3.2倍,而且这个差距随视频时长还会拉大。真正该盯的是「匹配full-softmax质量」这句——VBench 84.30这类总分接近,不代表运动连贯性、长时一致性这些真实差距被抹平,效率论文经常在这里打折。落点不在单卡本身,而在「大部分线性+少量softmax」这套取舍能不能在实测里站住。
原文:SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
也值得关注
今日观察
今天有四篇论文看着各测各的——WorkBuddy测coding agent、ICAE-Bench测项目搭建、LLMs Get Lost测多轮对话、Show Don't Tell测空间认知——但叠在一起看,它们攻击的是同一个东西:不是题目不够难,而是题目的形态本身就不真实。
过去的benchmark默认了三条没人明说的假设:任务是静态的、需求能一次说全、答案能写成文字。恰恰是这三条让benchmark好造,也让它离真实越来越远。这四篇各拆掉一条——WorkBuddy拆「公开issue文本够用」,改成从真实commit反编译、做成抗污染;ICAE-Bench拆「全规格静态任务」,改成从含糊意图交互着搭;LLMs Get Lost拆「单轮说全」,改成需求边聊边改;Show Don't Tell拆「答案写成文字/坐标」,改成在生成的像素里作答。连起来看,真正在动的是「任务形态」这个一直藏在背后的变量:从静态、说全、文字答案,转向动态、真实、原生模态。
为什么是现在?因为agent这半年才真正开始钻进真实工作里。以前模型只在题库里活动,benchmark任务和真实任务长得像不像无所谓;可一旦agent要去接真实的commit、真实的模糊需求、真实的空间操作,任务形态的这道差,才第一次成了卡住它的那一环。
一个具体动作:评估一个agent前,先别急着找「最难的那个benchmark」,而是拿你自己工作流里的一个真实任务,对着这三条假设各问一句——它是静态还是动态?需求是一次说全还是边做边变?答案该用文字,还是像素、结构、操作这类原生模态?哪一条对不上,那个benchmark的高分对你就先打个折。