验证比发现便宜,4B打平大模型

今日概览

  • 深度研究agent真正的改进杠杆,是「验证比发现便宜」这个差价,而非更强的基座——AREX留住已部分验证的中间状态、只补没站住的约束,4B模型就打平了更大的对手。
  • 逼模型把空间答案写成文字,测到的可能是文字转译而非空间能力:ProVisE改让图像生成模型直接在像素里作答,一放开接口,它就追平了文字输出的VLM。
  • coding agent榜单的高分,有多少是背出来的?腾讯WorkBuddy把每道题从真实commit反编译而来、做成抗污染,还因四个子集打分标准不同、干脆拒绝给一个总平均分。
  • 大部分线性注意力配25%softmax,视频生成单卡快3.2倍。SANA-Video 2.0用四分之一的softmax锚点补回全局依赖,单张H100出到720p——只是「匹配full-softmax质量」这句仍需实测盯住。

重点关注

01 Agent 验证比发现便宜,深度研究agent的改进杠杆就在这个差价上

深度研究要找的是同时满足一堆约束的答案,这种答案搜起来很贵;但反过来,验证一个候选答案往往能拆成一条条便宜的检查——哪个约束没满足,逐条对一下就知道。AREX抓的就是这个「发现贵、验证便宜」的不对称:与其一味搜得更久,不如把已经部分验证过的中间状态留着,用它引导下一轮只去补那些还没站住的约束。具体是内外两层循环——内层搜证据、拼一个临时答案,外层逐条审这个答案、挑出没证实的说法,再发起有针对性的补充研究;为了能跑很长的任务链,它还学了个自压缩历史的工具,把越滚越长的交互记录压成一个只保留「已验证证据+未决约束」的改进状态,不靠外部模型来做总结。效果上,一个4B稠密模型和一个122B总参数、激活约10B的MoE(混合专家)模型,在BrowseComp、HLE等深度检索与推理benchmark上都超过了同量级baseline,还能跟激活参数更多的模型掰手腕。真正值得记住的不是「recursively self-improving」这个大词——那部分最容易被高估——而是它把杠杆压在「验证比发现便宜」这个结构性差价上,而不是换个更强的基座。

凡是「验证能拆成便宜逐条检查、而发现很贵」的任务(深度检索、多约束求解),先搜一版再针对没站住的约束补漏,比一味搜得更久更划算长任务链的agent不爆context的关键,是把历史压成只留「已验证证据+未决约束」的改进状态,这个自压缩思路值得单独借鉴别被「recursively self-improving」带跑——杠杆来自验证比发现便宜的结构性差价,不是更强的基座,4B小模型能打平大模型正是佐证

02 评测 逼模型把空间答案写成文字,测的可能不是空间能力

现有的空间推理benchmark几乎都逼模型把答案写成坐标、选项或一段文字。可空间认知本来是「指方向、圈区域、画路径」的事——强行序列化成文字,你测到的可能是模型的文字转译能力,而不是空间能力本身。这篇的ProVisE换了个接口:让图像生成模型直接在生成的像素里作答,再把画出来的答案解析成能对齐原指标的结构化预测。意外的是,当空间答案能这样直接画出来时,图像生成模型的表现追平了文字输出的VLM(视觉语言模型),只有到了需要组合式空间推理的任务,后者才明显占优。对做评测的人,落点很硬:你用什么接口问,很大程度上决定了你到底在测什么。

评测接口不是中立的——逼模型把空间答案写成文字,测出的可能是文字转译而非空间能力答案能直接「画」出来时,图像生成模型追平文字VLM,组合式空间推理仍是文字模型的地盘做空间或具身相关评测时,先确认答案接口匹配你要测的能力,再去看分数

03 代码智能 coding agent榜单的高分,有多少是背出来的?

大多数coding agent的benchmark是拿公开issue文本改一改,而模型训练时很可能早已见过这些文本——榜单分数里混着记忆,分不清是真会做还是背过。腾讯WorkBuddy Bench的差异全在「题目怎么造」:每道题都从一个真实的commit、PR或业务场景反向工程而来,再改写成一句口语化、带角色扮演的请求,让你没法靠搜索原issue倒推答案,覆盖Code、Web、Office、Security四个域。关键是它抗污染不靠保密——题目、环境镜像、测试、参考解全部公开,靠的是这套构造方法加上版本管理,第三方能自己重跑审计。它甚至因为四个子集打分标准不同,就干脆不给一个总平均分,这种克制反而比一个漂亮的综合数字更可信。对从业者,它更像一把尺子:下次看coding agent榜单,先问一句这些题会不会早已泄进训练集。

看coding agent榜单先问一句——这些题会不会已泄进训练集,高分里有多少是背的抗污染不必靠保密,反编译真实commit加全量公开加版本管理是更可审计的路子四个子集打分标准不同、它拒绝出总平均分,提醒你别信跨域的「综合分」。

04 视频生成 线性注意力省算力却掉质量,这次用25%的softmax补回来

线性注意力对长视频生成一直很诱人——序列越长越省算力,但它缺了softmax那种全局的token交互,表达力总差一口气。SANA-Video 2.0没走纯线性,而是三份门控线性注意力配一份softmax「锚点」,用25%的softmax把全局依赖补回来,论文的降分辨率代理实验说这个比例是质量和效率的最优平衡。整套混合架构从头训练,而不是把预训练模型硬掰成线性,单张H100上能出到720p,推理比同规模的full-softmax基线快3.2倍,而且这个差距随视频时长还会拉大。真正该盯的是「匹配full-softmax质量」这句——VBench 84.30这类总分接近,不代表运动连贯性、长时一致性这些真实差距被抹平,效率论文经常在这里打折。落点不在单卡本身,而在「大部分线性+少量softmax」这套取舍能不能在实测里站住。

混合线性-softmax注意力(约3:1、25%用softmax)是绕开纯线性表达力短板的实用配方,想省长序列算力又怕掉质量的可以盯这条路线「匹配full-softmax质量」别只信VBench总分,运动连贯性和长时一致性才是效率论文最容易打折的地方效率优势随视频时长放大,长视频比短片更划算——但整套架构从头训练,不是改现成模型,复用门槛要算进去

也值得关注

05
多轮里用户边聊边改需求,模型却大多在「单轮说全」的设定下训练和评测 评测这篇量化了意图漂移时它们怎么一步步跟丢。链接
06
把coding agent当「交互式项目搭建者」来评,而不是给全规格让它补代码 代码智能从含糊的产品意图出发,考planning、需求澄清、调试到仓库级构建。链接
07
NVIDIA把agent写成一个普通Python对象 Agent方法是动作、字段是状态、docstring是prompt、类型标注是契约,方法体写「...」就在运行时由模型补全。链接
08
on-policy自蒸馏想甩掉外部teacher,却仍离不开师生间的信息不对称 训练优化这篇连特权答案和视觉证据都拿掉,只靠输入条件本身制造不对称。链接
09
视频里相机运动和物体运动纠缠在一起,这篇用自监督把两者拆开 多模态学到更稳、更结构化的运动表示。链接
10
正弦激活会诱导出谐波线谱,循环展开能逐步富化谱支撑 模型架构用一个共享正弦块迭代精化隐表示,做高保真INR(ECCV接收)。链接

今日观察

今天有四篇论文看着各测各的——WorkBuddy测coding agent、ICAE-Bench测项目搭建、LLMs Get Lost测多轮对话、Show Don't Tell测空间认知——但叠在一起看,它们攻击的是同一个东西:不是题目不够难,而是题目的形态本身就不真实。

过去的benchmark默认了三条没人明说的假设:任务是静态的、需求能一次说全、答案能写成文字。恰恰是这三条让benchmark好造,也让它离真实越来越远。这四篇各拆掉一条——WorkBuddy拆「公开issue文本够用」,改成从真实commit反编译、做成抗污染;ICAE-Bench拆「全规格静态任务」,改成从含糊意图交互着搭;LLMs Get Lost拆「单轮说全」,改成需求边聊边改;Show Don't Tell拆「答案写成文字/坐标」,改成在生成的像素里作答。连起来看,真正在动的是「任务形态」这个一直藏在背后的变量:从静态、说全、文字答案,转向动态、真实、原生模态。

为什么是现在?因为agent这半年才真正开始钻进真实工作里。以前模型只在题库里活动,benchmark任务和真实任务长得像不像无所谓;可一旦agent要去接真实的commit、真实的模糊需求、真实的空间操作,任务形态的这道差,才第一次成了卡住它的那一环。

一个具体动作:评估一个agent前,先别急着找「最难的那个benchmark」,而是拿你自己工作流里的一个真实任务,对着这三条假设各问一句——它是静态还是动态?需求是一次说全还是边做边变?答案该用文字,还是像素、结构、操作这类原生模态?哪一条对不上,那个benchmark的高分对你就先打个折。