用户改代码让Agent成功率降7.7个百分点

今日概览

  • 用户中途改代码,Agent平均解决率下降7.7个百分点,SWE-Touch显示9个编码模型常会保留冲突或覆盖用户成果,协作评测必须纳入变更检测、归属判断和回归验证。
  • GradCuit把隐状态更新连上可追踪的梯度路径:5个模型、3类推理基准上平均准确率达64.5%,较思维链高6.6个百分点,但梯度可归因不等于推理已被解释。
  • UEmbed用单个9B模型统一稀疏、稠密和多模态检索。 它在MMEB-v2上取得稠密71.8、稀疏71.0,实际价值仍取决于延迟、索引成本和部署复杂度能否同步下降。

重点关注

01 代码智能 用户一改代码,Agent就可能跟不上了

用户在任务进行中顺手改了几行代码,编码Agent面对的就不再是静态仓库,而是一个随时变化的共享工作区。SWE-Touch把这种真实协作现场做成了可复现的压力测试:在Agent触及关键代码时,注入看似合理、却与任务目标冲突的用户改动,并附上对应的上下文消息。对9个编码模型的评测显示,这类改动让SWE-bench Verified的平均任务解决率下降7.7个百分点,而且在更长链路的SWE-Bench Pro和DeepSWE任务上,性能退化依然存在。

更值得关注的是失败方式:Agent可能保留冲突代码,也可能直接覆盖用户修改,却没有重新检查仓库状态或用针对性测试验证行为。这说明对话里「知道用户说了什么」还不够,真正的协作能力包括发现外部变更、判断改动归属、重建当前任务状态,再决定合并还是回退。对准备把编码Agent接入真实团队工作流的人来说,SWE-Touch提供了一个很实用的提醒:部署前不仅要测它能否独立完成任务,还要测它在代码被别人碰过之后能否稳妥接手。

评估编码Agent时应加入用户并行修改代码的场景,静态仓库成绩不足以代表协作能力工作区变更检测、冲突归属判断和针对性回归测试应成为Agent基础能力接入真实团队前,要重点验证Agent是否会误留冲突代码或覆盖他人已完成的工作

02 推理 能看见梯度路径,就等于看懂模型推理了吗?

测试时优化正在从「调一团连续隐状态」,走向追踪每次更新如何影响后续推理。GradCuit把可优化状态插入Transformer的指定层,让整段输出的奖励梯度能直接分配给此前的隐状态;在5个模型、3类推理基准和2种答案格式上,平均准确率达到64.5%,比思维链提示高6.6个百分点,也比最强对比方法高2.4个百分点。它对学习率也更稳定:横跨7档设置持续领先LatentSeek,准确率标准差从1.53降至0.82。梯度归因显示影响集中在推理连接词,早期到中间层似乎是更有效的优化位置,但这只是提供了一条可检查的因果路径,并不等于可解释性已经解决。对考虑测试时扩展的团队,更值得验证的是这种优势能否跨任务成立,以及额外优化预算和失败模式是否可控。

测试时优化开始具备直接的信用分配路径,不再只能靠输出结果间接调整GradCuit的准确率与学习率稳定性均有改善,适合纳入latent reasoning方案对比「梯度可追踪」不等于「推理已解释」,决策前仍需检查跨任务表现、计算成本和失败案例

03 检索 一套表示收拢词项匹配和跨模态召回

稀疏检索长期依赖双向编码器,多模态扩展还常需额外的跨模态模块。UEmbed尝试用decoder-only(单向因果)架构在一次前向计算中同时生成稀疏和稠密表示,把这些能力收进同一个模型。它通过多个可学习的特殊token分管不同词表子集,再拼出完整的稀疏向量,同时保留稠密语义表示。公开数据训练的9B版本在多模态基准MMEB-v2上取得稠密71.8、稀疏71.0,超过RzenEmbed等同类模型,在文本检索基准BEIR上也保持竞争力。对团队而言,真正需要验证的不是单项分数,而是统一模型能否减少部署与维护成本,又不牺牲词项匹配的可解释性或跨模态召回质量;摘要尚未给出端到端延迟、索引成本和两类表示冲突时的取舍,需要看全文确认。

规划多模态检索时,可把统一稀疏与稠密表示纳入架构选项评估价值应重点测模块数量、延迟和索引维护成本,而非只看基准分数上线前需分别检查词项命中可解释性与跨模态召回,避免统一表示掩盖能力取舍
用户改代码让Agent成功率降7.7个百分点

也值得关注

04
世界模型不只要生成得逼真,还要对状态变化作出合理反应 评测WorldExam把评测重点推进到模型是否学会了可演化的世界。链接
05
双时相SAR与配准光学影像为洪水分割提供了大规模检验场 AI for ScienceGEOID-Flood用于检验地理基础模型跨区域、跨传感器迁移的实际价值。链接
06
SKT用27164条验证轨迹,把技能使用训练扩展到单技能与多技能任务 训练优化SKT通过可验证的合成任务训练完整的技能选择与执行过程。链接
07
内部地图已经指向下一步,Agent却仍可能继续穷举 AgentScrambleToolBench揭示了环境发现与策略利用之间的断层。链接
08
LiDAR与相机人体动捕开始从理想精度转向现场韧性 多模态Sen-Cap正面处理传感器缺失、布局变化和噪声干扰。链接
09
没有客观真值时,人类判断也可以先聚合再校准 评测该方法面向评审尺度不一致的任务,提供带理论保证的统一评估路径。链接

今日观察

SWE-Touch、ScrambleToolBench与GradCuit共同暴露出一个比「会不会推理」更细的瓶颈:系统可以生成下一步,却未必能把新证据正确归因,并据此停止、改道或保留已有成果。用户改过代码后仍沿用旧计划、工具地图已经指路却继续穷举、隐状态更新无法说明影响了哪段后续推理,看似是三类问题,本质上都是状态变化没有转化为选择性的策略更新。下一轮日志与评测应为每次外部变化单独记录「检测到什么、归因给谁、因此取消或保留了哪些动作」,并统计策略是否在变化后及时调整。