今日概览
- 用户中途改代码,Agent平均解决率下降7.7个百分点,SWE-Touch显示9个编码模型常会保留冲突或覆盖用户成果,协作评测必须纳入变更检测、归属判断和回归验证。
- GradCuit把隐状态更新连上可追踪的梯度路径:5个模型、3类推理基准上平均准确率达64.5%,较思维链高6.6个百分点,但梯度可归因不等于推理已被解释。
- UEmbed用单个9B模型统一稀疏、稠密和多模态检索。 它在MMEB-v2上取得稠密71.8、稀疏71.0,实际价值仍取决于延迟、索引成本和部署复杂度能否同步下降。
重点关注
01 代码智能 用户一改代码,Agent就可能跟不上了
用户在任务进行中顺手改了几行代码,编码Agent面对的就不再是静态仓库,而是一个随时变化的共享工作区。SWE-Touch把这种真实协作现场做成了可复现的压力测试:在Agent触及关键代码时,注入看似合理、却与任务目标冲突的用户改动,并附上对应的上下文消息。对9个编码模型的评测显示,这类改动让SWE-bench Verified的平均任务解决率下降7.7个百分点,而且在更长链路的SWE-Bench Pro和DeepSWE任务上,性能退化依然存在。
更值得关注的是失败方式:Agent可能保留冲突代码,也可能直接覆盖用户修改,却没有重新检查仓库状态或用针对性测试验证行为。这说明对话里「知道用户说了什么」还不够,真正的协作能力包括发现外部变更、判断改动归属、重建当前任务状态,再决定合并还是回退。对准备把编码Agent接入真实团队工作流的人来说,SWE-Touch提供了一个很实用的提醒:部署前不仅要测它能否独立完成任务,还要测它在代码被别人碰过之后能否稳妥接手。
原文:SWE-Touch: Benchmarking Coding Agents When Users Touch the Code
02 推理 能看见梯度路径,就等于看懂模型推理了吗?
测试时优化正在从「调一团连续隐状态」,走向追踪每次更新如何影响后续推理。GradCuit把可优化状态插入Transformer的指定层,让整段输出的奖励梯度能直接分配给此前的隐状态;在5个模型、3类推理基准和2种答案格式上,平均准确率达到64.5%,比思维链提示高6.6个百分点,也比最强对比方法高2.4个百分点。它对学习率也更稳定:横跨7档设置持续领先LatentSeek,准确率标准差从1.53降至0.82。梯度归因显示影响集中在推理连接词,早期到中间层似乎是更有效的优化位置,但这只是提供了一条可检查的因果路径,并不等于可解释性已经解决。对考虑测试时扩展的团队,更值得验证的是这种优势能否跨任务成立,以及额外优化预算和失败模式是否可控。
原文:GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning
03 检索 一套表示收拢词项匹配和跨模态召回
稀疏检索长期依赖双向编码器,多模态扩展还常需额外的跨模态模块。UEmbed尝试用decoder-only(单向因果)架构在一次前向计算中同时生成稀疏和稠密表示,把这些能力收进同一个模型。它通过多个可学习的特殊token分管不同词表子集,再拼出完整的稀疏向量,同时保留稠密语义表示。公开数据训练的9B版本在多模态基准MMEB-v2上取得稠密71.8、稀疏71.0,超过RzenEmbed等同类模型,在文本检索基准BEIR上也保持竞争力。对团队而言,真正需要验证的不是单项分数,而是统一模型能否减少部署与维护成本,又不牺牲词项匹配的可解释性或跨模态召回质量;摘要尚未给出端到端延迟、索引成本和两类表示冲突时的取舍,需要看全文确认。

也值得关注
今日观察
SWE-Touch、ScrambleToolBench与GradCuit共同暴露出一个比「会不会推理」更细的瓶颈:系统可以生成下一步,却未必能把新证据正确归因,并据此停止、改道或保留已有成果。用户改过代码后仍沿用旧计划、工具地图已经指路却继续穷举、隐状态更新无法说明影响了哪段后续推理,看似是三类问题,本质上都是状态变化没有转化为选择性的策略更新。下一轮日志与评测应为每次外部变化单独记录「检测到什么、归因给谁、因此取消或保留了哪些动作」,并统计策略是否在变化后及时调整。