今日概览
- 可执行rubric让长文本评测更快、更可审计:ExecRubrics将质量标准编译为Python评分函数,偏好判断准确率最高达92%,延迟最多降至原来的1/320。
- LoRA组合成为逐输入决策,LiST按当前样本检索、融合适配器,并通过安全接受规则决定启用或回退。
- 复杂RAG开始训练检索轨迹。GTA-RAG结合证据图与强化学习,让模型根据已有证据判断下一步去哪里找。
- 安全对齐成本需要按语言核算:全局效用指标可能掩盖保护强度与可用性损失的语言差异,上线前应进行分组审计。
重点关注
01 评测 当rubric变成代码,长文本评测开始像软件测试
ExecRubrics把写给裁判看的自然语言rubric,改造成可检查、可执行、可编辑的Python评分函数。这样一来,标准中的依赖关系、替代条件、扣分项和一票否决不再被压缩成简单加权求和,评测逻辑也能像测试组件一样复现和组合。在HealthBench、HelpSteer和ArgQuality三个长文本基准上,它匹配或超过自然语言rubric基线,偏好判断准确率最高分别达到53%、78%和92%,同时将延迟最多降低到原来的1/320。对医疗、银行等高风险场景而言,真正有价值的不只是少调用几次LLM裁判,而是每个评分决定都有明确、可审计的执行路径。文本处理库还能为这些规则补充外部能力,但具体提升来自哪些规则、跨任务是否稳定,仍需看全文确认。它也不会消除所有LLM裁判:文风、洞察力和说服力等主观维度很难被可靠程序化,更现实的方向是用代码承接硬标准,把模糊判断留给人工或模型。
原文:ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation
02 训练优化 LoRA合并从一次性配置变成了逐输入决策
面对每个测试输入,LiST会先从适配器库检索邻近分支,再搜索样本专属的融合权重。它结合LoRA参数与提示词行为来判断任务相似性,无需标签,也不更新基础模型或现有适配器。更有意思的是,这让适配器库从一批待合并的文件变成了运行时可检索、可组合的能力池;服务架构也会相应增加路由、融合和结果校验环节。候选组合只有通过安全接受规则才会启用,否则回退到针对当前输入生成的先验方案,给动态决策留出了一道保险。摘要称其在语言和多模态基准上优于静态合并及常规测试时适配,但具体延迟和扩展成本仍需看全文确认——对多任务产品而言,这些系统代价将决定它能否真正取代预先固化的LoRA套餐。
原文:LiST: Local-Simplex Test-Time LoRA Fusion
03 检索 复杂RAG不只要答对,还得学会下一步去哪里找
复杂问题的难点往往不是上下文装得不够多,而是模型不知道证据缺口在哪里、下一轮该搜什么。GTA-RAG先用实体—文档图采样相互关联的文档路径,再合成多跳问答轨迹,并通过实际部署的检索器验证这些轨迹是否真的可执行。训练时,它用GRPO(组相对策略优化)同时奖励答案正确和目标证据覆盖,让模型学习整条搜索决策,而不只是靠最终答案获得稀疏反馈;之后再用自然问答数据训练答案能力。相比扩充上下文窗口或对单次结果重排,这套方法多解决了一层「如何根据已有证据决定下一步去哪里找」的问题,并在五个问答基准、两种Qwen2.5骨干上持续优于同类强化学习方案。对实践团队而言,关键启示是把检索轨迹纳入训练与评估,但其收益能否迁移到自有知识库和检索器,仍需结合全文与实际数据验证。
04 安全对齐 一个全局效用指标,能算清对齐代价吗?
评估安全对齐时,只报告整体效用下降,可能会掩盖不同语言用户承担的实际成本。这项研究将安全模型与未对齐版本直接配对比较,把对齐单独造成的可用性损失定义为「安全成本」,并按语言分别核算。摘要显示,多种非英语语言不仅效用损失更大,有些还同时面临保护更弱的「双重惩罚」;另一些语言看似效用提高,却可能只是安全过滤器没有正常触发。即使是高资源语言,为达到相近安全水平付出的代价也可能高于英语,不过具体语言、差距大小和评测设置仍需看全文确认。对准备上线多语言模型的团队,这意味着安全评测必须加入分语言审计,同时检查明确拒答和更隐蔽的回答质量变化。
原文:Who Pays More for Safety? Measuring the Disparate Cost of Safety Alignment across Languages

也值得关注
今日观察
LiST按输入融合适配器,GTA-RAG按证据图调整检索轨迹,语义锚点解码按上下文组织生成,TRACE则回查模型实际取用的视频证据。它们指向同一个变化:模型系统的竞争点正从准备一个全局最优组件,转向在运行时为当前样本选择正确路径。这样的动态能力也改变了可观测性的边界——只记录输入和最终输出已经不够;适配器权重、检索节点、解码分组和证据帧都属于解释系统决策所需的路由痕迹。缺少这些记录,线上异常即使能够复现结果,也很难还原过程并准确归因。具体行动是为每次推理生成统一的路由追踪ID,并将上述中间决策与最终输出关联保存。