今日概览
- 法律RAG应先优化检索链路:基于178个检索查询和504组问答的乌兹别克语实验,定向微调检索器有望以较低成本缩小模型差距,并适配云端与本地的不同约束。
- 识别无解不等于触发拒答,多种1.7B至70B模型已形成可检测的异常信号,但该信号与拒答方向近乎正交,问题可能出在响应路由而非知识不足。
- CoVA-SFT直接监督视觉中间表征。 51.9K个样本包含超过222K个多模态推理步骤,成绩超过其他交错式思维链基线2倍,但仍落后于强文本思维链基线。
重点关注
01 检索 云端追质量、本地守数据,法律RAG该把预算花在哪?
云端可以调用托管模型追求质量,本地部署却必须守住数据边界、硬件和延迟约束,同一套法律助手因此需要两种完全不同的工程配置。这项工作没有用通用排行榜替代真实需求,而是围绕乌兹别克语法律服务建立了包含178个专家标注查询的检索测试集,以及504组专家整理问答的端到端测试集。摘要报告的结果显示,开放模型与专有模型之间的差距并不大,而且通过定向微调检索器就能以较低成本缩小,团队据此训练了面向乌兹别克语的开放文本嵌入模型UTE-1。相比之下,微调长上下文问答模型不仅需要大量硬件,法律条文频繁变化也会让写入参数的知识迅速过时;一次QLoRA实验的负面结果进一步支持了这个判断。需要注意的是,评测规模仍然有限,端到端分数也依赖经过人工与独立模型校验的模型裁判,能否推广到其他语言和法律体系还需更多验证。对资源有限的团队而言,更可控的路线是先把检索、索引更新和云端/本地配置做好,再判断是否真的需要继续投入大模型微调。
原文:Cloud and On-Premises Deployment of Uzbek Legal RAG via Targeted Retriever Fine-Tuning
02 安全对齐 模型明明知道无解,却还是给出了答案
碰到cot(-540°)这类本就没有合法答案的问题,模型给出结果不一定是没看出异常。摘要显示,在1.7B到70B参数的多种指令模型中,隐藏状态里存在一条能区分「可回答」与「结构性无解」的线性方向,说明生成前已经形成了可用的异常信号。意外的是,这条识别方向与安全训练形成的拒答方向近乎正交;沿识别方向干预生成时,模型的拒答行为还会随强度双向变化。基础模型与指令模型的对比进一步暗示,这个断点在预训练结束时就已存在,并非单靠增加拒答样本就能补上。对模型开发者而言,修复重点应从补知识和改提示,转向检查内部判断如何传递到最终响应策略,但结论目前集中在结构性数学与代码问题,能否推广到更开放的任务仍需看全文和后续验证。
原文:Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions
03 多模态 CoVA-SFT把中间表征写进训练数据
CoVA-SFT把显式推理说明、代理式渲染和验证循环编排成可监督的多模态步骤,目标是让模型在推理过程中交错使用文字与视觉抽象。这个包含51.9K个样本和超过222K个多模态推理步骤的数据集,针对纯文本推理中必须把视觉问题序列化为文字的限制,让模型可以在推理过程中构造并修正视觉抽象,而不只是描述它。从摘要给出的结果看,微调后模型在CoVA-Bench上的平均成绩超过其他交错式思维链基线的2倍,但仍不及强文本思维链基线,尚不能断言视觉抽象链已经全面胜出。这项工作提示,推理数据设计不仅要看答案数量,也可以显式监督模型使用怎样的中间表征。
原文:CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions

也值得关注
今日观察
多篇论文暴露出同一种「接口失配」:模型内部已经识别出问题无解,响应策略却没有转向拒答;低资源语音中已有声学证据,解码器却缺少翻译语义提供的锚点;TTS已生成大体正确的语音,局部韵律诊断却没有进入修正环节;法律RAG中的领域信号也需要真正落到检索器,而不能只依赖生成端补救。共同的问题不是证据完全不存在,而是证据形成后未被下一模块可靠消费。实践中应把评测与日志放在模块交界处,分别验证证据是否形成、路由是否发生、修正是否生效,再决定是否扩大模型或补充训练数据;本周可先抽取20个失败样本,为每个交界面补齐这三项检查。