今日概览
- RSB让形式化验证器少走弯路,强化学习重排分支启发式;在600个高难实例上比先进的分支启发式多解决11%的实例、少探索50%的分支,但这不等于模型已经获得安全保证。
- 视觉证据可以完整保留,计算仍能压缩:δ-Vision用轻量MLP重建逐层视觉状态,以相当或更低的计算量超过视觉token剪枝方法。
- 训练顺序会在权重中留下可干预痕迹。Qwen-3-4B实验中定向干预缩小损失差距,另一个跨四个LLM的实验以92%准确率辨识训练顺序。
重点关注
01 安全对齐 RSB在600个高难实例上比先进分支启发式少搜一半
神经网络的形式化验证通常依赖分支定界:不断拆分问题,再排除不可能的分支,而搜索顺序直接决定计算成本。现有启发式方法往往只看当前哪一步得分最高,RSB则用强化学习重新调整这些既有分数,让验证器为长期累计效率选择下一处分支。它没有替换验证框架,也没有改变被验证的模型,而是在学习「怎样验证更省力」。摘要报告称,在600个高难实例上,这种策略比先进的分支启发式多解决11%的实例,同时将探索的分支数量减少50%。这说明学习型搜索策略可能缓解安全证明的计算瓶颈,但结果仍局限于这组测试,泛化到其他网络、性质和资源约束的表现需要看全文确认。对安全系统团队而言,这项工作的价值是降低获得证明的成本,而不是证明部署模型已经更安全或完成认证。
原文:Verifying Neural Networks with Reinforcement Learning
02 多模态 视觉证据不必为省算力让路
多模态模型降低视觉计算成本,不一定非要删除token。研究者先切断视觉到文本的信息流,再只恢复少数方向,就能找回大部分损失的准确率——这说明真正影响文本生成的视觉信息集中在低维子空间。更有意思的是,各层需要的视觉状态高度可预测,轻量MLP就能以较高余弦相似度和较低误差完成重建。基于这一发现,δ-Vision保留全部视觉token供文本检索,同时用低秩适配器构造逐层视觉记忆,在图像和视频基准上以相当或更低的计算量超过视觉token剪枝方法。对多模态应用开发者而言,值得重新审视架构边界:视觉证据的保留与状态演化可以拆开优化,省算力未必要以永久丢失信息为代价。
原文:Just MLPs: Efficient Visual State Reconstruction for Multimodal Language Models
03 可解释性 训练顺序变了,模型权重竟会留下「指纹」
同一批数据只交换训练顺序,最终模型就可能留下可定位、可干预的方向性痕迹。研究者把这种「交换子记忆」投影到输出词元上:跨三个模型,无论读取实测权重差异,还是读取由不相交批次估计的括号,其结果都与原始前20个词元有82%—99%重合,明显高于随机方向的35%—49%。这不只是事后观察——在Qwen-3-4B的监督微调实验中,下调对损失差距预测贡献最大的10个词元,可缩小实测损失差距的中位数32%;另一个跨四个LLM的实验则以92%的准确率判断两个模型各自经历了哪种训练顺序,而随机机会为50%。它为数据课程设计和增量训练审计提供了一种新工具,但还不能完整追溯任意训练数据:这种记忆针对特定数据源对定义,并会随后续训练逐渐衰减。
原文:Commutator Memory: Sparse, Path-Local Reading and Steering in Language Models
