今日概览
- 因果预训练决定长历史能否转化为控制收益:视频历史从0扩至19.2秒后,RoboCasa GR-1任务成功率从63.3%升至78.7%,双向预训练初始化却没有净收益;流式执行把RTX 5090上的动作块延迟控制在107.4毫秒。
- 视觉文档向量不是无害副本,攻击者可恢复47%的文字和45%的敏感词,并让98.4%的重建页面重新定位源页面;打乱顺序可被逆转,池化目前更难攻破。
- 混合注意力的选择取决于扩展方式。滑窗混合更适合免训练长度外推,线性注意力混合更能受益于长上下文持续预训练;64k NIAH-SK1上的16倍外推不能泛化为全面能力。
重点关注
01 机器人 更长窗口没用,除非预训练先学会时间因果
同样把视频历史从0扩到19.2秒,自回归预训练让RoboCasa GR-1任务成功率从63.3%升至78.7%,双向预训练初始化却没有净收益。差别不在模型「看过」多少历史,而在预训练时是否沿时间顺序学习了「过去如何推向未来」,并在机器人动作适配阶段保留这套结构。Long-WAM先用无动作标签的机器人与第一视角视频学习因果预测,再结合机器人领域预训练,在多项长程任务中取得更高成功率。系统侧也必须配合:流式编码、异步执行和硬件加速把RTX 5090上的动作块延迟控制在107.4毫秒,其中仍包含未来视频潜变量预测。真机动态叠杯实验里,它达到95%成功率,而Pi0.5和Fast-WAM各20次尝试均未成功,说明这套「记忆+实时执行」组合至少在动态任务上值得重视。对机器人团队来说,长上下文的重点已经不是继续扩大窗口,而是同时对齐预训练目标、流式推理和部署硬件;不过这些优势在更广泛任务和硬件上的稳定性仍需看全文与后续复现。
原文:Long-WAM: Scaling the Context of World-Action Models
02 检索 不是原文,也不等于不敏感
一页视觉文档通常被存成约一千个按栅格顺序排列的patch向量,这种结构保留了版面与语义线索,而不只是「不可读的特征」。研究者从原始索引中恢复出47%的文字和45%的敏感词;虽然远非无损还原,但生成页面重新查询向量库时,有98.4%能把源页面排在第一。池化和打乱顺序都能把文字召回率降到约8%,但两者并不等价:攻击模型恢复向量顺序后,源页面排名第一的比例从3.8%回升到93.5%,池化索引则尚未被成功逆转。攻击未经调整迁移到另一种多向量检索器后,仍有70.2%的重建页面能定位源页面,不过文字恢复效果低于最近邻基线。对采用托管向量数据库的RAG团队来说,索引应进入与原文相同的访问控制和泄露响应范围,池化可以优先评估,但不能在更多攻击验证前被视为安全边界。
原文:Inverting Multi-Vector Visual Document Indices
03 模型架构 要免训练外推,还是要再训练扩展?
混合注意力没有一套通吃长上下文的配方,选型前应先明确目标是直接拉长上下文,还是通过持续预训练获得更强的长文本能力。论文对比发现,混合滑窗注意力的模型更擅长免训练长度外推,而混合线性注意力的模型从长上下文持续预训练中获益更多。若选择滑窗路线,窗口过短可能限制长距离学习,因此再训练时还需同步扩大窗口。作者进一步提出滑窗线性注意力,在64k上下文的NIAH-SK1任务上实现16倍免训练外推并保持100%准确率,但这仍是单一「大海捞针」测试,不能等同于推理、检索和生成能力的全面提升。对架构团队而言,这项工作的价值更像一张决策图:先选扩展方式,再选注意力机制。
原文:Mechanics of Long-Context Hybrid Models Part 1.1: From Hybrid Attention to Hybrid Position

也值得关注
今日观察
今天三篇主文共同提醒:表示或容量发生变化,并不意味着实际能力会沿直觉方向变化。19.2秒机器人历史只有在保留因果预测结构的预训练下才兑现为控制收益;滑窗与线性注意力分别偏向免训练外推和持续预训练扩展;表面不可读的视觉文档向量仍保留了足以重建敏感文字、版面并定位源页面的结构。因此,窗口长度、向量形式和架构复杂度都不能代替验证。团队应把验收拆成两类:任务测试衡量新表示对目标任务仍能做什么,威胁测试检查攻击者还能从中恢复或推断什么。下一次模型或索引评审时,为每项表示变更各增加一组任务消融和一组对抗恢复测试,并把两组结果同时作为上线门槛。