因果预训练让RoboCasa GR-1成功率达78.7%

今日概览

  • 因果预训练决定长历史能否转化为控制收益:视频历史从0扩至19.2秒后,RoboCasa GR-1任务成功率从63.3%升至78.7%,双向预训练初始化却没有净收益;流式执行把RTX 5090上的动作块延迟控制在107.4毫秒。
  • 视觉文档向量不是无害副本,攻击者可恢复47%的文字和45%的敏感词,并让98.4%的重建页面重新定位源页面;打乱顺序可被逆转,池化目前更难攻破。
  • 混合注意力的选择取决于扩展方式。滑窗混合更适合免训练长度外推,线性注意力混合更能受益于长上下文持续预训练;64k NIAH-SK1上的16倍外推不能泛化为全面能力。

重点关注

01 机器人 更长窗口没用,除非预训练先学会时间因果

同样把视频历史从0扩到19.2秒,自回归预训练让RoboCasa GR-1任务成功率从63.3%升至78.7%,双向预训练初始化却没有净收益。差别不在模型「看过」多少历史,而在预训练时是否沿时间顺序学习了「过去如何推向未来」,并在机器人动作适配阶段保留这套结构。Long-WAM先用无动作标签的机器人与第一视角视频学习因果预测,再结合机器人领域预训练,在多项长程任务中取得更高成功率。系统侧也必须配合:流式编码、异步执行和硬件加速把RTX 5090上的动作块延迟控制在107.4毫秒,其中仍包含未来视频潜变量预测。真机动态叠杯实验里,它达到95%成功率,而Pi0.5和Fast-WAM各20次尝试均未成功,说明这套「记忆+实时执行」组合至少在动态任务上值得重视。对机器人团队来说,长上下文的重点已经不是继续扩大窗口,而是同时对齐预训练目标、流式推理和部署硬件;不过这些优势在更广泛任务和硬件上的稳定性仍需看全文与后续复现。

评估长上下文模型时,应检查性能是否随历史长度增长,而不只看最大窗口自回归视频预训练可能比双向表征更适合需要追踪进度和运动的控制任务部署长时序机器人系统时,要把成功率与端到端动作延迟放在一起判断

02 检索 不是原文,也不等于不敏感

一页视觉文档通常被存成约一千个按栅格顺序排列的patch向量,这种结构保留了版面与语义线索,而不只是「不可读的特征」。研究者从原始索引中恢复出47%的文字和45%的敏感词;虽然远非无损还原,但生成页面重新查询向量库时,有98.4%能把源页面排在第一。池化和打乱顺序都能把文字召回率降到约8%,但两者并不等价:攻击模型恢复向量顺序后,源页面排名第一的比例从3.8%回升到93.5%,池化索引则尚未被成功逆转。攻击未经调整迁移到另一种多向量检索器后,仍有70.2%的重建页面能定位源页面,不过文字恢复效果低于最近邻基线。对采用托管向量数据库的RAG团队来说,索引应进入与原文相同的访问控制和泄露响应范围,池化可以优先评估,但不能在更多攻击验证前被视为安全边界。

将视觉文档索引视为敏感数据,而不是脱敏副本不要把打乱向量顺序当作可靠防护,攻击者可能恢复其排列优先测试池化对检索质量与隐私风险的权衡,但保留进一步验证

03 模型架构 要免训练外推,还是要再训练扩展?

混合注意力没有一套通吃长上下文的配方,选型前应先明确目标是直接拉长上下文,还是通过持续预训练获得更强的长文本能力。论文对比发现,混合滑窗注意力的模型更擅长免训练长度外推,而混合线性注意力的模型从长上下文持续预训练中获益更多。若选择滑窗路线,窗口过短可能限制长距离学习,因此再训练时还需同步扩大窗口。作者进一步提出滑窗线性注意力,在64k上下文的NIAH-SK1任务上实现16倍免训练外推并保持100%准确率,但这仍是单一「大海捞针」测试,不能等同于推理、检索和生成能力的全面提升。对架构团队而言,这项工作的价值更像一张决策图:先选扩展方式,再选注意力机制。

追求零训练扩容时优先评估滑窗混合架构计划做长上下文持续预训练时重点考察线性注意力混合16倍外推结果值得复现,但需要更多真实长文本任务验证
因果预训练让RoboCasa GR-1成功率达78.7%

也值得关注

04
不重训整套视频DiT,而是让高压缩潜变量继续兼容旧模型,以8倍token压缩换得11.1倍延迟下降 视频生成GRACE在480×832×81设置下适配Wan2.1-I2V-14B,并在VBench上保持压缩前管线的生成质量。链接
05
把「写入未来上下文」和「去噪当前帧」的冲突梯度拆给不同参数,5秒训练轨迹也能外推到最长24小时连续生成 视频生成SGF+无需额外视频数据或长视频微调,同时改善受测基线的画质与长程一致性。链接
06
将视频扩散模型改造成手部追踪器,并从单目第一视角视频同时估计姿态、接触与作用力 机器人RLHND把Cosmos 3作为确定性片段级特征提取器,并通过真机实验验证其对机器人学习的用途。链接
07
图像模型会写短字后,评测开始追问4至12个文本区域能否同时保持内容、位置和清晰度 评测UltraText Bench包含432条中英双语提示;受测设置中,清晰度提升可能伴随文字忠实度下降。链接
08
技能库也需要淘汰机制:让技能随策略经历试用、稳定与退休,避免旧经验继续误导Agent AgentSkillForge在多个交互式基准上的相对提升最高达7.8%,并持续控制技能库规模。链接
09
Agent是否调用工具可被压缩为一个受抑制机制塑形的内部方向 可解释性该机制在Qwen、Mistral和Granite等七个模型上重复出现,为诊断「该执行却只讨论」提供了可干预变量。链接
10
视觉token剪枝可能把注意力集中到恶意前景锚点上,加速策略需要与越狱安全一起验收 安全对齐推理时防护SAP在不牺牲效率或效用的受测设置下,将攻击成功率最多降低62%。链接
11
奖励模型无需逐字生成评语也能完成判断:连续潜在轨迹把评审过程压缩约9倍 推理加速LatentGRM-8B在vote@5下将总评审推理时间降低6.1至7倍,同时保持有竞争力的偏好判断准确率。链接
12
安全补丁通过总体基准仍可能误伤局部相似的正常请求 评测PatchBench-Local同时检查有害邻居修复与良性邻居保留,揭示全局能力近乎不变时仍可能存在严重局部回归。链接
13
神经PDE代理可能学到数值求解器的离散误差,而非真实动力学 AI for Science傅里叶符号诊断显示,代理对训练求解器误差的模仿程度可超过理论完全模仿上限的99.8%。链接

今日观察

今天三篇主文共同提醒:表示或容量发生变化,并不意味着实际能力会沿直觉方向变化。19.2秒机器人历史只有在保留因果预测结构的预训练下才兑现为控制收益;滑窗与线性注意力分别偏向免训练外推和持续预训练扩展;表面不可读的视觉文档向量仍保留了足以重建敏感文字、版面并定位源页面的结构。因此,窗口长度、向量形式和架构复杂度都不能代替验证。团队应把验收拆成两类:任务测试衡量新表示对目标任务仍能做什么,威胁测试检查攻击者还能从中恢复或推断什么。下一次模型或索引评审时,为每项表示变更各增加一组任务消融和一组对抗恢复测试,并把两组结果同时作为上线门槛。