寄存器token让代码任务最高提升19.5分

今日概览

  • 机制识别成为表格迁移的新起点:LimiX-2以联合结构建模替代直接预测目标,但规模、合成数据和训练预算的贡献仍待拆分。
  • 科研Agent开始沉淀训练闭环,ScienceBuddy把请求、反馈和执行证据转为任务与评测资产,同时保留人工监督。
  • 少量寄存器token撑起跨片段推理。 清空生成文本后,数学任务最高提升8.5分、代码任务最高提升19.5分,但状态忠实性仍需验证。
  • 游戏AI产物可以跨角色复用:轨迹、世界模型和设计规格可在六类角色间流动,但下游效果仍需在目标游戏中重新验证。
  • 百万帧数据推进事件手部重建落地,真实事件标注把验证边界推向弱光与高速运动环境,长期稳定性仍待测试。

重点关注

01 模型架构 表格模型能先看懂数据怎么生成,再决定如何预测吗?

传统表格基础模型通常围绕一个目标训练:给定上下文样本,直接预测目标变量。LimiX-2换了一个组织原则,通过上下文条件掩码建模,让模型学习特征与目标的联合结构,试图先识别当前数据背后的生成机制,再完成具体预测。其预训练数据来自结构因果模型生成的合成数据,覆盖不同的因果图、函数关系和观测过程;如果这种覆盖足够广,模型就可能把「机制识别」迁移到未见过的表格和任务,而不只是复用固定的预测套路。摘要称其在TabArena、TALENT和BCCO上超过现有专用模型与表格基础模型,特征注意力还能够恢复直接因果关系,但没有给出提升幅度、规模扩展曲线或真实数据分布偏移下的细节。尤其需要看全文确认,性能增长究竟来自机制导向的架构,还是更大的模型、更多合成数据与训练预算。因而「通用结构化数据智能」目前更适合作为待验证的方向判断:做跨表格建模的团队可以关注这种联合建模范式,但不宜仅凭若干基准领先就假定跨领域迁移问题已经解决。

跨表格迁移可以从学习预测映射转向识别数据生成机制评估架构贡献时应拆分模型规模、合成数据量与训练预算的影响在真实分布偏移和异构业务表格上验证前,通用智能仍是主张而非结论

02 AI for Science 科研Agent的护城河开始转向持续学习闭环

科研Agent正在从「替人调用工具」走向「边协作边建设自己的训练系统」。ScienceBuddy会把研究者的请求、反馈和执行证据加工成训练任务与评测标准,再通过双层递归迭代:内层固定模型、改进工作空间与工具链,外层则在改进后的环境中训练模型。这个设计真正有意思的地方,是把日常使用、评测体系和模型更新接成持续闭环,让每次人机协作都有机会沉淀为下一轮改进的材料。论文摘要提到案例覆盖4类科学任务,但尚不足以判断这种闭环能否稳定泛化,也不能把它理解成脱离研究者监督的自主能力飞轮。对科研工具团队来说,值得重新审视的或许不是该接入哪个更强模型,而是能否把用户反馈和执行轨迹转化为可复用的评测与训练资产。

科研Agent的竞争重点正从工具调用转向持续学习闭环用户反馈只有被结构化为任务与评测标准,才能成为长期资产评估这类产品时应同时看工作空间、评测体系与模型更新机制

03 推理 清空上下文,推理反而更强了

扩散语言模型每生成一段就把它清掉,下一段却还能接着推理,甚至比保留离散文本效果更好——这个结果颇为反常。这项工作给LLaDA和Dream加入少量register tokens(寄存器token),专门把推理进度压进连续隐藏状态;生成内容被清除后,模型只凭原始提示和这份状态继续解码。按摘要报告,它在所有基准上都优于携带离散文本,数学任务最高提升8.5分,代码任务最高提升19.5分,对需要跨越多个生成片段的程序尤其有效。若这一机制能够扩展,长推理的关键资源可能不再只是上下文窗口,但清除可见文本并不等于清除信息,连续状态仍可能携带敏感内容。更棘手的是可调试性:隐藏状态究竟忠实保存了哪些推理、是否会悄悄丢失或篡改关键信息,仍需结合全文和专门探测实验确认。

把可携带状态视为上下文窗口之外的新计算预算清除文本不等于清除信息,隐私评估必须覆盖连续隐藏状态用于长程代码生成前,应优先验证跨片段状态的忠实性与可调试性

04 Agent 游戏AI横跨六类角色,迁移效果仍需逐个场景重验

会打游戏只是系统链的一环:玩家与世界建模产生数据,设计规格驱动内容和实现,试玩与测试反馈再推动迭代。论文将游戏AI梳理为行动、建模、设计、开发维护、运行时生成适配、测试评估六类角色,重点追踪各环节的产物能否被下一环复用。真正的瓶颈在迁移:轨迹、世界模型和设计规格可以跨环节流动,但控制方式、规则、引擎接口、状态表示和玩家群体往往把能力锁在特定场景里。现有证据主要集中在边界清晰的游戏对局和部分学习环境,长期状态、持续适配、反复修改软件及代表性自动化测试仍不成熟。对游戏团队而言,评估方案时应先问「换游戏、换引擎、换玩家后还成立吗」,而不是只看单项演示效果。

把游戏AI按数据与反馈流设计成系统链,能发现更多复用机会跨游戏迁移的主要障碍常是接口、状态表示和玩家差异采购或自研前应要求在目标游戏环境中重新验证效果

05 机器人 一百万帧真实数据,能把事件相机带出实验室吗?

约100万帧带标注的真实第一视角事件数据,把手部重建的验证范围扩展到包括弱光条件在内的真实环境。事件相机的价值也不只是换一种传感器:它能在普通图像容易模糊时保留高时间分辨率的运动信号,为机器人交互和AR/VR提供更稳定的输入。不过,佩戴者自身运动会制造大量背景事件,单纯分割手部又无法区分左右手,容易凭空预测不存在的手。研究通过分别检测左右手,并用检测结果动态控制注意力,以学习双手的位置关系和交互。摘要称该方法在合成与真实数据上均优于基线,但真实设备、复杂动作和长期运行中的稳定性仍需看全文及后续验证。

事件相机值得关注的核心是扩大弱光与高速运动下的可部署边界约100万帧真实标注数据有助于缩小事件视觉从实验指标到产品验证的距离做人机交互时应重点评估左右手实例识别和无手场景,而不只看平均重建误差
寄存器token让代码任务最高提升19.5分

也值得关注

06
可变长度一维token同时对齐图像与文本 多模态FLAT试图消除冻结视觉表示对生成能力的上限。链接
07
用「诱饵方向」抵抗拒答能力消融 安全对齐该方法通过快速后处理权重编辑,提高开放权重模型抵御RFA攻击的能力。链接
08
不可能任务能暴露自动量表的奖励漏洞 评测ImpossibleRubrics检验针对规则优化的答案是否会比诚实拒答获得更高奖励。链接
09
结构化场景记忆支持连续操纵物体运动 视频生成PhysStream无需用户预先给出完整控制序列,即可进行流式生成与细粒度控制。链接
10
Agent故障可能沿记忆、工具和环境持续扩散 安全对齐Emergence World把安全压力测试延伸到长期部署与多Agent交互尺度。链接
11
ECG标注稀缺时,解码器设计的贡献超过所评估的半监督学习方法 AI for Science研究聚焦P波、QRS波群和T波边界识别中的架构选择。链接
12
RAG来源风险需要随查询动态判断 检索生成前的分流层可根据来源与具体查询的关系决定放行、复审或拦截。链接
13
专家约束让合成基准兼顾规模与情境有效性 评测该框架将领域知识引入情境化评测数据的端到端生成过程。链接
14
逐轮密度比为长交互训练提供细粒度校正 训练优化多尺度估计把校正信号从完整Agent轨迹下沉到具体轮次。链接
15
递归语义—几何契约持续约束科学海报 图像生成可检查的持久契约让内容规划与版面约束在反复生成中保持一致。链接

今日观察

ScienceBuddy把用户反馈和执行证据转成训练任务与量表,情境基准生成框架借助专家知识扩展评测数据,ImpossibleRubrics则显示自动量表可能被针对奖励的优化反向利用。风险不在于自动评测本身,而在于任务生产者、奖励定义者和受训模型被接入同一条自增强链路:只要某类行为更容易被当前量表识别和奖励,闭环就可能不断复制这类样本、提高其权重,最终把「更会满足评分器」稳定放大为表面进步。

角色隔离是阻断这种偏移的关键。任务生成、评分和训练应由可独立审计的组件承担,采用分离的数据版本、权限和更新节奏,避免训练模型直接影响其下一轮奖励标准。外部校准也不能只做一次验收:专家样本、不可能任务和对抗答案应长期保留在闭环之外,既不参与训练,也不由同一模型链路改写。具体可先为每次模型更新建立一套固定的闭环外回归集,并设置规则:外部校准分数未同步提升时,不把自动量表上的增益计为能力进步。