今日概览
- Skill-SP用技能层约束自我进化:可复用Agent技能连接任务生成、求解与验证,在扩展任务空间的同时降低错误奖励污染。
- Molt让算法实验回归PyTorch工程,通过原生、可追踪的异步训练循环降低Agent强化学习链路的修改成本。
- 原生多模态预训练呈现不同的规模规律。文本与视觉不会等比例受益,模型大小、token数量与数据配比需要联合设计。
重点关注
01 训练优化 任务越造越多,模型为什么反而可能越练越偏?
模型自我训练真正棘手的,不是题目不够多,而是开放生成的任务越丰富,错误奖励就越容易混进训练闭环。Skill-SP找到一个很有意思的中间层:把可复用的Agent技能同时作为出题条件、解题工具和反馈载体,让每个具体场景保持可执行、可验证,又能通过动态路由不断扩展任务空间。整个系统由出题者、解题者和技能控制器共同演化——出题者围绕抽取到的技能制造挑战,解题者探索候选方案,控制器再根据执行反馈更新并扩充技能库。这样一来,能力增长不再只依赖模型凭空「脑补」新任务,而是围绕能被实际调用和检验的技能持续加码难度。摘要称,这套机制在工具使用与推理基准上既能继续抬高成熟模型的上限,也能让原本没有对齐任务的模型出现明显逆转。这个方向最值得关注的,是技能库能否在更复杂环境中持续扩张而不积累验证偏差;如果可以,开放式自生成才可能真正从数据增广技巧变成可靠的能力增长引擎。
原文:Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
02 Agent Molt把算法实验拉回可控的PyTorch工程
在Agent强化学习实验中,更换一个估计器、采样方案或训练阶段,往往需要联动修改训练器、分布式后端和rollout(交互采样)链路。Molt把这条链路压缩为PyTorch原生、端到端可追踪的异步循环,让研究者乃至Coding Agent都能理解并重组完整训练流程,而不是只会修改局部模块。它还强调只训练策略自身生成的token,并保持数据、策略版本和模型语义一致,试图减少异步训练中隐蔽的数据错配。摘要称其在匹配的全异步设置下,效果与先进的Megatron方案统计相当,但代码精简是否会在更大规模和更复杂实验中继续成立,仍需看全文与实际复现。对需要频繁试验新算法的团队而言,Molt最值得评估的不是功能数量,而是它能否真正缩短从想法到可靠实验的周期。
原文:Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning
03 多模态 原生预训练呈现不同的规模回报
固定算力下,文本与视觉从规模扩展中获得的回报并不同步。这项工作选择从零训练视觉语言模型,并研究固定算力下模型大小、训练token数量和数据配比如何共同决定效率。结果显示,语言学习的资源分配规律对数据组成相对稳定,多模态学习却敏感得多;文本占比较高的混合数据,要到更大模型规模才更划算。原生预训练还表现出正向跨模态迁移,包括改善纯文本空间推理和多模态上下文学习,不过具体收益幅度和适用边界仍需看全文确认。这并不证明原生路线必然取代晚融合,但提醒训练多模态基础模型的团队:扩规模之前,数据配比与参数容量必须一起设计。
也值得关注
今日观察
Skill Self-Play、Molt与IDEAgent共同显示,前沿能力开发的关键正在从设计一次性的任务或损失函数,转向构建可持续迭代的搜索与训练闭环。技能层把开放任务拆成可执行、可验证的单元;质量—多样性搜索维持候选空间的广度,避免搜索过早坍缩;模块化训练框架则降低重组训练链路的工程成本。三者解决的是同一条闭环上的不同约束:任务能否继续扩展、反馈是否可信,以及算法修改能否快速进入下一轮实验。
因此,评估Agent训练系统不能只看最终benchmark。团队应分别记录新任务覆盖率、验证错误率和每次算法改动的工程周期,因为这三项共同决定自我改进能否规模化。具体行动上,可从下一轮实验开始建立三项指标的统一看板,并为每次训练迭代保留可追踪的版本记录。