今日概览
- NeoHorse-1把路由日志转化为训练飞轮,4B模型的11项基准宏平均从58.94升至64.87,为线上遥测驱动能力迭代提供了可测量的工程路径。
- AuK用一个接口统一语音生成与编辑:约30.3亿条指令—音频实例支撑五类任务,AuK-Flash以4步推理实现4.5倍端到端加速。
- 长时程Agent学不会时,可以先改造环境反馈。反馈增强环境在SciWorld和BFCL上跨模型规模及多种RL算法稳定提升,并促进困难任务探索。
- Miles把RL训练环路拆成可验证组件;可定制的训练组件为系统改造和故障定位提供条件,但大规模案例尚不能证明普遍的性能与成本优势。
重点关注
01 Agent路由器能把线上流量变成训练飞轮吗?
Agent系统每天都在产生能力需求、模型选择和任务结果,但这些线上遥测通常只用于监控,很少直接进入下一轮训练。NeoHorse-1把路由器变成数据入口:记录每轮请求需要什么能力、分配了哪档模型及最终交互,再经过结构校验、六维语义评估和子场景标注,转化为保留推理、工具调用与运行环境上下文的训练样本。路由信号随后用于组织三阶段微调课程和在线蒸馏,评测反馈则决定下一轮训练数据的配比,由此形成「评测—选择—更新」的闭环。摘要报告称,4B模型的11项基准宏平均从58.94升至64.87,9B模型从65.60升至69.04,说明这套飞轮至少能带来可测量的能力增量,并缩小小模型与大模型之间的总体差距。对Agent团队而言,这项工作的实用价值在于展示了一套把线上交互持续转成训练资产的基础设施,而不只是又一种后训练配方。不过,单轮实验尚不足以证明「递归自我改进」:系统能否跨多轮迭代稳定增益、避免数据偏差被不断放大,以及评测提升能否迁移到真实任务,都需要看全文和后续结果确认。
原文:NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness
02 多模态:一个接口统一语音生成与编辑
AuK通过自然语言指令和音频上下文提供统一接口,覆盖语音生成、内容编辑、增强与分离、副语言编辑和声学编辑五类任务。支撑这种统一能力的是约30.3亿条指令—音频实例和195万小时有效监督,这让它更像一个可扩展的语音底座,而非单点工具。模型还提供4步推理的AuK-Flash版本,在相同条件下获得4.5倍端到端加速,意味着统一工作流未必必须以高延迟为代价。论文摘要报告其在零样本、指令控制生成和通用编辑上达到领先水平,同时在信号修复任务上保持竞争力。代码与权重开放确实给开发者提供了检验新交互方式的机会,但如此庞大的数据与训练规模并不等于低成本复现,全场景质量也仍需结合全文和实际测试判断。
原文:AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing
03 Agent学不会,先改环境而不是改模型
反直觉的是,长时程Agent学不会,缺的可能不是更多示范,而是一个能及时暴露进展的环境。这项工作把训练干预从模型侧的监督微调(SFT)移到环境侧:构建反馈增强环境(FEE),并在单次任务探索和多轮训练的后期,用更丰富的观察信息逐步替代直接的动作指导。在SciWorld和BFCL基准上,这种方法跨Qwen3模型规模及多种强化学习算法都获得了稳定提升。摘要中的分析还显示,FEE能降低训练熵的波动、促进困难任务中的主动探索,而且环境提示会被写入策略参数,而非仅仅成为推理时的临时拐杖;不过,同组样本间的反馈一致性是稳定优化的重要边界。对训练Agent的团队来说,当奖励过于稀疏时,值得先检查环境是否能持续呈现状态变化,再决定是否投入成本追加SFT数据。
原文:Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks
04 训练优化|Miles把RL训练环路拆成可验证组件
Miles以准确性、效率、可靠性和扩展性为目标组织RL训练环路,并把组件的可验证、整洁和可定制作为统一设计原则。系统把推理生成、模型训练和权重同步拆成可验证、可替换的组件,并提供多种训练后端与同步方式,为团队按部署拓扑改造系统和定位故障提供更清晰的组件边界。它还把全参数训练、LoRA、在线蒸馏和监督微调纳入同一架构,减少不同训练方式各自维护一套基础设施的负担。摘要给出的案例是在64张NVIDIA GB300上对GLM-5.2 744B-A40B进行全异步智能体训练,表明系统能够运行这一规模的任务,但单个案例还不足以证明普遍的性能或成本优势。对准备自建后训练平台的团队来说,这套开源系统更适合作为可审查、可改造的工程基线,而「production-ready」仍需结合长期稳定性和自身负载验证。

也值得关注
今日观察
本期更值得追问的是,每次能力增益能否追溯到具体训练样本及其生成过程。NeoHorse把能力需求、模型层级和交互结果转为训练材料,再依据评测反馈调整下一轮数据配比;Miles则把训练环路划分为可验证、可定制的组件。随着数据选择、生成和训练阶段之间的联动增加,如果记录中缺少完整的样本血缘,即使指标持续上涨,团队也难以判断增益究竟来自哪批数据、哪次路由决策或哪种奖励来源。建议从下一轮实验开始,为每条训练样本绑定路由决策、环境版本、奖励来源和生成链路ID,并让评测结果能够沿这些字段回溯到具体训练批次。