今日概览
- 线上故障可以直接沉淀为回归测试:TraceDance从252,557条真实Agent会话生成107个专项基准;但两名标注者仅共同确认84%的抽样实例,九个前沿模型在这些测试上的平均通过率为26.7%。
- YuE2把可读乐谱变成歌曲生成接口,同一模型可规划、生成并局部编辑音乐;WildSongBench常规结果为6.73,6.96则来自best-of-8择优。
- 程序核验让自生成答案正确率从76%升至94%。VQS先将图像转成结构化记录,再由固定程序出题和计算答案,使Qwen3-VL在10个基准上最多提升3.18分。
重点关注
01 Agent 25万条部署轨迹,正在变成可复用的回归测试
TraceDance从252,557条真实Agent会话中定位特定的不良行为,再围绕出问题的决策点自动生成专项测试,让团队可以把线上故障直接纳入后续版本的回归验证。它先用可编程检索寻找候选轨迹,再由Flash大语言模型逐条确认;如果团队关注的是自定义行为,系统还会循环生成、修订检索规格。评测时不必重放整个环境,也不要求唯一参考答案,而是让模型从记录下来的决策点继续行动,再按行为专用规则判断下一步是否合适。实验最终构建了107个基准、4,125个实例,完成了95.3%的构建请求,说明这套「故障即测试」的流水线具备一定规模化潜力。边界也很明确:两名人工标注者仅在84%的抽样实例上都确认目标行为确实存在,意味着自动生成的测试仍需抽检,不能直接视为可靠真值。九个前沿模型的平均通过率只有26.7%,既暴露出Agent在具体行为决策上的短板,也可能受到测试噪声影响;对实际团队而言,这套方法更适合发现回归和比较版本,而不是单凭一个总分判定模型能力。
02 多模态 生成歌曲之前,先写一份能编辑的乐谱会怎样?
纯音频生成器能直接交付成品,却往往把旋律、和声和结构藏在不可读的内部表示里;YuE2更有意思的地方,是先生成可读乐谱,再将其扩展为语义音乐token并完成整曲音频。这个显式计划不是装饰:专家对比同一检查点时,49.3%更偏好带符号规划的结果,明显高于不带规划的34.6%。在WildSongBench上,常规结果为6.73,而6.96来自8个候选中择优,不能当作单次生成水平。更值得关注的是,同一模型还能遵循局部乐谱修改、尽量保留未编辑部分,并让外部语言模型把用户反馈转成作曲调整。对音乐产品团队来说,这意味着竞争焦点可能从「生成一首好听的歌」转向「提供一个可理解、可修改、可协作的创作接口」。
原文:YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality
03 训练优化 让程序管住模型裁判,自生成答案从76%升到94%
让视觉语言模型自己出题、自答,再拿答案训练自己,没想到最容易积累的不是知识,而是被反复写回训练集的错误。人工评估显示,多数投票生成的标签有24%错误,模型裁判也有18%错误,说明多采样几次并不能自动换来可靠答案。VQS先把图像解析成场景图、表格或关系图等结构化记录,再由固定程序出题并计算答案;模型不再裁决整个答案,只逐条确认程序用到的视觉事实。这样生成的答案正确率达到94%,高于多数投票的76%,并让Qwen3-VL在10个基准上最多提升3.18分,2B模型经过三轮训练后增益达到3.84分。对自举训练团队来说,值得优先设计可验证的数据生成流程,但结构化解析本身是否会在更复杂图像上成为新瓶颈,仍需看全文和更多场景验证。
原文:Program-Verified Self-Evolution for Vision-Language Models

也值得关注
今日观察
三篇主文都在把原本藏在生成过程里的信息变成可检查、可复用的中间对象:TraceDance将部署故障固化为决策点测试,使线上问题能够进入后续评测与回归验证;VQS将视觉内容转成程序可计算的结构化记录,让数据生成、事实核验和下一轮训练连成闭环;YuE2则把歌曲生成外显为可读、可编辑的乐谱,使规划结果能被人工审阅并继续用于局部修改。
这些中间对象的价值不只是帮助人理解模型,而是为评测、训练和编辑提供共享接口。产品团队在设计生成系统时,应避免只保存输入与最终输出,并从下一版数据结构开始,明确加入一种能够被程序验证、人工审阅且可用于后续训练或编辑的中间表示。