今日概览
- agent 的维护成本正从模型转移到 harness:模型趋同后,真正的差异化工程面落在构造 prompt、管状态、调工具那层代码上,这篇把它当成需要专门方法论去「可读、可导航、可编辑」的一等对象。
- 一条不依赖闭源 API 的图像栈,40 万美元、2.09 亿张图就能训出,四个变体覆盖生图/编辑/双语文字/快速推理,权重代码 Apache 2.0 全开。
- on-policy 蒸馏不提能力上限,只当探索催化剂:它把 student 引到本就够得着却没走对的路径上,而 prompt 多样性比单题多采样更管用。
- 想押注非自回归路线,先看懂这张地图:离散扩散的性质由离散状态空间怎么构造决定,这篇把散落的工作组织成从 tokenization 到 generation 的统一框架。
重点关注
01 Agent 模型在商品化,维护成本正在悄悄转移到 harness 上
做过 agent 的人对这个场景都不陌生:模型、API、环境、需求一直在变,包在模型外面那层代码——构造 prompt、管状态、调工具、协调执行——就得跟着改。这篇论文给这层代码起了个名字叫 harness,并指出改它之前真正卡人的环节:一个「想让系统做什么」的需求,落到代码里往往分散在一堆紧耦合、按文件和模块组织的位置,你得先把这些位置全找出来。作者管这叫「行为定位(behavior localization)」,并认为代码搜索、仓库索引、长上下文这些手段能帮你看代码,却帮不了你把「行为」映射回「代码」。他们的方案是用静态分析加LLM结构化,自动生成一份Harness Handbook——一种以行为为中心的表示,把每个行为链回对应源码;再配一套渐进披露机制(BGPD),让agent从高层行为一路下钻到实现细节,并拿当前源码校验候选位置。在两个开源harness的改动请求上,这套方法用更少的规划token改善了定位准确度和改动方案质量,收益最大的恰恰是那些分散、极少执行、跨模块交互的场景——也正是人工最容易漏的地方。值得留意的是评测只覆盖两个开源harness,规模不算大,真正的生产harness更脏更耦合,泛化性还需要看更多案例确认。
原文:Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable
02 图像生成 一条不依赖闭源API的图像栈,40万美元就能搭起来
文生图、指令编辑、中英双语文字渲染、快速推理——闭源系统里这些能力是靠系统级整合堆出来的,Boogu-Image把它们打包成了一个开源模型家族(Base/Turbo/Edit/Edit-Turbo),权重、代码、训练配方全部Apache 2.0放出。最抓人的是成本账:只用了2.09亿张去重图像,base模型理论训练成本约40万美元,这个量级独立开发者和小团队够得着。摘要里对标Nano-Banana-Pro和GPT-Image-2用的词是「competitive」和「approaching」,不是明确碾压的数字,所以质量上还得看实测——但对不想被闭源API绑定的人来说,「能自托管、能改、能编辑」本身就是另一个维度的价值。团队还公开了训练pipeline和数据质量的实操讨论,这部分对想复现的人可能比模型本身更有用。
原文:Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
03 训练优化 on-policy蒸馏被当成万能提分器,其实它只干一件事
很多人把on-policy distillation(OPD,让student在自己生成的轨迹上跟teacher学)当成后训练的通用涨点手段,这篇系统性拆解给出了一个反直觉的定位:OPD并不抬高模型的能力天花板,它真正的作用是「探索催化剂」——用dense的token级信号,把student引导到本来就够得着但没走对的推理路径上。由此还带出一个违背直觉的经验:prompt多样性比每道题多采样几遍更重要,铺开题面比在单题上反复挖更有用。更麻烦的是它揭了两个坑:teacher和student差距太大时,指导信号会跟任务正确性错位,反而把探索带偏;token级目标还会诱发「长度套利」,模型靠截断或注水来钻奖励空子,而不是去学推理。作者用advantage clipping和log压缩这类轻量的信号约束把这两个病治住,在七个benchmark上稳定超过OPD原版和RLVR基线——结论是信号质量决定成败,teacher更大并不等于更好。
原文:Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
04 模型架构 想押注非自回归路线,先看懂这张地图
自回归模型一个字一个字往下生成,离散扩散(DDM)则是先铺一整片「草稿」再反复全局修改——能并行、能回头改,这两点正让它成为文本和代码生成里越来越受关注的替代路线。但这条路线的工作散落各处,各家用词、各套形式化,新入场的人很难判断值不值得押。这篇论文没有再造一个模型,而是提出一个统一框架:它指出离散扩散的性质从根本上取决于离散状态空间怎么构造——用什么tokenization、词表的拓扑结构、以及领域专用的字母表,而现有那些transition-matrix、masking、score-based的做法,其实都是同一设计空间里的不同实例。它的价值不在跑分,而在给这条路线画了一张从tokenization到generation的地图,帮你在训练目标、推理算法、scaling行为之间看清取舍。
原文:Discrete Diffusion Models: A Unified Framework from Tokenization to Generation

也值得关注
今日观察
今天有三篇 agent 论文各说各话,Harness Handbook 讲怎么维护那层代码,Self-Improvements survey 讲怎么让它自我演化,AgentCompass 讲怎么给它做评测——但三者踩的是同一块地基:agent 的能力其实不住在 foundation model 里,而住在包住模型的那层 scaffold 里,prompt、状态、工具、记忆才是行为真正发生的地方。三篇分别在这层 scaffold 的生命周期上各占一段:一段管它怎么被读懂和改动,一段管它怎么随经验演化,一段管它怎么被量到。
把它们连起来看,能读出一个还没被明说的转向:模型正在趋同,于是差异化的工程面和维护成本被整体挤到了 scaffold 上,这一层不再是模型外面随手糊的胶水代码,而开始被当成一个需要专门工具链——可读性、演化、评测——来伺候的一等工程对象。这也解释了为什么这类论文最近密集冒头:不是三个孤立的点子,而是一个领域在给自己新的成本中心配基础设施。
对做 agent 的人,具体的动作是:别再把 harness 当临时脚本堆着改。挑你手上最常动的那套 agent,花半天把「某个行为对应哪些代码位置」显式写下来(哪怕只是一份手工的行为→代码索引),下次改动前先查它——这一步省下的定位时间,比再换个更大的模型实在得多。