今日概览
- 多Agent完成任务不等于协作良好:AgentWorld用100个人工标注任务测试3—20个角色不对称的Agent,最佳模型的任务成功率仅52.0%;CCE追踪行动间的因果依赖,并衡量团队投入中实际促成结果的比例;实验则暴露了沟通中断、角色混淆和共享计划难以维持等故障。
- PISA把稀疏选块推进到(O(N\log N)),金字塔式Top-K与融合Triton内核避免物化完整分数矩阵;摘要尚未提供端到端延迟和显存数据,实际工程收益仍待验证。
- 自然图像先验可迁移到高程图细化。研究剪枝Stable Diffusion 3的文本流,并以摄影测量DSM和Pléiades影像联合条件化,在留出城市波尔多将Dense Urban RMSE从4.16米降至2.77米。
重点关注
01 Agent团队做成了事,就等于协作得好吗?
多智能体任务只看最终成功与否,会把真正的协作贡献藏在一个二元结果里,也无法告诉开发者该修通信、分工还是计划机制。AgentWorld设计了100个人工标注任务及100个扩展变体,要求3—20个能力不对称的Agent在黑盒环境中连续协作50轮以上。它提出的因果协作有效性指标(CCE)会追踪行动之间的因果依赖,衡量团队投入中有多少真正促成了结果。实验中,最佳模型的任务成功率也只有52.0%,主要卡在沟通中断、角色混淆和跨轮次维持共享计划上。对Agent团队来说,这种评测比汇总单体能力更适合定位系统故障,但CCE如何构建可靠的因果关系、能否跨环境比较,仍需看全文确认。
原文:AgentWorld: Benchmarking Long-Horizon Collaboration of Multi-agent LLMs
02 推理加速:PISA把选块成本降至(O(N\log N))
稀疏注意力虽然少算了部分注意力,但决定保留哪些块,往往仍需为所有查询与候选块打分,隐藏成本依然是二次方。PISA用金字塔式Top-K从粗到细逐层筛选,每层只处理有限候选,并通过池化构建(O(\log N))层级,将整体复杂度推进到(O(N\log N))。它还用融合Triton内核完成分层路由和LogSumExp评分,避免物化完整的查询—键分数矩阵。语言建模评测中,该方法在常识推理上与基线相当,在检索任务上表现更好。只是摘要没有给出端到端延迟和显存占用,复杂度下降能否充分转化为真实工程收益,还需要看全文和实际硬件测试。
原文:Block Sparse Attention with Log-Linear Complexity
03 高程图细化需要先适配自然图像先验
噪声、异常值和空洞会削弱卫星立体摄影测量所生成数字表面模型(DSM)的高程精度。这项工作没有直接照搬Stable Diffusion 3,而是剪枝其文本流、加入分块归一化,并同时用摄影测量DSM和Pléiades卫星影像提供条件,让自然图像预训练获得的先验适应高程图细化。在唯一的留出城市波尔多,密集城区的均方根误差从4.16米降至2.77米,说明这种迁移在跨城市场景中仍有价值。更值得关注的是适配方法,而非把扩散模型当作开箱即用的地理工具;目前结论仅覆盖论文测试的法国城市和垂直配准DSM,也不能据此视为航空LiDAR的普遍替代。
