今日概览
- 7B模型用搜索补足参数容量,ZGCM-1通过内部推理、外部工具和256K上下文构建系统能力,16K预训练达到相同损失所需时间缩短约4.2倍。
- 安全监督必须覆盖实际执行轨迹:HazardAuditor将跨框架的运行时交互记录归一化,摘要报告相对最强既有守卫最高提升16.5个百分点。
- 理解、行动和预测可以共享序列目标。PhysBrain 1.5从人类交互视频获取具身监督,把回答、末端执行器运动和未来视觉状态编码为离散序列,但真实控制精度与延迟仍待验证。
- 可运行重建暴露两类指标的分离,BVB最佳模型虽获88.6感知相似度,却只保留53.7%的原视频时空事实。
重点关注
01 训练优化 7B不背下整个网络,反而更像一套系统
7B模型容量有限,ZGCM-1索性不把「记住开放网络」当目标,而是用内部推理和外部工具调用补足参数记忆。为支撑256K上下文,它交替使用滑动窗口与全局注意力,并将上下文从16K逐步扩展到64K、256K,把架构选择、训练系统和课程设计放在一起优化。论文报告称,其16K预训练达到相同损失所需时间缩短约4.2倍;但这是训练效率,不等于推理更快,也不能直接推出最终能力提升4.2倍。在数学推理和智能体搜索任务上,作者称7B模型可与部分规模大得多的前沿模型竞争,更合理的理解是:工具增强任务可能缩小参数差距,而不是小模型已普遍追平大模型。对小模型团队更有价值的,或许是完整开放的阶段权重、中间检查点、数据配方、训练代码和实验日志,它们能帮助判断效率来自哪里。具体优势能否跨任务复现、256K上下文是否真正有效,以及工具调用带来的额外推理成本,仍需结合全文和独立测试确认。
原文:ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
02 安全对齐 当风险发生在点击之后,文本护栏还能守住什么?
计算机操作Agent进入浏览器、终端和文件系统后,风险会在运行时交互中出现,单看提示词与回复很容易漏掉真正的问题。HazardAuditor在受控环境中运行Claude Code、Codex、Hermes和OpenClaw,再把各自不同的交互记录归一化为统一事件表示,让同一套安全监督能够跨框架训练。这一步填补了评测与守卫之间的缺口:平台给出一次安全判定,只能说明某次执行是否越界,无法自然变成可部署模型能复用的训练信号。训练上,它用GuardPO将确定性的安全结果转成序列级优势,并分别归一化推理说明与最终判定,避免长解释在梯度更新中压过安全决策本身。摘要报告相对最强既有守卫最高提升16.5个百分点,结果值得关注,但跨框架泛化范围、实时拦截成本和误报代价仍需看全文及实际部署验证。
原文:HazardAuditor: From Executable Threats to Safer Computer-Use Agents
03 机器人 人类交互视频,怎样变成理解、行动和预测的共同训练料?
PhysBrain 1.5先从人类交互视频中构造以任务为中心的片段,将语义和空间上下文与恢复的运动、后续观察配对,再用人类演示、机器人轨迹和模拟经验的混合数据进行监督微调。它把语言回答、末端执行器运动和密集视觉目标编码成三类离散序列,并统一用自回归下一token预测联合优化,让理解、行动和未来状态预测进入同一学习框架。其8B模型在28个具身理解基准上平均得分72.5,并在14项测试中取得开源最佳成绩;不过摘要对动作生成和未来场景预测只给出了定性案例。这种统一表示是否能减少模型拼接与训练目标割裂,是其值得验证的工程假设,而不是已经得到测量支持的结果。真正进入机器人部署前,仍需看控制精度、推理延迟,以及长序列执行中的误差是否会持续累积。
原文:PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models
04 评测 视频理解的评价单位,正从答案变成可执行场景
BVB不再让模型回答几道视频问题,而是要求它编程生成一段可运行、可渲染、可检查的Blender动画,把物体几何、运动轨迹和时间关系一起交付出来。重建结果暴露了感知相似度与时空事实保留率之间的缺口:表现最好的模型拿到88.6的感知相似度,却只保留了原视频中53.7%的时空事实,画面「看起来像」不等于内部关系还原正确。增加推理能改善视觉相似度,却没有补上事实准确性的差距,说明模型更容易复刻观感,而不是生成一致的可执行世界模型。不过,这项评测也混入了Blender编程与成本限制等因素,不能被当作纯粹的视频理解测量;更合理的用法,是把它作为现有问答评测的高压补充。
原文:BVB: Benchmarking Agentic Video Understanding via Programmatic Reconstruction in Blender

也值得关注
今日观察
今天四项工作的共同点,不是都在记录同一种轨迹,而是外部环境同时承担了三种不同角色。ZGCM-1把工具和搜索当作参数容量之外的能力补偿;PhysBrain 1.5从人类交互视频及后续观察中获取具身监督;HazardAuditor把运行时交互转化为跨框架安全监督;BVB则让Blender中的编程、执行和渲染直接成为评测过程。环境不再只是模型输出之后才接触的对象,也可以是能力来源、训练信号和可执行验证条件。
这一区分带来一套更具体的判断标准:工具增强要检查调用成本与跨任务收益,环境监督要验证从交互视频恢复的信息能否支撑控制和预测,运行时守卫要衡量跨框架准确率、延迟和误报,可执行评测则要拆开理解能力、编程能力与成本限制的影响。与其把「接入环境」视为统一的能力标签,更应追问环境究竟补偿了什么、提供了什么监督,以及最终指标测到了哪一层。