首页 > 资讯 > 颜水成团队新作:Scaling Harness Intelligence

颜水成团队新作:Scaling Harness Intelligence

36氪文章 2026-09-03 13:45 1 阅读 查看原文

智能体(Agent)的能力并不完全由底层模型决定,负责管理记忆、制定规划、编排工具调用并在失败时触发恢复机制的 Agent Harness,同样至关重要。

一个 SOTA 基础模型,如果被置于错误的记忆策略或行动协议下,表现出的能力会大打折扣;反过来,一套精心设计的 Agent Harness,却可以“放大”一个中等规模模型的实际性能。

然而,Harness 设计仍然依赖人工、局限于特定任务,且从根本上难以扩展

在这项工作中,新加坡国立大学颜水成教授团队及其合作者提出了JIT-Agent,将 Harness 构建从一种人工工程化、提前设计好的 artifact,转变为了一种可学习的能力,从而为任意现成的 Agentic LLM 实时合成任务自适应的 Agent Harness

论文链接:https://arxiv.org/pdf/2608.25593

结果显示,在深度研究、日常工作、规划和工作空间任务中,JIT-Agent 生成的 Harness 能够持续增强其底层骨干模型的能力,与 OpenCode、Claude Code 等成熟 Agent 运行时处于同一竞争区间,并扩展了成本-性能边界。

研究团队表示,JIT-Agent 是首个专为即时 Harness 生成而构建的模型,将 Harness 智能确立为一种独立于模型规模扩展、可训练、可迁移、可复合的 Agent 能力维度。

研究方法

为使 Harness 能够被模型稳定生成,研究团队没有让 JIT-Agent 直接输出完全不受约束的 Agent 程序,而是建立了一个固定的四模块协议,如下:

  • Memory:决定历史交互和中间状态如何保存、压缩并呈现给模型;
  • Planning:形成下一步指令,拆分和调整任务目标;
  • Action:推进动作执行循环,处理工具调用与执行结果;
  • Capability:编排可用工具和技能,决定不同阶段暴露哪些外部能力。

这四个模块共同构成一个可组合的 Harness。固定协议规定了模块接口、生命周期、验证规则和执行语义,同时保留每个模块内部的设计空间。

据此,他们构建了HarnessFactory,将不同类型的代表性 Agent Scaffold 统一到同一套接口下。JIT-Agent 输出的是结构化、可执行的模块,而不是一段仅供阅读的自然语言描述。这样做既减少了无关的语言差异,也让生成结果能够直接进入执行流程。

为解决 JIT-Agent 训练中面临的适配性(adaptivity)、可靠性(reliability)和可进化性(evolvability)挑战,研究团队采取了以下三阶段训练

第一阶段:看任务定制 Harness

在这一阶段中,模型通过教师模型生成的、符合协议的示例,学习如何根据任务结构选择不同的记忆、规划、动作和能力编排方式,从而理解当前任务的主要瓶颈是什么,哪些模块需要特殊设计。

例如,如果任务依赖大量外部证据,Harness 可能需要更关注检索内容的组织和工作记忆;如果任务涉及多个执行阶段,则需要让规划和状态管理能够随着阶段变化而切换;如果任务要求修改文件,则动作模块和验证机制需要围绕文件状态进行组织。

第二阶段:从失败轨迹中学习修复

仅仅生成一个结构合理的 Harness 还不够。模型输出可能存在编译错误、接口不匹配或运行时失败,因此模型还需要具备恢复能力。

这一阶段将失败的 Harness 生成过程转换成有边界的修复轨迹。模型学习识别失败原因,并在不改变整个系统的情况下,对相关模块进行修正。

这一步的关键在于,可靠性不再完全依赖外部工程师手动调试。Harness 生成器本身也被训练成能够处理自身输出的问题。

第三阶段:持续自进化

在这一阶段中,他们提出了“进化群组解耦策略优化”(Evolutionary Group-Decoupled Policy Optimization,Evo-GDPO),旨在让模型不断利用执行反馈自主生成最优 Harness。

与只追求单一任务得分不同,Evo-GDPO 分别对奖励、延迟和成本进行归一化处理。这样,模型不只是寻找“效果更好”的 Harness,也需要考虑执行效率和资源开销,推动 Model-Harness 组合不断扩展成本-性能边界。

经过上述训练,他们最终得到了一个能够即时定制、修复和进化任务专属 Harnesse 的 Harness Intelligence 模型——JIT-Agent-27B。

实验结果

研究团队在多个 Agent 基准和多个模型骨干上对 JIT-Agent 进行了评估。

结果表明,JIT-Agent 能够为不同模型带来显著的性能提升。例如,在 JIT-Agent 作为 Harness 助手的情况下,DeepSeek-V4-Flash在 DeepPlanning-Shopping 上的分数增加 24.8%,超越 GPT-5.6;GLM-5.2则在 OfficeBench、AgentIF、DeepSearchQA 榜单上全部取得 SOTA 分数。

同时,JIT-Agent 生成的 Harness 在性能上与 OpenCode、Claude Code 等成熟 Agent 运行时处于同一竞争区间,为 DeepSeek V4、Mimo-V2.5、Qwen3.6 三个模型系列带来了持续的性能提升。

下一步?

研究团队将 Harness Intelligence 视为与模型容量、推理算力并列的另一个基础 scaling 维度,而 JIT-Agent 则是实现这一目标的重要一步。

更长远的机会在于一种model–harness 协同设计范式,即基础模型与塑造其记忆、规划、行动和工具使用的操作性结构共同被训练。

不过,研究团队表示,未来的系统或许不必采用本研究中“有意为之的激进形式”——整个脚手架都可以被即时重新设计。保留一个稳定的核心 harness,同时允许模型在任务需要时构建、修订或替换其中特定的组件,或许是更好的选择。

他们认为,随着这一范式的成熟,Harness 合成、修复和进化的能力将逐渐被内化到基础模型本身。模型将不仅学会在给定 Harness 下行动,还会学会改进它所依赖的 Harness,进而衍生出关于自适应接口、可验证运行时修改、以及模型与执行系统协同扩展的更广泛研究议题。

本文来自微信公众号“学术头条”(ID:SciTouTiao),作者:学术头条,36氪经授权发布。