GitHub 推出了 HydraFusion 项目,这是 GitHub Copilot 的一项高级研究预览功能,旨在通过运行时模型协调提供前沿级的编码智能。在先前自动选择模型功能的基础上,HydraFusion 将工作流执行视为一项优化挑战,利用来自多个提供商的模型动态地构建完整的执行计划,从而处理核心的开发任务。
该系统利用针对复杂操作量身定制的显式能力信号来评估传入的提示。这些操作包括多步骤推理、自动代码生成、结构化调试以及高级工具使用。HydraFusion 不会依赖单一静态模型,而是会根据任务的复杂程度和上下文,将请求路由到三种不同的运行时执行模式:
-
单一模式:当选定的模型具备足够的能力独立完成任务时,该模型将直接执行,以实现速度和延迟优化的目的。
-
级联模式:高效模型生成初始解决方案草案,由质量门控机制进行评估。如果输出结果满足要求,则予以采纳;否则,任务将升级至更强大、能力更强的模型。
-
评审模式:起草模型生成初始解决方案,随后由来自独立模型族、无工具执行权限的独立只读评审模型进行评估(这与“橡皮鸭”评审模式相呼应)。随后,原始起草模型将根据此次评审结果进行一次结构化修订。
为了确保健壮性,而且执行过程符合生产级标准,HydraFusion 的架构遵循以下五项基本运行原则:完整的计账机制,用于追踪每个工作流阶段(起草、评审、修订、升级、重试和回退)的令牌成本和使用情况;执行边界限制机制,强制执行严格的超时规则和取消处理;评审步骤隔离机制,在没有工具的环境中可以防止修改操作;故障安全的补丁应用例程,在验证失败或执行被取消时拒绝打补丁;经过验证的路由机制,在运行时启动前预先检查模型可用性和绑定关系。
在针对三个代理式编码基准测试的受控离线评估中,HydraFusion 的选择性运行时工作流不仅达到甚至超越了基准测试的质量指标,而且大幅降低了预估成本。值得注意的是,在基准测试 TerminalBench 2.1 中,与 Claude Opus 5 相比,它完成验证任务的质量提升了 4.9 个百分点,同时将预估成本降低了 67%。
CheckpointBench 是一个基于可重放的真实 GitHub Copilot 代理编码会话(这些会话关联了特定的公开代码库和不可变的提交)而精心构建的内部多轮基准测试平台。在该平台上进行的测试中,该项目取得的平均会话得分几乎可以与参考基准 Claude Opus 5 持平,两者仅相差 0.1 个百分点,而预估的工作流成本降低了 65%。
目前,HydraFusion 项目仅作为研究预览版发布,通过 GitHub Copilot CLI 中的 /experimental 配置向 GitHub Copilot 所有层级的用户开放。开发者可以通过更新 CLI 环境、执行 /experimental on 命令,并在 /model 选择界面中选择 HydraFusion 来启用这项功能,其使用将根据执行过程中调用的底层模型的标准 Token 费率进行计费。