摘要
arXiv:2608.13571v1 公告类型:新论文
当语言模型首次尝试未能回答查询时,代理系统会重试,每次消耗额外的令牌。这种重试开销造成了模型单次令牌价格所暗示的成本与实际完整工作流成本之间的差距。我们将这一差距称为令牌膨胀,并将其定义为真实工作流成本与单次调用成本的比率。
像FrugalGPT这样的系统基于后者进行路由,这可能在困难任务上低估实际成本超过2倍。我们通过InflationAgent解决这一问题,这是一个四阶段路由器,它能够:
核心贡献
- 系统化测量:跨模型层级和任务类型系统化测量令牌膨胀,发现7B模型在多跳问答中的膨胀率高达4.25倍。
- CoT分支熵(CBE):引入一种完全基于局部推理计算的执行前难度信号,其预测高膨胀的AUROC达到0.887。
- 语义汇率(SER)模型选择:通过最大化语义汇率来选择模型,该汇率将预期准确率除以预测真实成本,并采用全新升级策略,在路由到更强模型之前丢弃失败的推理链。
实验结果
在固定预算下的GSM8K基准测试中,InflationAgent实现了94.7%的准确率,而FrugalGPT为91.0%,同时使用的令牌减少了31%。
此外,我们证明将失败的推理链转发给GPT-4o会使其准确率降低高达34.8个百分点,这验证了全新升级设计的有效性。