首页 > AI前沿 > Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs

Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs

arXiv自然语言 2026-08-13 12:00 1 阅读 查看原文

研究背景与挑战

评估LLM编码智能体在算法交易中的表现十分困难,因为静态基准测试存在数据污染风险,且数值回测输出需要依赖实际代码执行的真实结果。

Backtrader-Bench框架介绍

我们提出了Backtrader-Bench,一个包含两条互补流水线的评估框架。

确定性选择题(MCQ)流水线

该流水线基于回测配置生成问题,覆盖五种交易策略、33种模板和三个难度等级,并配备独立检查器重新推导每个答案。

生成器-求解器过滤流水线

该流水线自主挖掘更难的问题:生成器编写经可执行代码验证的问题,将其转换为选择题,并丢弃任何无需代码执行即可由无工具求解器回答的问题。

实验评估与结果

我们在30道精选题目上评估了11个无工具模型(每个运行10次)4种带工具配置

  • 工具增强智能体在单次运行中达到90.0%的准确率(GPT-5.5和Opus 4.7),比最佳无工具基线(10次运行平均73.0%)高出17个百分点。
  • 在另外38道单独挖掘的题目上,无工具准确率进一步下降,半数模型跌至接近随机水平(25%)

未来方向

除了评估之外,可扩展的MCQ基础设施旨在为强化学习生成训练语料库,最终目标是构建一个专门用于量化交易工作流程的智能体