研究背景与挑战
评估LLM编码智能体在算法交易中的表现十分困难,因为静态基准测试存在数据污染风险,且数值回测输出需要依赖实际代码执行的真实结果。
Backtrader-Bench框架介绍
我们提出了Backtrader-Bench,一个包含两条互补流水线的评估框架。
确定性选择题(MCQ)流水线
该流水线基于回测配置生成问题,覆盖五种交易策略、33种模板和三个难度等级,并配备独立检查器重新推导每个答案。
生成器-求解器过滤流水线
该流水线自主挖掘更难的问题:生成器编写经可执行代码验证的问题,将其转换为选择题,并丢弃任何无需代码执行即可由无工具求解器回答的问题。
实验评估与结果
我们在30道精选题目上评估了11个无工具模型(每个运行10次)和4种带工具配置。
- 工具增强智能体在单次运行中达到90.0%的准确率(GPT-5.5和Opus 4.7),比最佳无工具基线(10次运行平均73.0%)高出17个百分点。
- 在另外38道单独挖掘的题目上,无工具准确率进一步下降,半数模型跌至接近随机水平(25%)。
未来方向
除了评估之外,可扩展的MCQ基础设施旨在为强化学习生成训练语料库,最终目标是构建一个专门用于量化交易工作流程的智能体。