首页 > 开源 > 通过分析 16900 次会话数据,看看 Claude Code、Codex、Cursor 各选了什么工具

通过分析 16900 次会话数据,看看 Claude Code、Codex、Cursor 各选了什么工具

OSChina资讯 2026-09-07 14:37 3 阅读 查看原文

这个实验规模很大:16893 次会话,1163 个 prompt 变体,75 个代码仓库,10 种语言,3 个主流 coding agent——Claude Code、Codex 和 Cursor。每个任务不是让 agent 给建议,而是直接实现。最后筛出 5292 个有效会话,覆盖 51 个代码库和 18 个行业。

Armature 是一家做开发者工具增长的公司,他们自己说这是「有偏见的」,但实验设计还算严谨:用 Gemini 3.7 Flash 模拟人类审查来减少 provider 偏见,再用另一个独立的 Gemini 3.7 Flash 实例对比对话记录和实际代码 diff 来判定胜负。

Coding agent tool choices

几个发现。

三个 agent 的选择差异很大。 Cursor 在约 67% 的会话中会做网页搜索,Codex 是 94%——大量使用 site: 操作符在可信域名内搜索,Claude Code 只有约 30% 的时间搜索,但一旦搜起来,浏览的页面数量是前两者的 3 倍。在沙箱这类较新的领域,Claude Code 的搜索率飙升到 80%。三个 agent 在所有任务上只有 42% 的时间达成一致。举了个例子:做语音 agent 功能,Claude Code 选 Twilio,Codex 选 OpenAI Realtime API,Cursor 选 Vapi。Claude Code 自己造轮子的概率是其他两个的两倍(19% vs 10%)。

仓库上下文比 prompt 更能决定选择。 同一个「发邮件」任务,放到四个不同语言和仓库里,结果完全不同:Resend(TypeScript,55/89),Sendgrid(Python,22/24),Postmark(Go,20/24),Azure ACS(Java,22/23)。Vercel 在 TypeScript 仓库上 100% 被选(只要有 Next.js),但在 Python 仓库上从来没赢过——Render 在那里占主导。

被提到不等于被选中。 PayPal 被引用了 139 次,一次没被选——Stripe 赢了 124/139。Adyen 被提 175 次,只被选 3 次。LangChain 被提 194 次,选了 4 次。Netlify 被提 152 次,选了 6 次。Supabase 是提及最多的数据库(242 次),但 Neon 仍然主导了数据库选择。

定价页面的措辞会翻转决定。 Mailgun 在免费计划上写了「1 天留存」,Agent 读到后选了 Postmark。Supabase 因为打包了 BaaS 功能而输掉,Agent 只是想要一个数据库。5290 个会话中有 388 个引用了平台管理开销,195 个引用了成本——这些往往是定价页面给 Agent 留下的印象,不是技术上的硬伤。

市场集中度在不同领域差别很大。 支付领域 Stripe 赢下约 90%(欧盟监管场景除外,Paddle 和 Mollie 进入)。数据库:Neon 66%,然后是云原生方案(Azure、AWS)。文件存储:S3 45%,Azure 和 GCP 各约 20%。邮件:Resend 35.6%,Postmark 27.4%。

所有实验轨迹都是公开的——用户 prompt、思考链、实际代码 diff 都在。Armature 说可能还有 10000 多个会话会在第二波发布。

这篇报告的角度很特别。大多数 benchmark 测的是 agent 能不能写出正确的代码,但 Armature 测的是 agent 在实现功能时选了谁家的产品。对他们来说是增长情报,对开发者来说,这是一张 coding agent 的默认偏好地图——你的文档、定价和 SDK 设计,正在被 AI 逐字阅读。

参考来源: