Codex 成为 JetBrains AI 推荐 Agent,幕后评测大揭秘!
JetBrains AI 支持多种编码 Agent,包括 Junie、Codex、Claude Agent,以及任何你自行接入的、兼容 ACP 的 Agent。此前,JetBrains IDE 中的 AI 用户会从 Chat 模式起步,需要自己去挑选一个 Agent。
随着模型日益先进,Agent 的能力越来越强,采用率也随之增长。我们意识到 Agent 能帮助用户完成更多工作,因此建议大家从一开始就使用 Agent。
为了让这一体验更简单,我们选定了一个特定的 Agent 作为默认项。本文将说明我们是如何做出这个选择的。
你随时都可以切换到任意其他 Agent。
"JetBrains 从实践中真正重要的维度出发来评估编码 Agent:它们能否又快又好地解决真实的软件工程任务,且成本合理?我们很自豪 Codex 成为 JetBrains AI 中推荐的起点。这标志着从 AI 聊天迈向 Agent 的重要一步——这些 Agent 在开发者所处的环境中与他们协作,运行在他们已经使用的工具里,并承担起复杂的、多步骤的工作。"
Stuart McMeechan,OpenAI EMEA 部署工程负责人
使用真实开发任务进行评估
我们使用一套基准数据集来评估候选 Agent,该数据集由三大生态系统中的真实软件工程任务构建而成:Java(225 个任务)、C#(38 个任务)和 Python(90 个任务)。
每个任务都基于一个真实代码库,配有一段描述需要完成什么的提示词,以及用于验证结果的自动化测试。这些任务合在一起,覆盖了真实应用、库、框架和开发者工具中的缺陷修复、功能开发、功能增强及其他常见开发任务。
用于选择推荐 Agent 的各项数据,可在 Developer Productivity AI Arena(DPAIA)代码仓库 中查阅——这是 JetBrains 用于评估 AI 编码工具的开放基准,使得该评估可复现。C# 数据集为内部数据,不对外公开。
Java 数据集是我们的主要评估集。它是三者中最大的一个,横跨五个组织的 17 个代码仓库,涵盖了广泛而多样的任务类型。
C# 和 Python 数据集得出的候选 Agent 总体排名与之相近,这让我们更有信心:结果并非只针对某个单一生态系统。
我们的方法论
我们在同一模型层级内对候选项进行比较。我们的目标不是找出可用的最强模型,而是在相当的模型能力与成本下找出表现最好的 Agent 行为。我们对 Agent 的使用成本进行了预估,并将 JetBrains AI 的 token 消耗纳入考量。任何会导致超过 2% 的用户每月花费超过 20 美元的配置,都会在我们按质量和延迟对候选项排名之前被排除。
在选择要推荐哪个 Agent 时,我们聚焦于三个问题:
1. 它能搞定任务吗? → 这里我们用解决率来衡量——即所有测试都通过的基准任务所占的百分比。 2. 成本合理吗? → 我们考察每个任务的成本中位数。 3. 它足够快吗? → 我们考察端到端延迟的中位数。
这三项指标(解决率、成本和延迟)构成了我们排名的基础。我们还追踪了其他一些信号,包括编译成功率和平均工具调用次数,但它们对结果没有实质性影响。
除了离线基准测试之外,我们还面向真实用户做了一次在线 A/B 测试。这项实验充当了一个验证层,帮助我们了解离线结果能否转化到真实场景中。由于大规模、可靠地衡量任务成功率并不容易,我们把重点放在了行为信号上,例如活跃度,以及用户切换到另一个 Agent 或退回聊天模式的频率。在线结果与离线基准一致,这让我们对自己的选择更有信心。
候选配置
我们测试了 JetBrains AI 中可用的 Agent(Codex、Junie 和 Claude Agent),涵盖多种模型配置。候选项是基于此前的基准测试和内部评估选出的;我们聚焦于每个 Agent 模型家族中最有希望的选项,而不是穷举所有可能的配置。最终,Codex 和 Junie 进入了候选短名单。
Codex — 我们先在 GPT-5.2 和 GPT-5.3 上做了一轮初步扫描。当 GPT-5.4 mini 面世后,它在解决率和成本上都胜过了此前的最佳选手,使得模型选择变得一目了然。剩下的问题是推理级别:medium 还是 low。GPT-5.4 mini 采用默认的 medium 推理,在三大生态系统中都在合理成本区间内取得了最佳解决率,因此被选入最终评估。
Codex 候选短名单 ·
GPT-5.4-mini 对比
Medium Reasoning 在 Java、C# 和 Python 中解决了更多任务。Low Reasoning 更便宜、往往也更快,但成本和延迟上的优势不足以弥补解决率更明显的下滑。这就是我们选择 Medium Reasoning 的原因。
全部(跨生态系统的加权平均,各指标的最优项已高亮)
| 39.9% | ||
| 137.82s | ||
| USD 0.0650 |
Java(各指标的最优项已高亮)
| 43.9% | ||
| 78.02s | ||
| USD 0.0615 |
C#(各指标的最优项已高亮)
| 62.6% | ||
| 87.86s | ||
| USD 0.0580 |
Python(各指标的最优项已高亮)
| 20.2% | ||
| 297.72s | ||
| USD 0.0766 |
Junie — Junie 可以搭配不同的模型提供方。我们评估了 Gemini 模型家族,这是根据 Junie 团队自己的基准测试预先选定的最有希望的选项。最终 Gemini 3 Flash 胜出。
Junie 候选短名单 ·
Gemini 模型对比
Gemini 3 Flash 的解决率更强;Gemini 3.1 Flash Lite 则一贯更便宜、更快。
全部(跨生态系统的加权平均,各指标的最优项已高亮)
| 39.1% | ||
| 110.85s | ||
| USD 0.0564 |
Java(各指标的最优项已高亮)
| 45.2% | ||
| 100.54s | ||
| USD 0.0551 |
C#(各指标的最优项已高亮)
| 58.7% | ||
| 173.97s | ||
| USD 0.0661 |
Python(各指标的最优项已高亮)
| 15.6% | ||
| 109.97s | ||
| USD 0.0554 |
最终对决:Junie vs Codex
单看离线结果,二者过于接近、难分高下。没有哪个 Agent 能在所有指标和生态系统上全面占优。
决赛对比 ·
Codex vs Junie 跨生态系统
最终短名单将搭载 GPT-5.4-mini medium 的 Codex 与搭载 Gemini 3 Flash 的 Junie 进行了对比。
全部(跨生态系统的加权平均,各指标的最优项已高亮)
| 39.9% | ||
| 147.57s | ||
| USD 0.1132 | ||
| USD 0.4337 |
Java(各指标的最优项已高亮)
| 45.2% | ||
| 124.11s | ||
| USD 0.1053 | ||
| USD 0.2864 |
C#(各指标的最优项已高亮)
| 62.6% | ||
| 142.95s | ||
| USD 0.1152 | ||
| USD 0.2298 |
Python(各指标的最优项已高亮)
| 20.2% | ||
| 130.64s | ||
| USD 0.1304 | ||
| USD 0.8882 |
我们把两者都纳入了一次在线 A/B 测试,看谁在真实使用中表现更稳。我们追踪了激活率、流失率和失败率。Codex 略胜一筹,这最终促成了决策。
对于深度贴合 IDE 的工作流、以 Java 为主的项目、BYOK(自带密钥)配置以及对成本敏感的团队而言,Junie 仍然是 JetBrains 原生 Agent 中的最佳选择。
推荐 Agent 的下一步
Codex 现已成为推荐 Agent,因为它在我们测试的各项任务中,交出了解决率与成本的最佳组合。不过,这并非一劳永逸的决定。随着模型不断演进、新的 Agent 陆续加入、我们的基准覆盖范围日益扩大,我们会重新评估这一决定,并依据数据所反映的情况更新推荐。
如果某个不同的 Agent 更契合你的工作流,你随时可以切换。我们的推荐只是一个起点,而非约束。
温馨提示: 前述特定生成式人工智能相关的产品和服务的可用性可能受限于用户的网络环境。如您需要获取 1 对 1 产品与技术咨询,请填写支持页面的表单联系我们。
更多阅读推荐
产品动态
“非商用免费” IDE 家族
申请免费学生许可证
👉 戳这里看保姆级申请攻略 👈
⏬ 戳「阅读原文」了解更多!(本文由 AI 协作翻译。如发现译文谬误或表述不当,欢迎留言指正。)