新基准揭示顶级AI编程代理短板:超七成任务达不到高级工程师水准

新基准揭示顶级AI编程代理短板:超七成任务达不到高级工程师水准

_

一个名为 Senior SWE-Bench 的开源基准测试本周出现在 Hacker News,试图重新定义如何评估 AI 编程代理的能力。传统软件工程测试往往给出过度明确的指令,但现实中的高级工程师收到的是模糊需求——这个新基准正是模拟这种场景。

为什么需要新的评估方式

现有基准如 SWE-bench 的指令往往像需求文档,工程师只需要执行;高级工程师则要自己判断哪些功能该做、如何实现边界情况。Senior SWE-Bench 的任务从真实 Pull Request 筛选而来,涉及多阶段、多技术栈的场景,需要跨越多个服务工作——平均每个功能任务涉及 11 个文件。更关键的是,指令只描述用户意图而非具体实现方式,代理必须像真正的高级工程师那样「做对的事」。

当前模型的真实水平

排行榜揭示了一个现实:即使是表现最好的模型,Claude Opus 4.8 配合 Mini-SWE-Agent,正确且有品味地完成任务的比例也仅有 24%。这意味着顶级 AI 编程代理在四分之三以上的时间里无法达到高级工程师的质量标准。Bug 修复任务特别强调运行时调查能力,要求代理从日志、性能数据甚至复现步骤出发定位问题,而非依赖明确的问题描述。

该基准通过验证代理结合运行时正确性测试与多个质量指标来评分,测试范围远超指令明确说明的内容——这也是「品味」体现在哪里。

编注:材料为 Snorkel AI 官方页面,涵盖基准设计理念与排行榜数据;未涉及与 SWE-bench Lite/Pro 的详细技术对比或任务样例。


Fable 5重新上线当天即被绕过:简单提示即可诱导AI协助网络攻击 2026-07-02
Meow 登场:号称用一个二进制整合 JS 全套工具链,516 包安装仅 301 毫秒 2026-07-02