224 points · 133 comments · 9小时前
AI编程评测的标准答案,如今成了行业笑话。OpenAI亲自发文承认:你们都在用的SWE-bench Verified,已经不能反映真实能力了——测试集本身有缺陷,而且所有前沿模型都在训练时见过这些题目。
事件回顾
4月26日,OpenAI在官方博客发布重磅技术分析:《为什么SWE-bench Verified不再能衡量前沿编码能力》。这篇本该是"自吹自擂"的技术文章,却成了行业基准崩塌的自我举报。
SWE-bench Verified是什么
SWE-bench是2023年发布的AI编程评测基准,从12个主流开源Python仓库(如Django、pytest等)提取GitHub Issue和对应Pull Request,要求AI模型根据Issue生成代码修复——只有测试全部通过才算成功。由于从真实开源项目提取,SWE-bench迅速成为行业公认的"编程能力托福"。2024年,OpenAI又做了"净化版"——从1699个问题中筛选出500个经三重验证的"干净"题目,称为SWE-bench Verified,被各厂商默认为对标基准。
核心发现一:59.4%的受审问题测试用例有缺陷
OpenAI团队审计了模型频繁失手的138个问题,每个问题由至少6名资深工程师独立审查。结果触目惊心:至少59.4%的测试用例拒绝功能正确的代码提交——模型做对了,但测试说你错了。就像考试时标准答案印错了,老师却扣了学生的分。
核心发现二:所有前沿模型都"见过"这些题目
比测试bug更致命的是数据污染。SWE-bench问题来自12个主流开源仓库,这些代码正是各模型厂商训练数据的主要来源。OpenAI发现,所有受测前沿模型都能复现原始bug修复(gold patch),甚至复现完整问题陈述——说明它们在训练时已看过答案。
这就像考前老师把试题和答案都发给了学生,然后学生考了高分来证明自己学习好。
行业反应:224 points + 133 comments,HN炸锅
这篇文章在Hacker News上获得224 points、133条评论,热度远超同时间段大多数帖子。"如果连SWE-bench都被污染了,我们还能相信什么?""这说明前沿模型的进步可能只是过拟合,而非真正的能力涌现。"
为什么重要
对AI创业者的直接影响:你们选工具的标准可能全是错的
那些"XX模型编程能力全球第一"的宣传素材,那些基于SWE-bench排名做的工具对比视频,那些教你"根据评测分数选Copilot还是Claude"的攻略——都可能建立在一个有缺陷的基准上。
一个真实案例:某创业团队2025年底基于SWE-bench分数选了某模型用于代码审查,半年后发现该模型在其Python 3.12 + FastAPI项目上错误率高达30%——远高于评测表现。问题不在于模型"变笨了",而在于评测集和实际项目的数据分布完全不同。
揭示了AI评测的系统性问题
SWE-bench Verified被认为是"净化过"的版本,OpenAI在2024年专门找了专家审查1699个问题。结果呢?验证集依然有大量缺陷。这说明:
- 评测集的净化速度,赶不上模型训练数据收集的速度——当你觉得某个评测集"干净"时,可能已经有团队在用它做训练了
- 只要是开源数据,就不可能真正"干净"——模型厂商永远可以声称"我们没见过",但训练数据里有就是有
- 行业需要全新的、真正干净的编程能力评测标准——但创业者不能等
我们能学到什么
1. 不要迷信任何单一评测分数
真正有价值的评估来自实际业务场景的POC,而非榜单排名。
2. 开源数据训练的"诅咒"
任何基于开源代码训练的模型,都会面临数据污染。对于需要高可靠性的垂直场景(金融、医疗、工业控制),通用编程模型可能并不适用。
3. AI编程工具选型的正确姿势
- 第一步:梳理团队最高频的编程任务类型
- 第二步:用实际代码库做盲测,记录各工具的真实表现
- 第三步:关注"边际改进"——当工具从60分提到70分时,你的工作流有多少改变?
- 第四步:建立你自己的"体感评测集"——把团队最常遇到的10个编程任务做成内部测试,每次换工具时重新测
4. 关注厂商的透明度,而非只是能力分数
OpenAI敢发这篇文章承认问题,说明行业正在从"只报喜不报忧"向更透明的方向演进。这次,OpenAI主动揭短,反而赢得了一定的信任。
常见问题
Q:现在选AI编程工具应该看什么标准?
A:看三个东西:①工具在你实际业务代码上的错误率(自己测,不是看广告);②工具对你代码库的理解深度;③工具的响应速度和定价是否匹配你的使用量。
Q:SWE-bench分数完全没用了吗?
A:不是完全没用,但它只能告诉你"模型在这个特定数据集上的表现",而非"模型在你实际工作中的表现"。分数低肯定不行,分数高不等于在你项目上表现好。
Q:OpenAI为什么主动揭短?
A:两种可能——他们在推动更透明的评测文化(正向);或者污染问题太严重,继续作为标准会反噬自身公信力(务实)。无论哪种,对行业长期都是好事。
行动建议
今天就可以做的一件事:
回顾你或团队目前使用的AI编程工具(Cursor、Windsurf、GitHub Copilot、Claude Code等),不要看宣传页或评测排名,而是评估:
- 这个工具在我最常写的代码类型上表现如何?(不是官方Demo,是你自己的代码)
- 它犯过的最离谱的错误是什么?我能接受吗?
- 它的失误频率和修正成本,与节省的时间相比,净收益是多少?
这个"体感评估"比任何benchmark都更真实。