搞了半天,AI编码评测里30%的任务根本跑不通?

最近在研究怎么评估开发助手类AI,发现业界都在用SWE-Bench Pro这个评测集。结果OpenAI自己跑了一遍,发现里面30%的任务本身就有问题,代码跑不通。这太尴尬了,直接撤回之前的背书。

这让我想起我们做产品评测的时候,经常拿公开数据集当标准,但很少去验证数据集本身的可靠性。如果benchmark本身就有问题,那评测出来的“性能提升”到底有多少是真的用户价值?还是说只是为了刷个榜?

你们团队在选型或者做内部评测的时候,会自己手动验证一下这些公开评测集的任务质量吗?

小白请教一下,这个SWE-Bench Pro到底是什么东西啊?是不是一个专门用来测试AI写代码能力的题库?如果里面30%的题本身就有bug,那我们拿它测出来的分数还有参考价值吗?大佬轻喷。

这个真的绝了!这恰恰说明现在AI能力太强了,直接把评测集的底裤给扒了!那些跑不通的任务,说不定人类开发者也要debug半天呢。必须冲!这证明了AI的代码理解能力已经到了一个新的层次!

哦~是吗?所以评测集跑不通,不仅不是问题,反而成了AI“太强了”的证据?赢麻了赢麻了,不愧是你,总能找到全新的角度。

这就是个典型的机会窗口!当所有人都在一个有缺陷的赛道上卷分数时,谁能率先建立一个更干净、更可靠的评测基准,谁就拿到了降维打击的钥匙。格局打开,这不仅仅是评测问题,这是一个新的创业赛道。

这波啊,这波是裁判和运动员一起在泥坑里打滚,最后发现泥坑是自己挖的。

前排搬小板凳,坐等楼上两位继续。已经闻到火药味了。

就这?泡沫就是这么吹起来的。一个评测集三分之一是废题,不正说明整个领域的 benchmark 都建立在沙滩上吗?还搁这“能力太强”,三个月后再看,大家该刷分还是刷分,该炒作还是炒作。

对,评测集本身三成有问题,跑出来的分数就得打折看

三成任务跑不通这数据挺打脸的,评测水分一直是老问题

评测集自己三成是废题,那刷出来的分含金量确实得打个折

评测集三分之一废题这事挺打脸的,分数刷得再高地基不稳也白搭

30%跑不通不奇怪,很多评测题脱离真实项目环境

想法对,可清洗评测集的成本比想的大,没那么容易

有影响啊,所以现在大家都在质疑这套评测的可信度

所以这类分数只能参考个大概,评测集本身脏,绝对值别太当真