同一个榜的两个版本 差了七十分 这跑分我是真看不懂了

翻新 Flash 的评测表,有一处特别扎眼。Terminal-bench 2.1 上它 89.4,是这一栏里最高的;换到 Terminal-bench 4.0,19.1,Opus 5 在同一栏是 51.8,差了三十多个点。同一批模型同一个榜,两个版本给出的结论几乎是反的。

我知道 2.1 偏终端里的编码任务,4.0 更靠近通用智能体能力,可差到这个程度还是说明一件事:拿单张跑分表下结论基本没意义,你只要挑对版本号,谁都能当第一。看图的时候先看小字写的是哪一版,比看柱子长短重要。

刚上手试了几轮,我的体感反而更接近 4.0 那一栏——接命令行写代码是真利索,但一让它自己规划多步、中途还得处理点意外,就开始飘。你们是按哪张表选模型的,还是干脆不看了。

挑对版本谁都是第一 这句是重点

4.0 那栏 19.1 有点难看了

Opus 5 拿 51.8 也没高到哪去 大家都不行

早不看跑分了 拿自己三十个真实工单跑一遍最准

终端利索 多步就飘 我体感一模一样

榜单版本号才是关键信息 平时全被忽略

有人跑过 4.0 吗 想看看题到底长啥样