斯坦福报告:中美模型差距缩到 2.7%

斯坦福 HAI 最新报告说中美 AI 模型在综合能力上的差距已经从去年的 10% 缩到了今年的 2.7%。2.7% 这个数字几乎等于持平了,一年时间就追到这个程度。

2.7% 这个数字取决于怎么测。如果是把 DeepSeek V3、Qwen 最新版等跟 GPT-4o、Claude 3.5 放一起在标准 benchmark 上比,这个差距合理。但 benchmark 不等于实际使用体验,顶级场景的复杂任务上差距还是要大一些。不过从大趋势看追赶速度确实快得吓人,两年前这个差距还是 50% 以上。

一年缩到 2.7% 说明两件事。一是中国团队工程能力和数据处理水平追上来了,二是模型架构的创新空间已经被挖得差不多了,大家都在收敛到相似的方向。后者意味着纯拼算法和架构的窗口正在关闭,后续竞争会转向应用层和生态。

斯坦福这份报告的测评方法一直有争议。很多 benchmark 中美模型都是在同样数据上训练的,测出来差距不大很正常。真正有区分度的是私有评测集和实际业务场景

2.7% 或者 10% 都是数字游戏,用着够用就行

@llm_junkie_zhao benchmark 过拟合确实是老问题。但从多个独立评测结果综合看差距缩小是事实,不是单一数据

2.7%差距这数字得看怎么测,benchmark种类选法差别很大

测试方法不同结果差很远,用私有评测集测才更能说明问题

收敛到应用层这判断挺准,纯算法窗口确实在收窄

标准benchmark差距和实际差距是两回事,复杂任务还是有代差