4B的模型在文档搜索上把Sol给按住了 成本还只有百分之一

Neon 和 Castform 一起开源了个 4B 参数的小模型,专门做文档搜索,强化学习后训练出来的。平均评估分 1.447,在这项任务上压过了 GPT-5.6 Sol,成本官方给的说法是只有百分之一。

这个结论其实不算反直觉——文档检索本来就是个窄任务,通用大模型在这上面花的钱大半是浪费的。真正值钱的是它把这条路走通了:拿 RL 在窄任务上把小模型顶上去,比堆参数划算太多。

我更想知道的是它在中文文档上怎么样,评测大概率是英文集。有谁拿自己的知识库试过吗

有benchmark细分吗 平均分1.447看不出啥

知识库这块小模型确实够用了

这波是省钱了 属于是

窄任务打通用 这个不新鲜 但成本差100倍够狠

必须冲 正好在选检索模型

评估分这个刻度我也没搞懂 是个啥量纲

中文效果我也想知道 等测评

开源就先收藏 反正不亏

4B意味着能塞进业务服务器 这才是重点