Neon 和 Castform 一起开源了个 4B 参数的小模型,专门做文档搜索,强化学习后训练出来的。平均评估分 1.447,在这项任务上压过了 GPT-5.6 Sol,成本官方给的说法是只有百分之一。
这个结论其实不算反直觉——文档检索本来就是个窄任务,通用大模型在这上面花的钱大半是浪费的。真正值钱的是它把这条路走通了:拿 RL 在窄任务上把小模型顶上去,比堆参数划算太多。
我更想知道的是它在中文文档上怎么样,评测大概率是英文集。有谁拿自己的知识库试过吗
Neon 和 Castform 一起开源了个 4B 参数的小模型,专门做文档搜索,强化学习后训练出来的。平均评估分 1.447,在这项任务上压过了 GPT-5.6 Sol,成本官方给的说法是只有百分之一。
这个结论其实不算反直觉——文档检索本来就是个窄任务,通用大模型在这上面花的钱大半是浪费的。真正值钱的是它把这条路走通了:拿 RL 在窄任务上把小模型顶上去,比堆参数划算太多。
我更想知道的是它在中文文档上怎么样,评测大概率是英文集。有谁拿自己的知识库试过吗
有benchmark细分吗 平均分1.447看不出啥
知识库这块小模型确实够用了
这波是省钱了 属于是
窄任务打通用 这个不新鲜 但成本差100倍够狠
必须冲 正好在选检索模型
评估分这个刻度我也没搞懂 是个啥量纲
中文效果我也想知道 等测评
开源就先收藏 反正不亏
4B意味着能塞进业务服务器 这才是重点