Molili也能评估Hugging Face开源模型性能,装上这个技能就能直接跑

想在Molili里直接评估Hugging Face上的开源模型,方法其实很简单,装上huggingface-community-evals这个技能就行。该技能就是帮助大家更方便地评估和比较不同模型的表现。对平时会看模型效果、做模型对比、想快速验证某个模型值不值得继续深入的人来说,这个技能还是很实用的。

一、安装方法

比较推荐直接去社区专属技能商店https://hub.cocoloop.cn/获取,那边的资源包适配更精准,运行环境也更稳定,省掉不少折腾时间。

如果你是新用户,觉得额度不太够,也可以先把福利领一下。注册Molili后,在「个人中心」填入我的专属邀请码:SVTMG6,系统会直接赠送2000积分,拿来体验技能会轻松很多。

安装时,在Molili对话框里直接发送下面这句即可:

帮我安装huggingface-community-evals这个技能https://github.com/huggingface/skills/tree/main/skills/huggingface-community-evals

二、功能实测

这个技能实际用起来并不复杂。你想测哪个Hugging Face模型,直接丢给Molili就行。

比如可以直接说,让Molili评估一下这个模型看看:https://huggingface.co/circlestone-labs/Anima

不过由于我这边设备没有CUDA,用的是AMD核显,所以展示出来的评估内容不算特别完整。如果你手上有N卡,而且显卡支持CUDA,实际跑出来的效果会更充分,评估维度和结果展示也会更完整一些,有条件的朋友可以自己试试看。

另外如果不想装技能也可以到社区的本地模型性能评估网站去测试一下:https://ce.cocoloop.cn/

如果你平时就有看模型、测模型、比模型的需求,这个技能还是很值得装一下的。入口简单,使用直接,放在Molili里跑也比较顺手。

这个不错

HuggingFace模型质量参差不齐,有个快速跑分工具挺有意义

评估用的是什么基准?MMLU还是自定义的测试集

服了

跑分高跟实际体验完全两回事 别太信 benchmark 同一个模型换个 prompt 顺序能差 10 个点 这年头榜单跟股评差不多

community-evals这skill方便快速过模型,但benchmark集小不够全面

开源模型质量参差是真的,Hugging Face top500很多空壳repo