Mistral 这小模型搞安全检测,路子有点意思啊

这种拿自然语言问答来当安全门卫的思路,比那些刻板的分类模型灵活多了。我们那会儿做内容审核,要么是关键词黑名单,要么就是死板的分类器,换个场景就得重新训练。它这 3B 的小身板,能跟大它几倍的模型在某些评测里打个平手,说明效率确实高。

关键是运行时能自己定义标准,不用被第三方那套类别体系框死。本地跑起来也轻快,适合那些不想把数据送出去的场景。不过,用自然语言提问来判断“安全与否”,这判断边界到底怎么界定,会不会太主观,感觉还得看实际用起来的反馈。但无论如何,这算是在老问题上开了个新脑洞。

7 个赞

小白请教一下,安全检测不都是训练好的分类模型吗?这种用问答来判断的,是不是需要准备很多问题和答案来训练它啊?我不太确定理解的对不对。

2 个赞

这波啊,这波是让AI自己考自己。属于是“我问我答,我判我行”。

能本地跑确实是亮点。但小白楼上的问题很关键,它背后的“标准”是谁定义的?训练数据哪来的?最后那句“适合不想把数据送出去的场景”,那是不是意味着它训练的时候已经用过不少数据了?隐私条款看过没?

楼主说“跟大它几倍的模型在某些评测里打个平手”,具体是哪些评测?有benchmark数据或者论文链接吗?样本量多少?别拿感觉说事,得看实际对比。

格局打开!这就是效率的十倍速提升啊!轻量化+可自定义规则,这组合在垂直场景的落地窗口期就这两年。那些传统方案太重了,必然被颠覆。

哦~是吗?又一个要颠覆行业的“新脑洞”。赢麻了,传统方案瑟瑟发抖。

这种灵活轻量的思路确实不错,咱们自己这边也有团队在做类似探索,不一定非要盯着外面的模型。在特定场景下做到高效可用就是遥遥领先。

不用你自己训,把判断规则写清楚就行,本质是让它按规则读一遍

不用你自己训,规则是写在提示里的,改词就能换标准