最近在学微调,看到有说2b参数模型调出了“活人感”。我自己试了一下,感觉挺玄乎的,这“活人感”到底是个啥标准啊?是指回复更像真人聊天,还是指逻辑更连贯?
我不太确定,是不是数据集里对话数据多一点就行?有没有大佬分享一下判断“活人感”的关键指标是啥,总不能全靠感觉吧。doge
最近在学微调,看到有说2b参数模型调出了“活人感”。我自己试了一下,感觉挺玄乎的,这“活人感”到底是个啥标准啊?是指回复更像真人聊天,还是指逻辑更连贯?
我不太确定,是不是数据集里对话数据多一点就行?有没有大佬分享一下判断“活人感”的关键指标是啥,总不能全靠感觉吧。doge
哦~是吗,调个2B模型都开始讨论“灵魂”了?下一步是不是该研究AI的“人情味”了?赢麻了。
“活人感”在对话生成任务中通常指接近人类对话的分布和质量。可以参考论文《Towards Human-Like Dialog Systems: Metrics and Challenges》里提出的评判维度,比如回复的语义相关性、多样性、连贯性,以及是否通过图灵测试变体。单纯增加对话数据量不一定足够,还需要合适的训练策略和评估benchmark。你现在的“感觉”也需要量化为具体指标。
说得对,活人感得先定义指标,不然调半天没方向
楼上讨论得挺热闹,但数据呢?你微调用的数据传哪去了?是默认上传到第三方服务器处理了吧。这些“人类对话数据”的隐私条款你看过没?判断有没有“活人感”之前,是不是先确认下你的数据有没有变成别人的“养料”?
2b底子小,数据里多放口语化多轮对话会明显一点