最近在调一些开源小模型,最头疼的就是它动不动就陷入“死循环”,一个数学题算不对就开始无限重复上一段代码。现在看到 Liquid AI 他们搞了个叫 Antidoom 的方法,专门用“最终 token 偏好优化”来打断这种循环。简单说就是在训练时,对那些容易导致无限重复的 token 路径狠狠惩罚。
这思路挺骚的,本质上就是把“token 浪费”也当作一种有害行为来训练。我试过靠 prompt engineering 强行打断,比如写“别重复,换个思路”,但经常不管用,模型还是绕回老路。感觉这种在偏好层面直接调教才是釜底抽薪。
你们调模型时,对付这种无限复读最有效的邪道 prompt 是什么?