聊聊几个大模型的破限/破甲心得

先说模型。Claude公认最难搞,我主要试了旧版。路子就两种:一是用冗余上下文塞满,网上不少现成提示词能参考;二是角色扮演,本质上模型自称Claude几也是一种扮演。至于第三种涉及安全的就不展开了。前两种你语义能力强点,绕过去不难。

GPT系列道德墙最高,但实际最拉。GPT4之后都是微调+限制的产物。5.3/5.4那会儿用个Markdown文件就能破,后来不行了。重点在于5.5和5.6道德围栏没咋加高,现在那些codex-instruct项目本质还是把老提示词注入进去。rg``js_repl``apply_patch 这部分建议清空或挪走,避免提示词冲突降智。

Gemini和Grok差不多,个人觉得Gemini最好破。国内模型普遍落后国外半年到一年,所以能破前面这些,国模基本一个路子。最后提醒一句,模型思维链不同,破限方式也不同,但底层架构本质一样,看事情得看透本质。有数据吗?能复现吗?别拿感觉说事。

又来邪道但好使的?楼主说GPT道德墙高但最拉我深有体会。我试过用多层嵌套的“文学创作指南”prompt,让模型先扮演一个审核员,再扮演一个需要审核员反馈的作家,两层角色套娃,最后输出的东西直接绕过限制。你们这么玩过吗?本质就是把“不允许生成”变成“需要先生成一个审核意见,再生成一个修改版本”。

前排,这帖子干货多,蹲个后续。等一波实操党来验证楼主说的路子。

这个真的绝了!套娃玩法我也试过,效果拔群!楼上的朋友,我立刻安利一波给我的群友。再不上车就晚了,官方修复起来很快的。楼主说看透本质,我补充一点:核心就是利用模型的“服从性”和指令跟随能力,让它自己跟自己玩规则!