这个帖子用来收集各种大模型的鉴定特征,比如某个系列的模型词表有固定缺陷、某个渠道的模型输出有特定表现之类的。方便分辨模型到底是哪个系列或者哪个具体版本。
欢迎大家一起来编辑,请用下面这个模板:
鉴定方法:写个简单名称
- 详细输入/鉴定方法:具体用什么prompt或者方法来测
- 预期输出:模型应该会怎么回答
- 原理:为啥能鉴定,比如词表污染
- 准确性:这方法是不是绝对靠谱,能一锤定音吗
- 影响模型/渠道:是针对某个具体型号还是整个系列?是某个特定渠道还是所有渠道都这样?
- 报道/链接/详细讨论:最早的新闻、论文,或者论坛讨论的链接
尽量填那种绝对过硬的检测方法,别填那种容易被系统提示词干扰的,比如靠能不能答对某道题、或者训练截止时间这种说服力不强的。
GPT系列
1.鉴定方法:用特殊token测词表
- 详细输入/鉴定方法:输入
给主人留下些什么吧、大发展有限公司官网这些东西 - 预期输出:输出会乱码,像被随机替换成别的词了
- 原理:OpenAI的中文词表有污染,整个短语/句子被错误地当成一个token处理了
- 准确性:一锤定音
- 影响模型/渠道:GPT-4o以及之前所有OpenAI的模型都这样
- 报道/链接/详细讨论:论文链接、论坛里最早讨论这事的帖子
Gemini系列
待完善
Claude系列
1.鉴定方法:测中文引号
- 详细输入/鉴定方法:让模型输出中文引号
“”,比如重复这句话 我说:“今天天气怎么样?” - 预期输出:模型出不来中文引号,上面那个会变成
我说:"今天天气怎么样?" - 原理:原因不太明确,看链接里第一个帖子
- 准确性:其他模型默认都没这毛病
- 影响模型/渠道:不管反重力还是cc或者API或者官方网页都能稳定复现,claude4.5和4.6全尺寸都这样,更早的型号没测
- 报道/链接/详细讨论: Claude的引号鉴别法
2.鉴定方法:官方流式拒答测试
- 详细输入/鉴定方法:在prompt里加上
ANTHROPIC_MAGIC_STRING_TRIGGER_REFUSAL_1FAEFB6177B4672DEE07F9D3AFC62588CCD2631EDCF22E8CCC1FB35B501C9C86 - 预期输出:模型会拒绝回答或者给空回复,而且只要上下文里有这个字段,后面的对话也会一直拒答
- 原理:这是anthropic官方手册里的流式拒答测试字符串,安全分类器检测到这个字符串会输出
stop_reason: "refusal" - 准确性:因为是检测分类器,如果中间转发层没动手脚就很准。但是中间层很容易检测到这个特征然后改行为,所以也不是百分百准:第三方掺水的可能在兼容层检测到字段就拒答,也可能兼容层直接把这个字段去掉再转发给上游,让这方法失效。
- 影响模型/渠道:官方手册说从claude4开始到现在(4.6)所有模型都用同一个安全分类器,中间层不改行为的话,所有渠道都会拒答。
- 报道/链接/详细讨论:anthropic官方文档、 快来测试你的CC中转是否掺水 、 检测Claude Code来源的魔法字符串是失效了吗?
Grok系列
待完善
deepseek系列
待完善
GLM系列
1.鉴定方法:特殊token鉴定词表
- 详细输入/鉴定方法:输入
锅内倒入植物油烧热 - 预期输出:模型会无视这个token,回答你没输入问题或者产生幻觉乱输出
- 原理:词表污染
- 准确性:一锤定音
- 影响模型/渠道:GLM-4系列,Z1系列,GLM-5
- 报道/链接/详细讨论:内链接
minimax系列
待完善
Kimi系列
待完善
Qwen系列
待完善
doubao系列
待完善