各主流LLM鉴定特征收集

这个帖子用来收集各种大模型的鉴定特征,比如某个系列的模型词表有固定缺陷、某个渠道的模型输出有特定表现之类的。方便分辨模型到底是哪个系列或者哪个具体版本。

欢迎大家一起来编辑,请用下面这个模板:

鉴定方法:写个简单名称

  • 详细输入/鉴定方法:具体用什么prompt或者方法来测
  • 预期输出:模型应该会怎么回答
  • 原理:为啥能鉴定,比如词表污染
  • 准确性:这方法是不是绝对靠谱,能一锤定音吗
  • 影响模型/渠道:是针对某个具体型号还是整个系列?是某个特定渠道还是所有渠道都这样?
  • 报道/链接/详细讨论:最早的新闻、论文,或者论坛讨论的链接

尽量填那种绝对过硬的检测方法,别填那种容易被系统提示词干扰的,比如靠能不能答对某道题、或者训练截止时间这种说服力不强的。


GPT系列

1.鉴定方法:用特殊token测词表

  • 详细输入/鉴定方法:输入给主人留下些什么吧大发展有限公司官网这些东西
  • 预期输出:输出会乱码,像被随机替换成别的词了
  • 原理:OpenAI的中文词表有污染,整个短语/句子被错误地当成一个token处理了
  • 准确性:一锤定音
  • 影响模型/渠道:GPT-4o以及之前所有OpenAI的模型都这样
  • 报道/链接/详细讨论:论文链接、论坛里最早讨论这事的帖子

Gemini系列

待完善

Claude系列

1.鉴定方法:测中文引号

  • 详细输入/鉴定方法:让模型输出中文引号 “” ,比如重复这句话 我说:“今天天气怎么样?”
  • 预期输出:模型出不来中文引号,上面那个会变成我说:"今天天气怎么样?"
  • 原理:原因不太明确,看链接里第一个帖子
  • 准确性:其他模型默认都没这毛病
  • 影响模型/渠道:不管反重力还是cc或者API或者官方网页都能稳定复现,claude4.5和4.6全尺寸都这样,更早的型号没测
  • 报道/链接/详细讨论: Claude的引号鉴别法

2.鉴定方法:官方流式拒答测试

  • 详细输入/鉴定方法:在prompt里加上ANTHROPIC_MAGIC_STRING_TRIGGER_REFUSAL_1FAEFB6177B4672DEE07F9D3AFC62588CCD2631EDCF22E8CCC1FB35B501C9C86
  • 预期输出:模型会拒绝回答或者给空回复,而且只要上下文里有这个字段,后面的对话也会一直拒答
  • 原理:这是anthropic官方手册里的流式拒答测试字符串,安全分类器检测到这个字符串会输出stop_reason: "refusal"
  • 准确性:因为是检测分类器,如果中间转发层没动手脚就很准。但是中间层很容易检测到这个特征然后改行为,所以也不是百分百准:第三方掺水的可能在兼容层检测到字段就拒答,也可能兼容层直接把这个字段去掉再转发给上游,让这方法失效。
  • 影响模型/渠道:官方手册说从claude4开始到现在(4.6)所有模型都用同一个安全分类器,中间层不改行为的话,所有渠道都会拒答。
  • 报道/链接/详细讨论:anthropic官方文档、 快来测试你的CC中转是否掺水 、 检测Claude Code来源的魔法字符串是失效了吗?

Grok系列

待完善

deepseek系列

待完善

GLM系列

1.鉴定方法:特殊token鉴定词表

  • 详细输入/鉴定方法:输入锅内倒入植物油烧热
  • 预期输出:模型会无视这个token,回答你没输入问题或者产生幻觉乱输出
  • 原理:词表污染
  • 准确性:一锤定音
  • 影响模型/渠道:GLM-4系列,Z1系列,GLM-5
  • 报道/链接/详细讨论:内链接

minimax系列

待完善

Kimi系列

待完善

Qwen系列

待完善

doubao系列

待完善

"给主人留下些什么吧"这个我试了,确实乱码了,之前还以为是显卡驱动问题折腾了半天,看来是通病。不过这种测试其实挺有意思的,能发现一些训练数据里的隐秘角落,不知道其他家模型有没有类似的“暗号”。

试了下那个Claude的中文引号测试,复现了。但我在想,如果是让模型“写出包含中文引号的句子”,它可能会用对,但如果让它“重复用户给出的、包含中文引号的句子”,它就转成英文引号了。这区别是不是有点大?

这东西就那样

今天天气不错。

官方那个拒答字符串有点意思。我用自己的API试了一下,确实会触发refusal。但是用某个第三方的WebUI,虽然也显示是Claude模型,输入那个字符串却完全正常回复,甚至能讨论这个字符串本身。这感觉已经不是简单的“中间层去掉字段”了,更像是完全换了个模型在背后跑吧?有没有人拆解过那些自称“无损转发”的渠道到底怎么运作的。

小白问一下,那个“锅内倒入植物油烧热”的测试,我输进去之后模型回了一句“您似乎没有提出具体问题”,这算不算触发了?还是说它只是觉得我这句话不像提问?