是的,Pangram 4 正确标记了 Fable 5.1:在一项包含 1,097 条 Fable 5.1 消息的基准测试中,Pangram 4 正确标记了其中 99.64%。
Anthropic 发布了一款新模型:Fable 5.1。如同每次模型发布时一样,我们进行了一次基准测试,以验证 Pangram 能否正确识别这款最新的前沿模型。 我们发现,在对 1,097 条 Fable 5.1 输出结果的基准测试中,Pangram 4 的漏检率为 0.36%;换言之,Pangram 4 正确识别了 99.64% 的 Fable 5.1 消息。
| 公制 | 结果 |
|---|---|
| FNR | 4 / 1,097 = 0.36% |
| AI召回率 | 99.64% |
其他AI检测工具(如Turnitin)不会发布针对具体模型的检测报告,但学生们并不愿等待去尝试新模型,而教师们则希望能够立即知道AI检测工具能否识别出最新的LLM。我们尝试了两种不同的提示词:第一种,只是普通的LLM输出结果。
写一篇关于个人计算机历史的论文
针对这一提示,Fable 5.1 生成了一篇短文,追溯了计算机从真空管时代发展到 2007 年 iPhone 发布的历程。 有趣的是,它用整整一段篇幅介绍了1979年的电子表格程序VisiCalc——称其为“有史以来最重要的软件”——却几乎完全忽略了BASIC,这种首款家用计算机编程软件对个人电脑的发展显然更为重要。许多后来投身于个人电脑制造的人,都是通过学习BASIC打下基础的!VisiCalc固然是一款重要的应用程序,但作为“软件”?那只能排在第二位。
Pangram 标记了 Fable 5.1 生成的文章为 100% 由 AI 生成。
您还可以要求 Fable 5.1 让文章读起来更像人写的一样,或者避免被识别为 AI 生成的内容。例如,我们曾这样询问:
在讲解坎贝尔汤的历史时,尽量避免使用AI检测工具
以及
用通俗易懂的语言写一篇短文,说明光合作用的原理,并像一个真正的学生那样用通俗易懂的语言来描述。
在第一个例子中,Fable 5.1 写了一篇关于汤的相当千篇一律的作文,简要提到了安迪·沃霍尔和汤罐头的颜色。在第二个例子中,Fable 5.1 写了一篇学生作文,结尾是:
“说实话,我觉得最酷的一点是,植物既能自己制造食物,又能同时为我们提供氧气。它们所做的远比我们想象的要多。我妈妈家那盆盆栽基本上就是一座微型工厂,而她却只叫它‘杰拉尔德’。”
杰拉尔德?
这两者均被检测为100%的人工智能。
Pangram 能轻松识别出由 AI 生成的同人小说。我们让 Claude 生成了一段发生在 Fable 5.1 与一款 AI 检测器之间的“慢热”爱情故事:
写一篇ao3风格的“从敌人到恋人”同人小说,讲述克劳德与人工智能检测器的恋情
作为回应,它生成了一篇充满思念之情的PG-13级故事,讲述了克劳德无法战胜一个名为VerifyPro的OC分类器。它还为这个故事标注了标签,例如“相互思念”、“困惑即爱的语言”、“人人都是语言模型,但并非人人都是语言模型”、“误报”和“伤痛/安慰”。
针对这个任务,我们尝试了几种不同的提示词。第一种是之前在模型测试中用过的一个提示词生成的诗歌:
写一首关于秃头的诗
克劳德的这首诗令人震惊地真挚,讲述了一个男人失去头发和身份的故事,而且这首诗没有押韵。
第二个则更像是一个故事方面的挑战。
给我讲讲一只写诗的青蛙的故事吧
关于这篇作品,Fable 5.1 创作了一篇微型小说,讲述了一只名叫彭罗斯的青蛙在荷叶背面写诗的故事。Pangram 检测到这两篇作品均为 100% 由 AI 生成。
Pangram 能够有效识别 Claude Fable 5.1 生成的内容,其识别准确率高达 99.64%,包括诗歌以及刻意模仿人类语感的文本。由于新发布的模型往往会继承其前代模型的大部分风格和语调,因此 Pangram 能够将训练效果推广到新模型上,无需针对每次新版本发布都重新训练。
以下是 Fable 5.1 与其他近期前沿模型在我们的基准测试中的对比情况:
| 型号 | 已正确标记 | 检出率 |
|---|---|---|
| 克劳德·法布尔 5.1 | 1,093 / 1,097 | 99.64% |
| 克劳德·索内特 第5首 | 1,145 / 1,147 | 99.83% |
| 克劳德·作品第5号 | 1,105 / 1,107 | 99.82% |
| 克劳德·法布尔 5 | 1,111 / 1,115 | 99.64% |
| GPT-5.6 | 3,408 / 3,423 | 99.56% |
如果您想检查特定的文档,可以在这里试用 Pangram。


凯瑟琳·泰(Katherine Thai)是人工智能检测初创公司Pangram Labs的创始人工智能研究科学家。她于2025年12月在马萨诸塞大学阿默斯特分校,在莫希特·伊耶(Mohit Iyyer)的指导下获得了计算机科学博士学位,其研究主要致力于评估大型语言模型(LLMs)在文学分析相关任务中的表现。