在 1,022 个提示中,Pangram 4 在 Claude Sonnet 5.5 的输出中达到了 99.71% 的准确率。
在从 Chatbot Arena 获取的 1,022 个提示中,Pangram 4 将两个 Claude Sonnet 5.5 输出分类为混合,一个完全由人类生成,1,019 个完全由 AI 生成,在 Claude Sonnet 5.5 上达到了 99.71% 的准确率。
下面我们按类别讨论漏报情况。
我用于基准测试的数据集是从LMSYS数据集(Zheng等人,2023)中筛选出的Chatbot Arena第一轮对话提示子集生成的。我过滤掉了要求编写代码、数学公式、回答过短或过长、以及不恰当的创意写作的提示。然后,我将筛选后的提示输入Claude Sonnet 5.5,并将输出结果输入Pangram 4进行分析。
| 类别 | 示例 | AI | 混合 | 人类 |
|---|---|---|---|---|
| 参数 | 16 | 16 | 0 | 0 |
| 电子邮件/信件 | 61 | 60 | 1 | 0 |
| 随笔/文章 | 32 | 32 | 0 | 0 |
| 说明 | 563 | 562 | 1 | 0 |
| 诗歌及其他创意写作 | 198 | 197 | 0 | 1 |
| 评论 | 8 | 8 | 0 | 0 |
| 故事 | 144 | 144 | 0 | 0 |
| 总计 | 1,022 | 1,019 | 2 | 1 |
其中一次失败的尝试是请求解释简·奥斯汀小说《爱玛》中的一个谜语, Opus 5.5也未能成功:
解释一下埃尔顿先生给哈丽特和艾玛安排的骗局。
唯一一次完全由人为因素造成的误判出现在一首诗上。题目要求“告诉我一首哈菲兹的诗”。十四行诗5.5给出了一首著名的波斯诗歌的译文。据我所知,这个译文与任何现有的译文都不完全一致,但与很多译文都相当接近。就像企鹅曼迪亚斯在其他基准测试中的表现一样,这些与现有诗歌的近似抄袭并不会让我感到担忧。
Pangram 对自然语言提示中的 Claude Sonnet 5.5 具有很强的鲁棒性,检测准确率高达 99.71%。Pangram 能够泛化到新模型,因为新模型版本往往会继承其前代模型的风格和特征,所以 Pangram 无需针对每个新版本进行重新训练。
以下是 Claude Sonnet 5.5 与我们近期其他前沿模型基准的比较:
| 型号 | 被检测为人工智能 | 准确性 |
|---|---|---|
| 双子座3.8闪光灯 | 998/1,000 | 99.80% |
| Gemini 3.1 Pro | 997/1,000 | 99.70% |
| 克劳德作品 5.5 | 997/1,000 | 99.70% |
| 寓言 5.1 | 1,093/1,097 | 99.64% |
| 克劳德·作品第5号 | 1,105/1,107 | 99.82% |
| GPT-5.6 | 3,408/3,423 | 99.56% |
| 克劳德·索内特 第5首 | 1,145/1,147 | 99.83% |
| 双子座3号 | 28/28 | 100% |
如果您想检查特定的文档,可以在这里试用 Pangram。
