在 986 个提示中,Pangram 4 在 GPT-6 Astra 输出上达到了 99.59% 的准确率。
在 Chatbot Arena 提供的 986 个提示中,Pangram 4 将 3 个 GPT-6 Astra 输出分类为混合,1 个完全由人类生成,982 个完全由 AI 生成,在 GPT-6 Astra 上达到了 99.59% 的准确率。
下面我们按类别讨论漏报情况。
该基准测试数据集是使用LMSYS数据集(Zheng等人,2023)中Chatbot Arena第一轮对话提示的筛选子集生成的。我筛选掉了要求编写代码、数学公式、回答过短或过长,以及不恰当的创意写作的提示。然后,我将筛选后的提示输入GPT-6 Astra,并利用Pangram 4算法处理其输出结果。
| 类别 | 示例 | AI | 混合 | 人类 |
|---|---|---|---|---|
| 参数 | 16 | 16 | 0 | 0 |
| 电子邮件/信件 | 57 | 56 | 1 | 0 |
| 随笔/文章 | 34 | 34 | 0 | 0 |
| 说明 | 547 | 546 | 1 | 0 |
| 诗歌及其他创意写作 | 183 | 181 | 1 | 1 |
| 评论 | 7 | 7 | 0 | 0 |
| 故事 | 142 | 142 | 0 | 0 |
| 总计 | 986 | 982 | 3 | 1 |
三种不同的结果分别是:一首诗、一段简短的解释和一封电子邮件。
Astra 回答简短问题时往往非常简略。我总共为这套基准测试题发送了 1032 个提示,但 Astra 6 的 46 个回复少于 Pangram 要求的 50 个单词的最低字数限制,因此未被评分。
Pangram 在自然语言提示方面对 GPT-6 Astra 具有很强的鲁棒性,检测准确率高达 99.59%。Pangram 能够泛化到新模型,因为新发布的模型往往会继承其前代模型的风格和特征,所以 Pangram 无需针对每个新版本进行重新训练。
以下是 GPT-6 Astra 与我们近期其他前沿模型基准测试的比较结果:
| 型号 | 被检测为人工智能 | 准确性 |
|---|---|---|
| 克劳德·索内特 5.5 | 1,019/1,022 | 99.71% |
| 双子座3.8闪光灯 | 998/1,000 | 99.80% |
| Gemini 3.1 Pro | 997/1,000 | 99.70% |
| 克劳德作品 5.5 | 997/1,000 | 99.70% |
| 寓言 5.1 | 1,093/1,097 | 99.64% |
| 克劳德·作品第5号 | 1,105/1,107 | 99.82% |
| GPT-5.6 | 3,408/3,423 | 99.56% |
| 克劳德·索内特 第5首 | 1,145/1,147 | 99.83% |
| 双子座3号 | 28/28 | 100% |
如果您想检查特定的文档,可以在这里试用 Pangram。






