案例研究

Pangram 可以检测 GPT-6 Astra 吗?

2026年9月4日

以下是简要总结


在 986 个提示中,Pangram 4 在 GPT-6 Astra 输出上达到了 99.59% 的准确率。

在 Chatbot Arena 提供的 986 个提示中,Pangram 4 将 3 个 GPT-6 Astra 输出分类为混合,1 个完全由人类生成,982 个完全由 AI 生成,在 GPT-6 Astra 上达到了 99.59% 的准确率。

下面我们按类别讨论漏报情况。

该基准测试数据集是使用LMSYS数据集(Zheng等人,2023)中Chatbot Arena第一轮对话提示的筛选子集生成的。我筛选掉了要求编写代码、数学公式、回答过短或过长,以及不恰当的创意写作的提示。然后,我将筛选后的提示输入GPT-6 Astra,并利用Pangram 4算法处理其输出结果。

按类别查看结果

类别示例AI混合人类
参数161600
电子邮件/信件575610
随笔/文章343400
说明54754610
诗歌及其他创意写作18318111
评论7700
故事14214200
总计98698231

三种不同的结果分别是:一首诗、一段简短的解释和一封电子邮件。

Astra 回答简短问题时往往非常简略。我总共为这套基准测试题发送了 1032 个提示,但 Astra 6 的 46 个回复少于 Pangram 要求的 50 个单词的最低字数限制,因此未被评分。

结论

Pangram 在自然语言提示方面对 GPT-6 Astra 具有很强的鲁棒性,检测准确率高达 99.59%。Pangram 能够泛化到新模型,因为新发布的模型往往会继承其前代模型的风格和特征,所以 Pangram 无需针对每个新版本进行重新训练。

以下是 GPT-6 Astra 与我们近期其他前沿模型基准测试的比较结果:

型号被检测为人工智能准确性
克劳德·索内特 5.51,019/1,02299.71%
双子座3.8闪光灯998/1,00099.80%
Gemini 3.1 Pro997/1,00099.70%
克劳德作品 5.5997/1,00099.70%
寓言 5.11,093/1,09799.64%
克劳德·作品第5号1,105/1,10799.82%
GPT-5.63,408/3,42399.56%
克劳德·索内特 第5首1,145/1,14799.83%
双子座3号28/28100%

如果您想检查特定的文档,可以在这里试用 Pangram。


安娜米卡·阿茨

安娜米卡是 Pangram 的一名技术撰稿人。

查看安娜米卡·阿茨的更多内容

相关阅读

Pangram 能检测到 Gemini 3.8 Flash 和 Gemini 3.1 Pro 吗?
案例研究

Pangram 能检测到 Gemini 3.8 Flash 和 Gemini 3.1 Pro 吗?

2026 年 9 月 30 日
Pangram预测,ICLR会议的21%的评论由人工智能生成
案例研究

Pangram预测,ICLR会议的21%的评论由人工智能生成

2025年11月18日
AI会议论文正越来越多地由AI撰写:自2023年以来增长了370%
案例研究

AI会议论文正越来越多地由AI撰写:自2023年以来增长了370%

2024年9月30日
哪款AI检测工具最准确?30款工具测评(2026年)
案例研究

哪款AI检测工具最准确?30款工具测评(2026年)

2026年1月7日
如何识别AI生成的评论
案例研究

如何识别AI生成的评论

2023年12月5日
“全字母句”能识别克劳德的《作品5.5》吗?
案例研究

“全字母句”能识别克劳德的《作品5.5》吗?

2026年9月23日