当前的AI检测市场由几家大型企业主导。您可能听说过它们:Pangram、GPTZero、Turnitin、ZeroGPT等。如需全面了解这些工具的优劣对比,请查阅我们关于当前最佳AI检测工具的指南。
许多此类公司都会定期更新其模型,并公布相关性能数据。最近,GPTZero 推出了夏季模型更新,并发布了多种新模型的最新性能数据。在本篇博客中,我们将对比 GPTZero 新模型与Pangram 人工智能检测工具的性能表现,其中也包括最新的 GPT-5 模型。
| 型号 | 全字母句检测率 | GPTZero检测率 | 更优检测器 |
|---|---|---|---|
| GPT-5 | 99.81% | 95.0% | 全字母句 |
| GPT-5-聊天-最新 | 99.97% | 未经测试 | 不适用 |
| GPT-5-mini | 99.92% | 92.2% | 全字母句 |
| GPT-5-nano | 99.97% | 96.1% | 全字母句 |
| GPT-OSS-120b | 100.00% | 未经测试 | 不适用 |
| GPT-开源-20b | 99.74% | 未经测试 | 不适用 |
| GPT4.1 | 99.48% | 96.8% | 全字母句 |
| GPT4.1-迷你版 | 99.94% | 98.7% | 全字母句 |
| o3 | 99.86% | 89.9% | 全字母句 |
| o3-迷你版 | 100.00% | 98.4% | 全字母句 |
| 双子座2.5专业版 | 99.91% | 95.7% | 全字母句 |
| 双子座2.5闪存 | 99.75% | 98.2% | 全字母句 |
| 克劳德十四行诗4 | 99.91% | 99.1% | 全字母句 |
注:GPTZero并未向公众公开其内部评估数据集,因此这些数据并非来自完全相同的文档。此外,GPTZero也未公布其测试所用的文档数量,因此我们无法进行数量上的比较。不过,关于Pangram的性能数据,我们针对每个模型评估了数千份文档,并涵盖了多种领域和提示方案,以模拟实际应用场景。
此外,Pangram 的准确性不仅体现在能准确识别出最多的人工智能生成的文档,它在保持较低误报率方面也是市场领导者。确保不会将人工撰写的文档误判为人工智能生成的文档,是我们极为重视的优先事项。下表概述了 Pangram 和 GPTZero 报告的误报率差异:
| 全字母句 | GPTZero | |
|---|---|---|
| 假阳性率(%) | 0.01% | 1% |
| 假阳性率(#) | ~每10,000份文件中约有1份 | ~每100份文件中就有1份 |
GPTZero 误报率博客文章
这里我们可以看到,GPTZero的性能报告显示其假阳性率(FPR)为1%。
Pangram 和 GPTZero 也在经同行评审的人工智能研究论文中展开了直接较量。马里兰大学最近发表的一项研究《经常使用 ChatGPT 进行写作任务的人能够准确且可靠地识别人工智能生成的文本》对此进行了最生动的诠释。该研究探讨了专业人工标注员区分人类生成文本与人工智能生成文本的能力。
作为研究的一部分,研究人员将人工标注结果与市面上的商业检测工具及开源检测工具进行了对比。Pangram 的表现不仅优于每位人工标注者,也优于所有商业替代方案,包括 GPTZero。
| GPT-4o | 克劳德 | |
|---|---|---|
| 全字母句 | 100% | 100% |
| GPTZero | 100% | 97.6% |
| 注释者1 | 96.7% | 100% |
| 注释者 2 | 96.7% | 100% |
| 注释者3 | 86.7% | 80% |
| 注释者4 | 90.0% | 96.7% |
| 注释者5 | 93.3% | 93.3% |
Pangram 的旗舰模型与 GPTZero 之间的差异不仅限于此。这两个模型都是“多语言”的,这意味着它们不仅能检测英语中的 AI 内容,还能检测其他语言中的 AI 内容。Pangram 支持互联网上排名前 20 的所有语言。GPTZero 则支持英语、法语和西班牙语。以下是每个模型所支持的语言:
| 语言 | 全字母句子的误报率(FPR) | GPTZero 误报率 (FPR) | 全字母AI检测率 | GPTZero AI检测率 |
|---|---|---|---|---|
| 西班牙语 | 0.00% | 5.6% | 100.0% | 96.4% |
| 法语 | 0.00% | 3.1% | 100.0% | 93.1% |
| 阿拉伯语 | 0.10% | 未经测试 | 100.0% | 未经测试 |
| 捷克 | 0.00% | 未经测试 | 99.89% | 未经测试 |
| 德语 | 0.00% | 未经测试 | 99.68% | 未经测试 |
| 希腊 | 0.00% | 未经测试 | 99.79% | 未经测试 |
| 波斯语 | 0.00% | 未经测试 | 100.0% | 未经测试 |
| 印地语 | 0.00% | 未经测试 | 99.58% | 未经测试 |
| 匈牙利语 | 0.10% | 未经测试 | 99.05% | 未经测试 |
| 意大利语 | 0.00% | 未经测试 | 100.0% | 未经测试 |
| 日语 | 0.00% | 未经测试 | 100.0% | 未经测试 |
| 荷兰 | 0.10% | 未经测试 | 100.0% | 未经测试 |
| 波兰语 | 0.00% | 未经测试 | 100.0% | 未经测试 |
| 葡萄牙语 | 0.00% | 未经测试 | 100.0% | 未经测试 |
| 罗马尼亚 | 0.10% | 未经测试 | 100.0% | 未经测试 |
| 俄罗斯 | 0.00% | 未经测试 | 100.0% | 未经测试 |
| 瑞典 | 0.00% | 未经测试 | 99.89% | 未经测试 |
| 土耳其语 | 0.00% | 未经测试 | 99.79% | 未经测试 |
| 乌克兰 | 0.00% | 未经测试 | 99.89% | 未经测试 |
| 乌尔都语 | 0.00% | 未经测试 | 98.84% | 未经测试 |
| 越南语 | 0.00% | 未经测试 | 99.89% | 未经测试 |
| 中文 | 0.00% | 未经测试 | 99.89% | 未经测试 |
有关 Pangram 在多语言文本处理方面的表现,请参阅这篇博客文章
此外,这两个模型在训练过程中都特别关注了ESL(英语作为第二语言)文本的检测表现,因为业界普遍担心AI检测器可能会对非英语母语者产生偏见。GPTZero和Pangram都专门发布了针对ESL文本的检测结果。请参阅下文了解它们的对比情况:
| 假阳性率 | 样本量 | |
|---|---|---|
| 全字母句 | 0.032% | 25,021 |
| GPTZero | 1.1% | 91 |
如需进一步了解 Pangram 处理 ESL 文本的方法,请阅读这篇博客文章:https://www.pangram.com/blog/how-accurate-is-pangram-ai-detection-on-esl
对于正在寻求人工智能检测解决方案的企业而言,另一个关注点在于其对未发布模型的检测性能。随着人工智能领域的竞争日益白热化,大型人工智能实验室和初创公司都在持续发布重要模型。对于人工智能检测解决方案而言,关键在于能够持续对那些其可能未曾直接进行过训练的模型提供准确的检测结果。
GPT-5的近期发布为我们提供了绝佳的机会来验证这一点!新模型发布后仅数小时,Pangram团队便针对多种提示类型对GPTZero和Pangram的性能进行了测试。测试结果如下:
| 全字母句 | GPTZero | |
|---|---|---|
| 文件1 | 100% | 2% |
| 文件2 | 100% | 0% |
| 文件3 | 100% | 0% |
| 文件4 | 100% | 0% |
| 文件5 | 100% | 9% |
| 文件6 | 99% | 0% |
| 文件7 | 100% | 0% |
| 文件8 | 100% | 0% |
| 文件9 | 100% | 29% |
| 文件10 | 100% | 0% |
| 文件11 | 100% | 10% |
注:GPTZero 随后发布了模型更新,声称在 GPT-5 上的表现更佳!有关我们最初对比测试的更多详情,请参阅这篇博客文章。此外,我们鼓励用户自行进行测试,以比较任意时间点的性能表现。
总而言之,Pangram 始终是检测 AI 生成内容的强大且可靠的选择。无论您的需求是用于教育、出版、内容审核,还是其他更特殊的情境,我们都能为您提供准确且公正的 AI 检测服务。欢迎访问我们的博客了解更多信息,或通过info@pangram.com 与我们联系。

布拉德利是一位人工智能研究员,也是工业领域深度学习产品开发的专家。他最近曾领导生成式人工智能药物发现公司Absci的深度学习研究团队,此前曾是特斯拉Autopilot核心计算机视觉团队的成员。
在攻读研究生期间,布拉德利曾与斯坦福视觉实验室合作,在深度学习研究领域发表了多篇论文。他拥有斯坦福大学物理学学士学位和人工智能硕士学位。除了人工智能,他还对教育和哲学充满热情,并且是一名狂热的高尔夫球手。





