案例研究

Pangram 与 GPTZero 相比如何?

2026年1月22日

当前的AI检测市场由几家大型企业主导。您可能听说过它们:Pangram、GPTZero、Turnitin、ZeroGPT等。如需全面了解这些工具的优劣对比,请查阅我们关于当前最佳AI检测工具的指南

许多此类公司都会定期更新其模型,并公布相关性能数据。最近,GPTZero 推出了夏季模型更新,并发布了多种新模型的最新性能数据。在本篇博客中,我们将对比 GPTZero 新模型与Pangram 人工智能检测工具的性能表现,其中也包括最新的 GPT-5 模型。

Pangram 与 GPTZero:已发布数据

型号全字母句检测率GPTZero检测率更优检测器
GPT-599.81%95.0%全字母句
GPT-5-聊天-最新99.97%未经测试不适用
GPT-5-mini99.92%92.2%全字母句
GPT-5-nano99.97%96.1%全字母句
GPT-OSS-120b100.00%未经测试不适用
GPT-开源-20b99.74%未经测试不适用
GPT4.199.48%96.8%全字母句
GPT4.1-迷你版99.94%98.7%全字母句
o399.86%89.9%全字母句
o3-迷你版100.00%98.4%全字母句
双子座2.5专业版99.91%95.7%全字母句
双子座2.5闪存99.75%98.2%全字母句
克劳德十四行诗499.91%99.1%全字母句

注:GPTZero并未向公众公开其内部评估数据集,因此这些数据并非来自完全相同的文档。此外,GPTZero也未公布其测试所用的文档数量,因此我们无法进行数量上的比较。不过,关于Pangram的性能数据,我们针对每个模型评估了数千份文档,并涵盖了多种领域和提示方案,以模拟实际应用场景。

此外,Pangram 的准确性不仅体现在能准确识别出最多的人工智能生成的文档,它在保持较低误报率方面也是市场领导者。确保不会将人工撰写的文档误判为人工智能生成的文档,是我们极为重视的优先事项。下表概述了 Pangram 和 GPTZero 报告的误报率差异:

全字母句GPTZero
假阳性率(%)0.01%1%
假阳性率(#)~每10,000份文件中约有1份~每100份文件中就有1份

GPTZero 误报率博客文章

这里我们可以看到,GPTZero的性能报告显示其假阳性率(FPR)为1%。

研究结果如何?全字母句 vs. GPTZero

Pangram 和 GPTZero 也在经同行评审的人工智能研究论文中展开了直接较量。马里兰大学最近发表的一项研究经常使用 ChatGPT 进行写作任务的人能够准确且可靠地识别人工智能生成的文本对此进行了最生动的诠释。该研究探讨了专业人工标注员区分人类生成文本与人工智能生成文本的能力。

作为研究的一部分,研究人员将人工标注结果与市面上的商业检测工具及开源检测工具进行了对比。Pangram 的表现不仅优于每位人工标注者,也优于所有商业替代方案,包括 GPTZero。

GPT-4o克劳德
全字母句100%100%
GPTZero100%97.6%
注释者196.7%100%
注释者 296.7%100%
注释者386.7%80%
注释者490.0%96.7%
注释者593.3%93.3%

多语言表现

Pangram 的旗舰模型与 GPTZero 之间的差异不仅限于此。这两个模型都是“多语言”的,这意味着它们不仅能检测英语中的 AI 内容,还能检测其他语言中的 AI 内容。Pangram 支持互联网上排名前 20 的所有语言。GPTZero 则支持英语、法语和西班牙语。以下是每个模型所支持的语言:

语言全字母句子的误报率(FPR)GPTZero 误报率 (FPR)全字母AI检测率GPTZero AI检测率
西班牙语0.00%5.6%100.0%96.4%
法语0.00%3.1%100.0%93.1%
阿拉伯语0.10%未经测试100.0%未经测试
捷克0.00%未经测试99.89%未经测试
德语0.00%未经测试99.68%未经测试
希腊0.00%未经测试99.79%未经测试
波斯语0.00%未经测试100.0%未经测试
印地语0.00%未经测试99.58%未经测试
匈牙利语0.10%未经测试99.05%未经测试
意大利语0.00%未经测试100.0%未经测试
日语0.00%未经测试100.0%未经测试
荷兰0.10%未经测试100.0%未经测试
波兰语0.00%未经测试100.0%未经测试
葡萄牙语0.00%未经测试100.0%未经测试
罗马尼亚0.10%未经测试100.0%未经测试
俄罗斯0.00%未经测试100.0%未经测试
瑞典0.00%未经测试99.89%未经测试
土耳其语0.00%未经测试99.79%未经测试
乌克兰0.00%未经测试99.89%未经测试
乌尔都语0.00%未经测试98.84%未经测试
越南语0.00%未经测试99.89%未经测试
中文0.00%未经测试99.89%未经测试

有关 Pangram 在多语言文本处理方面的表现,请参阅这篇博客文章

ESL 表现

此外,这两个模型在训练过程中都特别关注了ESL(英语作为第二语言)文本的检测表现,因为业界普遍担心AI检测器可能会对非英语母语者产生偏见。GPTZero和Pangram都专门发布了针对ESL文本的检测结果。请参阅下文了解它们的对比情况:

假阳性率样本量
全字母句0.032%25,021
GPTZero1.1%91

如需进一步了解 Pangram 处理 ESL 文本的方法,请阅读这篇博客文章:https://www.pangram.com/blog/how-accurate-is-pangram-ai-detection-on-esl

未发布的模型与GPT-5

对于正在寻求人工智能检测解决方案的企业而言,另一个关注点在于其对未发布模型的检测性能。随着人工智能领域的竞争日益白热化,大型人工智能实验室和初创公司都在持续发布重要模型。对于人工智能检测解决方案而言,关键在于能够持续对那些其可能未曾直接进行过训练的模型提供准确的检测结果。

GPT-5的近期发布为我们提供了绝佳的机会来验证这一点!新模型发布后仅数小时,Pangram团队便针对多种提示类型对GPTZero和Pangram的性能进行了测试。测试结果如下:

全字母句GPTZero
文件1100%2%
文件2100%0%
文件3100%0%
文件4100%0%
文件5100%9%
文件699%0%
文件7100%0%
文件8100%0%
文件9100%29%
文件10100%0%
文件11100%10%

注:GPTZero 随后发布了模型更新,声称在 GPT-5 上的表现更佳!有关我们最初对比测试的更多详情,请参阅这篇博客文章。此外,我们鼓励用户自行进行测试,以比较任意时间点的性能表现。

结论

总而言之,Pangram 始终是检测 AI 生成内容的强大且可靠的选择。无论您的需求是用于教育出版内容审核,还是其他更特殊的情境,我们都能为您提供准确且公正的 AI 检测服务。欢迎访问我们的博客了解更多信息,或通过info@pangram.com 与我们联系。


布拉德利·埃米
布拉德利·埃米首席技术官,联合创始人

布拉德利是一位人工智能研究员,也是工业领域深度学习产品开发的专家。他最近曾领导生成式人工智能药物发现公司Absci的深度学习研究团队,此前曾是特斯拉Autopilot核心计算机视觉团队的成员。

在攻读研究生期间,布拉德利曾与斯坦福视觉实验室合作,在深度学习研究领域发表了多篇论文。他拥有斯坦福大学物理学学士学位和人工智能硕士学位。除了人工智能,他还对教育和哲学充满热情,并且是一名狂热的高尔夫球手。

查看布拉德利·埃米的更多内容

相关阅读

Pangram预测,ICLR会议的21%的评论由人工智能生成
案例研究

Pangram预测,ICLR会议的21%的评论由人工智能生成

2025年11月18日
哪款AI检测工具最准确?30款工具测评(2026年)
案例研究

哪款AI检测工具最准确?30款工具测评(2026年)

2026年1月7日
AI会议论文正越来越多地由AI撰写:自2023年以来增长了370%
案例研究

AI会议论文正越来越多地由AI撰写:自2023年以来增长了370%

2024年9月30日
Quora 如何利用全字母句来处理由 AI 生成的答案
案例研究

Quora 如何利用全字母句来处理由 AI 生成的答案

2024年9月26日
让您的企业具备应对法律人工智能(LLM)和生成式人工智能(GenAI)的能力
案例研究

让您的企业具备应对法律人工智能(LLM)和生成式人工智能(GenAI)的能力

2024年1月30日
目前,亚马逊首页评论中有3%是由人工智能生成的
案例研究

目前,亚马逊首页评论中有3%是由人工智能生成的

2026年5月4日