案例研究

第三方全字母句评估

独立的第三方评估一再证实了Pangram内部的准确率数据——以下是对相关外部证据的汇总。

2026年8月2日

我们认为,机构能够信赖 Pangram 的高准确度至关重要,因此我们鼓励对我们的质量指标(误报率和漏报率)进行第三方验证。下文将重点介绍芝加哥大学(UChicago)、马里兰大学(UMD)的研究人员以及商业评审人员对 Pangram 的评估结果。

关键要点:Pangram 的内部测试经得起第三方审查。

Pangram 在完全由 AI 生成的文本中实现了 97.5% 的检测率,在 ESL 作文中未出现任何误报

在2026年6月发表的一篇经同行评审的论文中,布鲁塞尔自由大学(Vrije Universiteit Brussel)的一组研究人员对四款AI检测工具——Pangram、GPTZero、Turnitin和Copyleaks——进行了测试,测试对象是160篇每篇超过4000词的学术论文。 该数据集采用英语撰写,内容均等分为四类:由非母语英语(ESL)学生撰写的人工论文、AI生成的论文、混合型论文(人工与AI文本混合)以及经过“人性化”处理的AI文本。

研究人员发现,Pangram 是唯一能够可靠检测 AI 内容的工具:“在本文研究的四款 AI 检测工具中,目前只有 [Pangram] 产生了令人满意的结果。”

Pangram 是唯一能够可靠地同时检测出完全由 AI 撰写和经过人工润色的论文的工具(检测率分别为 97.5% 和 95%)。在完全由 AI 生成的数据集上,其他三款工具几乎未能检测出任何内容,检测率均为 0%。除 Pangram 之外,没有其他检测工具能可靠地处理经过人工润色的文本,不过 Turnitin 检测出了大约一半,Copyleaks 则检测出了四分之一。

工具检测率(完全基于AI)检出率(杂交法)检出率(人源化)假阳性率
全字母句97.5%95%95%0%
Turnitin0%60%52.5%0%
Copyleaks0%32.5%25%0%
GPTZero0%0%2.5%轻微的正偏差(唯一在人类文本中不为零的指标)

早先的研究发现,其他检测工具对非母语英语写作者会产生误报,但这项独立研究表明,Pangram 对非母语英语文本并无实质性的偏见。

潘格拉姆的可靠性与准确性(芝加哥大学)

实验

在芝加哥大学贝克尔-弗里德曼经济学研究所,研究人员对比了四种AI检测工具:Pangram、GPTZero、Originality AI以及RoBERTa(一款开源AI检测工具)。该研究使用每种检测工具,分析了1,992篇2020年前撰写的人类文本和1,992篇AI生成的文本,涵盖不同体裁和字数范围。 他们考察了AI检测中的两种错误类型:假阳性率(FPR)和假阴性率(FNR)。研究人员针对多个阈值对这些率进行了比较。这些检测器还对来自ChatGPT、Claude和Gemini等流行大型语言模型(LLMs)的AI生成文本进行了分类。研究人员在各检测器中设置了多种FPR策略上限,以观察FNR的变化情况。

结果

摘自布莱恩·贾巴里安(Brian Jabarian)和亚历克斯·伊马斯(Alex Imas)于2025年8月发表的论文《人工书写与自动检测》:

在所有阈值下,Pangram 都表现优于其他检测器。

Pangram 是唯一一款既能满足严格的政策上限(FPR ≤ 0.005),又不影响准确检测 AI 文本能力的检测器。

Pangram 依然是所有类别中成本最低的检测工具,平均每段正确标记的 AI 文本仅需 0.0228 美元,而 OriginalityAI 和 GPTZero 分别为 0.0416 美元和 0.0575 美元,这使得 Pangram 成为检测完整段落和短文时最具成本效益的工具。

该研究表明:

在处理中长至长篇段落时,Pangram 的误报率和漏报率基本为零。

Pangram 在各类文本中均展现出极高的准确率,包括博客、评论、简历、新闻和小说等。在短篇文本中,其误报率和漏报率虽略有上升,“但仍远低于合理的政策阈值”。

各检测器在六个体裁和四个大型语言模型(LLMs)上的平均假阳性率(将人类文本误判为AI文本)和假阴性率(漏检AI文本)。这两项指标均以数值越低越好。

工具假阳性率假阴性率对StealthGPT人性化处理具有鲁棒性吗?
全字母句0.0010.01是(检测率接近100%)
Originality.ai0.0020.035部分有效(在短文本上FNR值最高可达0.21)
GPTZero0.0070.06否(FNR 0.50+)
RoBERTa(开源)0.50不可靠(将大部分文本标记为AI生成)不适用(不合适)

Pangram 不再对少于 50 个单词的文本进行预测,但正如该研究中指出的,

Pangram’s performance largely holds up on very short passages (< 50 words) and is robust to “humanizer” tools (e.g., StealthGPT), the performance of other detectors becomes case-dependent.

Pangram 与 Humanizers(马里兰大学)的对决

实验

在这项马里兰大学(UMD)研究的实验1中,研究人员邀请了具备不同大语言模型(LLM)知识水平的标注员,让他们预测一段文本是否由AI生成。 在发现一名标注员在识别AI文本方面表现近乎完美后,研究人员又邀请了四名具有相似LLM使用背景的专家标注员,对同一组60个样本进行分类。专家投票的结果与Pangram、PangramHumanizer和GPTZero等商业检测器,以及Fast-DetectGPT等开源工具进行了对比。在此过程中,Pangram与其他检测器进行了比较。

在所有测试场景下(包括最难的测试场景——人性化的o1-pro文本)中,AI文章的检出率(TPR)及误报率。只有Pangram的表现能与人类专家相媲美。

探测器总体检出率(TPR)假阳性率对人性化文本的检测
专家(多数票)99.3%0%100%
全字母句人化者99.3%2.7%96.7%
全字母句(基础版)98.0%2%90.0%
GPTZero85.3%0.7%46.7%
Fast-DetectGPT80.0%7.2%23.3%
双筒望远镜(精度模式)66.7%1.3%6.7%
RADAR15.3%2%0%

结果

Pangram 能够准确识别经过“人性化”处理的 AI 生成的文本。马里兰大学(UMD)的计算机科学家证实了这一点,他们指出,在检测“人性化”文本和改写文本方面,Pangram 的综合得分最高,其准确率达 99.3%,表现优于其他 AI 检测软件。

了解有关“Pangram”在与“humanizers”的对比中表现如何

研究机构以外的全字母句评估

《Tom’s Guide》的阿曼达·卡斯韦尔在一篇文章中指出,在试用了数十款AI检测工具后,Pangram“表现优于我试用的其他工具”。此外,Pangram还被证实正在努力降低本已较低的误报率。

ZDNET的DavidGewirtz将Pangram描述为“我们测试中的新秀,一经亮相便跻身优胜者之列。”

由于研究论文中人工智能的使用日益增多,人们担心这可能预示着学术不端行为。 亚当·戴(Adam Day)在Medium上发表的文章利用Pangram的AI检测功能,获得了关于AI内容普及率的可靠结果,同时也得出结论:生成式AI在研究中存在正当的应用场景。戴建议使用Pangram进行研究,他表示:“如果有人想对已发表文献中生成式AI的使用情况进行调查,我认为利用Pangram的工具来完成这项工作是一个绝佳的机会。”

结论

在 Pangram,我们坚信透明度是建立信任的基础。我们期待与您携手合作,为您的组织带来人工智能透明度。


德斯蒂尼·阿基诺德

Destiny 是 Pangram 的研究分析师实习生。她目前就读于纽约市立技术学院,主修应用数学和化学。Destiny 在 Pangram 的工作为调查互联网上的 AI 垃圾内容做出了巨大贡献。在工作和学业之余,Destiny 热衷于创意写作和恐怖小说创作。

更多来自 Destiny Akinode 的内容

相关阅读

AI会议论文正越来越多地由AI撰写:自2023年以来增长了370%
案例研究

AI会议论文正越来越多地由AI撰写:自2023年以来增长了370%

2024年9月30日
哪款AI检测工具最准确?30款工具测评(2026年)
案例研究

哪款AI检测工具最准确?30款工具测评(2026年)

2026年1月7日
目前,亚马逊首页评论中有3%是由人工智能生成的
案例研究

目前,亚马逊首页评论中有3%是由人工智能生成的

2026年5月4日
Pangram在各类学生作文中未检测到任何误报
案例研究

Pangram在各类学生作文中未检测到任何误报

2026年8月19日
Gradpilot 如何利用“全字母句”帮助学生找到自己的声音
案例研究

Gradpilot 如何利用“全字母句”帮助学生找到自己的声音

2025年9月15日
Pangram 与 GPTZero 相比如何?
案例研究

Pangram 与 GPTZero 相比如何?

2026年1月22日