我们认为,机构能够信赖 Pangram 的高准确度至关重要,因此我们鼓励对我们的质量指标(误报率和漏报率)进行第三方验证。下文将重点介绍芝加哥大学(UChicago)、马里兰大学(UMD)的研究人员以及商业评审人员对 Pangram 的评估结果。
关键要点:Pangram 的内部测试经得起第三方审查。
在2026年6月发表的一篇经同行评审的论文中,布鲁塞尔自由大学(Vrije Universiteit Brussel)的一组研究人员对四款AI检测工具——Pangram、GPTZero、Turnitin和Copyleaks——进行了测试,测试对象是160篇每篇超过4000词的学术论文。 该数据集采用英语撰写,内容均等分为四类:由非母语英语(ESL)学生撰写的人工论文、AI生成的论文、混合型论文(人工与AI文本混合)以及经过“人性化”处理的AI文本。
研究人员发现,Pangram 是唯一能够可靠检测 AI 内容的工具:“在本文研究的四款 AI 检测工具中,目前只有 [Pangram] 产生了令人满意的结果。”
Pangram 是唯一能够可靠地同时检测出完全由 AI 撰写和经过人工润色的论文的工具(检测率分别为 97.5% 和 95%)。在完全由 AI 生成的数据集上,其他三款工具几乎未能检测出任何内容,检测率均为 0%。除 Pangram 之外,没有其他检测工具能可靠地处理经过人工润色的文本,不过 Turnitin 检测出了大约一半,Copyleaks 则检测出了四分之一。
| 工具 | 检测率(完全基于AI) | 检出率(杂交法) | 检出率(人源化) | 假阳性率 |
|---|---|---|---|---|
| 全字母句 | 97.5% | 95% | 95% | 0% |
| Turnitin | 0% | 60% | 52.5% | 0% |
| Copyleaks | 0% | 32.5% | 25% | 0% |
| GPTZero | 0% | 0% | 2.5% | 轻微的正偏差(唯一在人类文本中不为零的指标) |
早先的研究发现,其他检测工具对非母语英语写作者会产生误报,但这项独立研究表明,Pangram 对非母语英语文本并无实质性的偏见。
在芝加哥大学贝克尔-弗里德曼经济学研究所,研究人员对比了四种AI检测工具:Pangram、GPTZero、Originality AI以及RoBERTa(一款开源AI检测工具)。该研究使用每种检测工具,分析了1,992篇2020年前撰写的人类文本和1,992篇AI生成的文本,涵盖不同体裁和字数范围。 他们考察了AI检测中的两种错误类型:假阳性率(FPR)和假阴性率(FNR)。研究人员针对多个阈值对这些率进行了比较。这些检测器还对来自ChatGPT、Claude和Gemini等流行大型语言模型(LLMs)的AI生成文本进行了分类。研究人员在各检测器中设置了多种FPR策略上限,以观察FNR的变化情况。
摘自布莱恩·贾巴里安(Brian Jabarian)和亚历克斯·伊马斯(Alex Imas)于2025年8月发表的论文《人工书写与自动检测》:
在所有阈值下,Pangram 都表现优于其他检测器。
Pangram 是唯一一款既能满足严格的政策上限(FPR ≤ 0.005),又不影响准确检测 AI 文本能力的检测器。
Pangram 依然是所有类别中成本最低的检测工具,平均每段正确标记的 AI 文本仅需 0.0228 美元,而 OriginalityAI 和 GPTZero 分别为 0.0416 美元和 0.0575 美元,这使得 Pangram 成为检测完整段落和短文时最具成本效益的工具。
该研究表明:
在处理中长至长篇段落时,Pangram 的误报率和漏报率基本为零。
Pangram 在各类文本中均展现出极高的准确率,包括博客、评论、简历、新闻和小说等。在短篇文本中,其误报率和漏报率虽略有上升,“但仍远低于合理的政策阈值”。
各检测器在六个体裁和四个大型语言模型(LLMs)上的平均假阳性率(将人类文本误判为AI文本)和假阴性率(漏检AI文本)。这两项指标均以数值越低越好。
| 工具 | 假阳性率 | 假阴性率 | 对StealthGPT人性化处理具有鲁棒性吗? |
|---|---|---|---|
| 全字母句 | 0.001 | 0.01 | 是(检测率接近100%) |
| Originality.ai | 0.002 | 0.035 | 部分有效(在短文本上FNR值最高可达0.21) |
| GPTZero | 0.007 | 0.06 | 否(FNR 0.50+) |
| RoBERTa(开源) | 0.50 | 不可靠(将大部分文本标记为AI生成) | 不适用(不合适) |
Pangram 不再对少于 50 个单词的文本进行预测,但正如该研究中指出的,
Pangram’s performance largely holds up on very short passages (< 50 words) and is robust to “humanizer” tools (e.g., StealthGPT), the performance of other detectors becomes case-dependent.
在这项马里兰大学(UMD)研究的实验1中,研究人员邀请了具备不同大语言模型(LLM)知识水平的标注员,让他们预测一段文本是否由AI生成。 在发现一名标注员在识别AI文本方面表现近乎完美后,研究人员又邀请了四名具有相似LLM使用背景的专家标注员,对同一组60个样本进行分类。专家投票的结果与Pangram、PangramHumanizer和GPTZero等商业检测器,以及Fast-DetectGPT等开源工具进行了对比。在此过程中,Pangram与其他检测器进行了比较。
在所有测试场景下(包括最难的测试场景——人性化的o1-pro文本)中,AI文章的检出率(TPR)及误报率。只有Pangram的表现能与人类专家相媲美。
| 探测器 | 总体检出率(TPR) | 假阳性率 | 对人性化文本的检测 |
|---|---|---|---|
| 专家(多数票) | 99.3% | 0% | 100% |
| 全字母句人化者 | 99.3% | 2.7% | 96.7% |
| 全字母句(基础版) | 98.0% | 2% | 90.0% |
| GPTZero | 85.3% | 0.7% | 46.7% |
| Fast-DetectGPT | 80.0% | 7.2% | 23.3% |
| 双筒望远镜(精度模式) | 66.7% | 1.3% | 6.7% |
| RADAR | 15.3% | 2% | 0% |
Pangram 能够准确识别经过“人性化”处理的 AI 生成的文本。马里兰大学(UMD)的计算机科学家证实了这一点,他们指出,在检测“人性化”文本和改写文本方面,Pangram 的综合得分最高,其准确率达 99.3%,表现优于其他 AI 检测软件。
了解有关“Pangram”在与“humanizers”的对比中表现如何
《Tom’s Guide》的阿曼达·卡斯韦尔在一篇文章中指出,在试用了数十款AI检测工具后,Pangram“表现优于我试用的其他工具”。此外,Pangram还被证实正在努力降低本已较低的误报率。
ZDNET的DavidGewirtz将Pangram描述为“我们测试中的新秀,一经亮相便跻身优胜者之列。”
由于研究论文中人工智能的使用日益增多,人们担心这可能预示着学术不端行为。 亚当·戴(Adam Day)在Medium上发表的文章利用Pangram的AI检测功能,获得了关于AI内容普及率的可靠结果,同时也得出结论:生成式AI在研究中存在正当的应用场景。戴建议使用Pangram进行研究,他表示:“如果有人想对已发表文献中生成式AI的使用情况进行调查,我认为利用Pangram的工具来完成这项工作是一个绝佳的机会。”
在 Pangram,我们坚信透明度是建立信任的基础。我们期待与您携手合作,为您的组织带来人工智能透明度。

Destiny 是 Pangram 的研究分析师实习生。她目前就读于纽约市立技术学院,主修应用数学和化学。Destiny 在 Pangram 的工作为调查互联网上的 AI 垃圾内容做出了巨大贡献。在工作和学业之余,Destiny 热衷于创意写作和恐怖小说创作。