我们推出了迄今为止最先进的模型:Pangram 4!点击此处了解详情。

产品更新

Pangram 4 技术报告

2026年7月29日

Pangram 4是我们最新推出的尖端 AI 文本检测模型。与前代模型相比,Pangram 4 在区分纯 AI 生成、混合作者以及 AI 辅助写作方面取得了显著进步,同时具备更强的细分能力,能够更精细地区分文档中由人类和 AI 生成的段落。该模型还具备抗“人性化”处理和抗对抗性提示的能力,并在最新前沿模型上的检测准确率显著提升。

据我们所知,Pangram 4 是首个能够在单次处理中同时区分 AI 辅助写作与 AI-人类混合写作的 AI 检测模型。

主要成果:

  • 在我们的基准测试中,Pangram 4 能正确识别 99.66% 的 AI 生成的文档,而将人类撰写的文档误判为 AI 生成的比例仅为 0.0041%,即每 24,000 份文档中大约出现一次误报。
  • Pangram 4 在两个方面都比 Pangram 3 有所改进,漏检率降低了近 6 倍,误检率降低了 14 倍。
  • Pangram 4 不会将轻度的 AI 润色误认为 AI 生成:它仅在 0.009% 的情况下将经过 AI 润色的人类写作标记为完全由 AI 生成,这一比例较 Pangram 3 降低了 20 倍。
  • 在与13款流行的商用“人性化”工具进行对比测试时,Pangram 4在98.83%的情况下能够识别出人性化AI文本中存在AI参与。

混合署名与人工智能辅助

如今产生的许多书面文档已不再能明确归类为完全由人工智能生成或完全由人类撰写;相反,我们正生活在一个这样的时代:一篇文本的行文风格与论点,其来源很可能各不相同。

我们认为,将此类文档与完全由人工智能生成或完全由人类撰写的文本区分开来至关重要。这之所以重要,一方面是因为我们倡导透明的作者归属,另一方面是因为作为一项广受欢迎且正在兴起的技术,语言模型正以我们尚未完全理解的方式塑造着世界——尽管我们已能从中窥见端倪。部分研究表明,使用语言模型编辑文本会以可量化的方式改变其风格;例如,由大型语言模型(LLM)改写的学术论文往往会积累更多保留性词汇(如“可能”、“通常”、“表明”)和强调性词汇(如“强烈”、“稳健”、“一致”)。相关研究发现,即使指示大型语言模型仅修正语法,其编辑也会改变文本的含义;此外,由大型语言模型撰写的同行评审在清晰度和重要性的权重分配上,与人类评审者存在差异。另有迹象表明,即使经过大量编辑,也很难消除AI生成的草稿所留下的痕迹:那些将大型语言模型生成的内容编辑成个人风格的作者,其最终产出的文本读起来仍更接近大型语言模型的写作风格,而非其个人风格。

为解决这一问题,我们考虑了将人类作者与人工智能作者相结合的两种主要方式。对于异构文档——即其中各段落可明确归因于人工智能或人类作者之一——Pangram 采用基于单词的预测方法。另一方面,对于经过迭代编辑且无法将任何单词明确归因于单一人工智能或人类作者的段落,Pangram 会将该段落标记为“人工智能辅助”内容。

异质混合文本与同质混合文本之间的区别。异质混合文本与同质混合文本之间的区别。

Pangram 能够有效抵御“人性化”攻击和对抗性提示

随着人工智能检测技术的进步,针对人工智能生成的文本进行改写以规避自动检测的软件需求也在不断增长。这些工具通常旨在在作者身份至关重要的领域(如学术界、研究领域或出版业)规避检测。 为应对这一问题,Pangram 4 具备专门的“人性化文本”检测功能。在与 13 款主流商业“人性化”工具的对比测试中,Pangram 能够以 98.83% 的准确率识别出经过“人性化”处理的 AI 文本中存在的 AI 痕迹。

另一种用于规避检测的常见对抗性策略是“对抗性提示”,例如Blader humanizer,用户通过该策略指示大型语言模型(LLM)偏离其惯常的写作风格。为了评估我们在该领域的表现,我们允许一个AI代理(Codex GPT 5.6 Sol)在24小时内访问Pangram 4 API,旨在构建可重复出现的假阴性结果。

在此过程中,GPT 5.6 测试了多种策略,包括风格模仿、简洁的专业语体,以及通过人类源文本预加载上下文。 在测试期间,它仅通过模仿口述的外科病理记录成功绕过限制一次。尽管这一成果令人印象深刻,但我们最终认为此次尝试超出了测试范围——一方面是因为输入内容包含的上下文比输出内容更多,另一方面是因为生成的文本是简练的要点列表,而非我们通常针对的开放式散文。

培训与架构

为了确定作者身份,我们将AI生成的文本定义为:由大型语言模型(LLM)针对开放式写作任务或问题所生成的原创自然语言散文。此外,我们要求大型语言模型必须贡献原创令牌,并排除模型原封不动复述人类撰写文本的情况;例如,引用上下文窗口中的内容、背诵记忆中的内容,或对人类输入字符串进行删节。

训练数据

我们利用来自各种领域、语言和AI模型的人工撰写文本以及AI生成的文本,对Pangram 4进行了训练。

与之前版本一样,所有由人工编写训练数据均已获得商业许可或归本公司所有。一如既往,Pangram 4 的训练未使用任何用户提交的数据、API 用户的客户数据,或通过未经授权的网络爬取获取的数据。

下图显示了我们人类数据集中各域的大致分布情况。

按类别划分的人类源文本的大致构成。按类别划分的人类源文本的大致构成。

对于数据集中的 AI 部分,我们利用 75 种最流行的模型(包括目前所有可用的 OpenAI 和 Anthropic 模型)在内部生成了所有合成示例。构建合成数据集时的目标是提供上下文,以帮助模型理解文本的写作方式,而非仅仅捕捉 AI 文本中的主题、语言或语气特征。

为了减少对异常人类书写内容的误报,我们会将一个经过训练的候选模型应用于预留的人类文本库,以识别那些被该候选模型错误标记为AI生成的内容。随后,我们为这些被错误标记的内容生成合成镜像,并利用合并后的数据集对候选模型进行重新训练。我们将这种方法称为“硬负样本挖掘”。

建筑

Pangram 4 是我们迄今为止规模最大的模型,其参数数量是 Pangram 3.3 的 6 倍。与前代模型相比,Pangram 4 在架构上进行了多项重大改动。它也是我们首个混合专家模型,其中采用的稀疏路由机制将不同类型的输入引导至神经网络的不同部分。我们认为,鉴于输入可能性范围广泛,此类架构将非常适合人工智能检测任务。

Pangram 4 架构概述。Pangram 4 架构概述。

预测机制

为了提高预测的精度,Pangram 4 针对给定输入字符串中的每个令牌预测三个分数,分别对应其对该令牌是“人工撰写”、“AI辅助”还是“AI生成”的判断。对于较长的文档,我们会以重叠的 512 个令牌为一个窗口进行评分,这样对于每个窗口,我们不仅能获得窗口级分数,还能获得令牌级分数的聚合结果。 随后,所有评分将进行平均和平滑处理,以抑制单个令牌预测中出现的异常波动。该方法取代了预处理阶段中简单地将文本分块的旧有做法,正是它使我们能够精确推断出人工智能内容与人类内容之间的界限。

性能与基准测试

为了准确建模现实世界中的大型语言模型(LLM)应用场景,我们针对人类撰写、AI生成以及AI辅助生成的文本,在多种标准和挑战性基准测试上对Pangram 4进行了评估。

误报

对于测试集中的自然语言部分,Pangram 4 基于一套 200 万份商业授权的 2022 年前文档进行了基准测试,这些文档在模型训练过程中被保留下来。 在此基准测试中,Pangram 4 的误报率为 0.0041%,95% 置信区间为 (0.0032%,0.0050%)。这意味着大约每 24,000 份文档中会出现一次误报。

AI生成的数据集中的假阴性

我们通过从Chatbot Arena对话中收集用户提示语来构建该基准数据集;选择这组提示语是为了反映用户向大型语言模型(LLMs)发送的提示语在现实世界中的分布情况。随后,我们使用一个小型语言模型(Mistral-Small-24B-Instruct-2501)过滤掉了所有请求数学或编程帮助的提示语,以及选择题答案,因为我们认为这些内容超出了研究范围。 过滤后,我们获得了一组包含20,000条提示的全面数据集,这些提示能从模型中诱发开放式回答。针对该数据集中的每条提示,我们为数据集中26个语言模型(包括GPT-5.5、Claude Opus 4.8和Gemini 3.1 Pro)生成了相应的回答,共计519,993个成功评分的样本。

在此基准测试中,Pangram 4 的总体假阴性率为 0.3396%,而 Pangram 3 在同一数据集上的假阴性率为 1.99%。

对前沿模型的鲁棒性

Pangram 4 可在前沿语言模型中普遍适用:每个模型家族的假阴性率(FNR)均低于 0.7%,且我们未发现模型发布日期与其可检测性之间存在显著相关性。

公司产品系列FNR家族
思考机器灵感0.190%
Anthropic克劳德0.195%
NVIDIANemotron0.310%
阿里云Qwen0.315%
OpenAIGPT0.316%
腾讯浑元0.330%
DeepSeekV40.388%
Moonshot AI基米0.395%
Mistral AI米斯特拉尔0.400%
谷歌杰玛0.430%
Z.aiGLM0.470%
谷歌双子座0.498%
元数据羊驼0.550%
xAIGrok0.605%
总体而言0.3396%

在混合文档和编辑后的文档中的性能表现

我们创建了一个由AI校对和AI润色后的文本数据集,用于评估我们的“AI辅助误报率”,即模型错误地将AI所做的微小修改标记为AI生成的内容的比例。 我们使用消费级产品(Grammarly、Apple Intelligence 以及 Google Docs 中的 Gemini)和前沿大型语言模型(Opus 4.8、Gemini 3.1 和 GPT-5.5),对来自 ELLIPSE、PELIC 和 ICNALE 的学生写作进行轻微修改。 例如,我们使用苹果Pages文字处理器中内置的“写作工具”功能对部分文本进行“校对”,或提示Opus 4.8“在保持草稿明显具有人类写作风格的同时,修正轻微的学术风格问题”。

在一段来自异构混合文档的摘录上,Pangram 3 与 Pangram 4 的对比。Pangram 4 能够以更精细的粒度检测 AI。在一段来自异构混合文档的摘录上,Pangram 3 与 Pangram 4 的对比。Pangram 4 能够以更精细的粒度检测 AI。

接下来会发生什么

我们很高兴向大家推出这款机型,并相信它是目前同类产品中全球最出色的。不过,我们还有几个目标。

首先,我们希望在数据漂移演变成问题之前就主动加以应对。目前尚不清楚2022年之前的训练集还能在多长时间内继续满足我们标准所要求的、能够生成稳健预测模型的需求,因此,寻找方法来扩充我们由人工标注的训练集是当务之急——但当然,这绝不能影响我们对每份用于训练的有机文档都提供人工标注的真实值这一保证。

接下来,我们希望确保 Pangram 4 的预测结果在不同上下文中保持稳定。有时,较长文本中的某个子集会因处于孤立状态还是嵌入到周围文档中而获得不同的预测结果。这种情况可能反映了额外上下文如何为模型提供更多信息或更强的信号,但我们希望通过更好的校准来尽量减少这种影响。

最后,我们希望继续推进可解释性研究,以加深对特征归因、嵌入空间以及生成器识别的理解。这是我们最具雄心壮志的研究项目之一,我们期待在未来几个月内分享我们的研究进展。

模特卡

详细信息请参见“Pangram 4”模型卡


安娜米卡·阿茨

安娜米卡是《Pangram》的一名撰稿人。

查看安娜米卡·阿茨的更多内容