Pangram 如何检测由人工智能生成的内容

了解Pangram是如何经过训练,以近乎零误报率检测AI生成的文本的。

01

概述

Pangram Text旨在检测AI生成的内容,其误报率接近于零。我们采用严格的训练方法最大限度地减少错误,使模型能够通过分析和理解文本中的细微线索来识别AI文本。

Pangram 的训练方式:先挖掘分类错误的人工示例,并将其与大语言模型(LLM)生成的文本进行配对,然后对模型进行重新训练。
图1.Pangram如何被训练以区分人类撰写和AI生成的文本的概述
02

初始培训流程

我们的分类器采用传统的语言模型架构。它接收输入文本并将其分词。随后,模型将每个词汇转换为一个嵌入向量,该向量由数字组成,用于表示每个词汇的含义。

输入数据经过神经网络处理,生成输出嵌入向量。分类器头将输出嵌入向量转换为 0 或 1 的预测结果,其中 0 代表人工标注,1 代表 AI 标注。

每个令牌都被转换为一个嵌入向量,并绘制在三维空间中。
图2.每个令牌都被转换为一个嵌入向量——一个代表其含义的数字向量——模型将其绘制在高维空间中(图中展示的是3D空间)。

我们基于一个规模虽小但多样性强的数据集训练初始模型,该数据集包含约100万份由公众及授权人类撰写的文本。数据集还涵盖了GPT-4及其他前沿语言模型生成的AI文本。训练结果是一个能够可靠预测文本作者是人类还是AI的神经网络。

文本经过分词处理后,通过神经网络传递到分类器头部和嵌入层,最后由软最大似然(softmax)生成预测结果。
图3.初始模型是在大约一百万份人类撰写和AI生成的文档上进行训练的
03

通过迭代实现持续改进

硬负采矿

最初的模型已经相当有效,但我们希望进一步提高准确率,并尽可能减少误报(即错误地将人类撰写的文档判定为AI生成的)。为此,我们专门为AI检测模型开发了一种算法。

在初始数据集的基础上,我们的模型缺乏足够的特征信息,无法将准确率从99%提升至99.999%。虽然模型能够快速学习数据中的初始模式,但为了精确区分人类文本和AI生成的文本,它需要接触到一些棘手的边界案例。

我们通过以下方式解决这一问题:利用模型在大型数据集中搜索假阳性结果,并在重新训练前将这些额外的困难样本添加到初始训练集之中。经过数轮迭代后,最终生成的模型不仅实现了接近于零的假阳性率,在保留集上的整体性能也得到了提升。

该模型会从大型数据集中挖掘出困难样本,并在重新训练前将这些样本添加到训练集之中。
图4.该模型从大型数据集中挖掘出“困难样本”,并在重新训练前将这些样本添加到训练集之中。

镜像提示

我们设计了数据集的人工智能部分,使其在风格、语调和语义内容上与人类部分高度相似。针对每个人类示例,我们生成一个人工智能生成的示例,该示例在尽可能多的维度上与原始文档相匹配,以确保我们的模型能够仅基于大型语言模型写作的特定特征来学习分类文档。

对于每份人类撰写的文档,我们都会生成一份在风格、语气和内容上与之相匹配的AI文档。
图5.对于每份人类撰写的文档,我们都会生成一份在风格、语气和内容上与之相匹配的AI生成的“镜像”文档。

再培训

我们使用更新后的训练集对模型进行训练,并在每个步骤评估模型的性能。通过这种方法,我们能够减少误差,并将模型的准确率提升到常规训练无法达到的水平。

对每个再训练周期进行评估,从而将误差稳步降低到常规训练所能达到的水平以下。
图6.每个再训练周期都会进行评估,从而将误差稳步降低到常规训练所能达到的水平以下。
04

了解更多

请在 arXiv 上查阅我们的完整技术白皮书,其中深入探讨了训练细节、性能及其他实验内容。

arxiv.org关于Pangram人工智能生成文本分类器的技术报告
    人工智能检测原理 | Pangram Labs