案例研究

Pangram在各类学生作文中未检测到任何误报

Pangram 4 在 PERSUADE 2.0 语料库中的全部 25,996 篇人工撰写的作文中均未产生任何误报,涵盖了按残疾状况、性别、年级、族裔、英语学习者(ELL)身份以及经济困难状况划分的所有子群体。

2026年8月19日

以下是简要总结


我们在包含各类学生作文的PERSUADE 2.0数据集上对Pangram 4进行了评估,结果显示在全部25,996篇作文中未发现任何误报。在所有已报告的子组中,Pangram均未产生任何误报。

了解Pangram在不同类型作者群体中的表现至关重要。虽然包含作者人口统计信息的人工撰写文章数据集并不容易获得,但评估Pangram在不同类型作者(包括残障学生、有色人种、非英语母语者以及经济困难群体)所撰写文本中的表现,对于理解该模型是否公平对待每一位作者而言至关重要。

PERSUADE 数据集有助于解决这一问题。PERSUADE(全称“用于评分、筛选和理解论证与话语要素的说服性文章”)旨在推动开发无偏见的学生写作评估算法,是一个包含近 2.6 万篇美国初中和高中学生于 2010 年至 2020 年间撰写的标注文章的数据集。 该数据集涵盖了来自不同背景和能力水平的学生,每篇作文都标注了作者的基本信息,例如年级、性别、族裔和社会经济背景。

PERSUADE数据集为评估Pangram提供了绝佳的机会,原因有二。首先,Pangram并未使用PERSUADE数据集进行训练,因此我们可以利用该数据集来测试Pangram对先前未见过的学生写作的泛化能力。其次,PERSUADE的人口统计数据——包括来自弱势群体的写作样本——使我们能够考察Pangram在不同人口统计群体中的表现是否公平。

关键结论:我们在包含各类学生作文的PERSUADE 2.0数据集上对Pangram 4进行了评估,结果显示在全部25,996篇作文中未出现任何误报。我们还按残障状况、性别、年级、种族和族裔、英语学习者身份以及经济困难状况对结果进行了分析。在所有报告的子群体中,Pangram均未产生任何误报。

下文详细说明了研究人员如何定义PERSUADE数据集中的各项人口统计特征,并列出了各组所包含的论文数量。

残疾

在 PERSUADE 2.0 数据集中,残疾状况指的是拥有《个体教育计划》(IEP)或《第 504 条计划》的学生,其中可能包括患有各种学习障碍或健康问题的学生。

nFPR
被认定为残疾人2,6880%
未被认定为残疾人18,1350%
缺失/未报告5,1730%

性别

PERSUADE数据集中的性别信息基于自我申报,男女比例大致为五五开。Pangram在两个性别组中均未观察到任何误报。

nFPR
女性 (F)13,1420%
男性 (M)12,8540%

年级

Pangram 4 在所有观察到的年级水平上均未出现任何误报,这表明 Pangram 在应对多种不同写作水平时都表现出了很强的鲁棒性。

nFPR
六年级1,3720%
8年级9,6290%
9年级2,0660%
10年级8,2740%
11年级3,0830%
12年级4040%
缺失/未报告1,1680%

族裔

在PERSUADE数据库中,大多数作家自认为白人(45%),其次是西班牙裔(25%),然后是黑人(19%),这大致反映了美国学生群体的人口分布情况。

nFPR
白色11,5710%
西班牙裔/拉丁裔6,5600%
黑人/非裔美国人4,9590%
亚裔/太平洋岛民1,7430%
两个或多个种族/其他1,0220%
美洲印第安人/阿拉斯加原住民1410%

英语学习者(ELL)身份

尽管早期的一些研究曾表明,旧版的人工智能检测程序可能对将英语作为第二语言的人群以及英语学习者存在偏见,但Pangram在检测这些作者时几乎没有表现出任何偏见,且在PERSUADE数据集中,针对英语学习者(ELL)的观察到的假阳性率(FPR)为0%。

nFPR
ELL2,2440%
非英语学习者22,4510%
缺失/未报告1,3010%

经济上的不利处境

在 PERSUADE 语料库中,经济困难的定义是指学生是否符合获得某些联邦援助的资格,例如免费或减价学校午餐以及补充营养援助计划。

nFPR
经济上处于劣势9,6430%
可能不属于经济困难群体11,1160%
缺失/未报告5,2370%

结论

在PERSUADE 2.0语料库中的全部25,996篇由人类撰写的作文中,Pangram 4在所有子群体(包括残障状况、性别、年级、族裔、英语学习者身份以及经济困难状况)中均未产生任何误报。这一结果表明,Pangram能够很好地推广到多样化的作者群体,且不会将这些作者的作品过分地误判为AI生成的内容。

我们的目标是尽可能减少所有作者群体中的误报,因此持续评估至关重要。然而,在 PERSUADE 2.0 的范围内,Pangram 4 在每个人口统计学亚组中均未出现误报。

参考文献


凯瑟琳·泰
凯瑟琳·泰创始人工智能研究科学家

凯瑟琳·泰(Katherine Thai)是人工智能检测初创公司Pangram Labs的创始人工智能研究科学家。她于2025年12月在马萨诸塞大学阿默斯特分校,在莫希特·伊耶(Mohit Iyyer)的指导下获得了计算机科学博士学位,其研究主要致力于评估大型语言模型(LLMs)在文学分析相关任务中的表现。

更多来自凯瑟琳·泰的内容
安娜米卡·阿茨

安娜米卡是 Pangram 的一名技术撰稿人。

查看安娜米卡·阿茨的更多内容