根据大学理事会(College Board)的最新研究,74%的高校教师表示,学生正在使用人工智能撰写论文。
这甚至还未统计那些使用人工智能却未被发现的学生数量,该数据仅代表那些已察觉此现象的教师。
鉴于学术界中人工智能的使用如此普遍,学会识别大型语言模型(LLMs)的特征并核实学生写作的真实性,已不再是可有可无的选择。 这催生了AI论文检测工具——无论好坏,它本质上又是另一种LLM,声称能帮助识别AI使用情况,但效果往往好坏参半。
今天,我们将探讨什么是AI论文检测工具、它如何运作,以及能否通过它成功验证学生的写作。
AI作文检测工具是一种软件工具,用于扫描一篇写作作品(此处指学生作文),以查找是否存在使用AI的迹象。其目的是确认学生在撰写该作文时未借助大型语言模型(LLM)的帮助,在某些情况下,还会检查常见的拼写和语法错误。
“作文检测工具”这一术语涵盖了两项不同的功能,在评估任何工具之前,最好先将它们区分开来。
第一类论文检查工具通过检查语法、表述清晰度、结构和引用情况,帮助作者改进草稿。这类工具在课堂上基本没有争议。
常见的写作改进检查工具包括:
第二类论文检测工具用于验证文本的来源。这包括检测AI生成的文本(即文本是否由机器生成),有时还会检测剽窃行为。
此类工具的常见例子包括:
大多数教育工作者并不反对自动语法和拼写检查工具,因此就学术诚信问题而言,这类论文检测工具本身并非问题所在。
然而,当涉及学生利用人工智能生成整篇论文时,情况就截然不同了。正因如此,许多教育工作者开始寻求第二类论文检测工具,以帮助他们核实学生作业的真实性。
提示:一些号称能检测AI生成的文章的工具还包含“AI人性化处理”功能,这使得使用AI的用户能够轻松地对文本进行随机化处理,使其读起来更像人类写的(尽管本质上仍是大型语言模型生成的内容)。这一功能与您作为教育工作者所追求的目标背道而驰,因此请避免使用提供此功能的工具。
我们经常看到这个问题,而且这两者很容易被混淆。不过,AI论文检测工具与抄袭检测工具之间的区别其实很简单:它们解决的是两个不同的问题。
AI论文检测工具会询问“这是由AI撰写的吗?”,并给分析人员一个分数,表明该问题的答案为“是”的可能性有多大。 它不会告诉你任何AI文本的来源,只是表明该文本是由大型语言模型(LLM)生成的。
另一方面,抄袭检测工具则会询问“这篇文章是否抄袭自现有来源?”,并在数百万篇文章、网站、论坛和数据库中查找近乎逐字逐句的匹配内容,并向分析人员提供高亮标注以展示其检测结果。
如果你是一名教师,想必已经意识到这两者都有其必要性。虽然二者存在一定重叠(AI可能会基于其训练数据进行剽窃),但各自满足着不同的需求。在此情境下,学生可能通过两种方式试图规避作业而非真正完成它,而针对这两种情况,也有相应的两种不同解决方案。
在人工智能检测领域,准确率并非一个单一的数值,也没有任何工具能做到100%准确。任何人工智能检测工具是否“有效”,取决于以下两个因素:
一张对比AI作文批改工具“命中率”和“误报率”的信息图。
误报是教育工作者的一大担忧,因为提出任何学术不端行为的指控都可能带来风险,而若基于误报做出指控,可能会导致学生被错误地判为不及格,甚至被开除。
大多数检测工具都存在检测盲区。 对于所有AI检测解决方案而言,短文本和经过大量编辑的文本都是最难分析的,对于基于困惑度的分析工具而言更是如此。
正因如此,Pangram经第三方验证的假阳性率(FPR)仅为0.01%,使其成为高等教育领域中值得信赖的检测工具。我们采用的神经网络检测技术能够有效应对改写工具和人性化处理工具,因此您可以放心,出现假阳性的可能性已降至最低。
使用人工智能撰写论文虽不完全等同于剽窃,但大多数大学将其视为一种相关的学术诚信违规行为。原因归根结底在于学术诚信政策对违规行为的定义。
“剽窃是指将非自己原创的想法、研究成果或文字冒充为自己的行为。 剽窃的例子包括:复制他人或AI工具的原文或图像,却未使用引号和引用格式来标明来源。”
-纽约市立大学
根据包括密歇根大学和牛津大学在内的许多对剽窃的定义,其核心在于提交了非自己完成的作业。
使用大型语言模型(LLM)生成文本,意味着你正在利用人工智能预测可能的词序来完成作业,这与自己完成作业有显著区别。当学生提交此类作品时,他们实际上是将他人的作品冒充为自己的,这符合剽窃的普遍定义。
既然我们已经弄清楚了什么是AI论文查重工具以及它是如何工作的,接下来就来谈谈如何通过一套经得起审核的流程来审阅一篇论文。
一张展示检查论文是否涉及AI的四个步骤的图片。当然,你的第一步是使用AI检测工具对这篇作文进行检测。你可以通过快速复制粘贴来完成,也可以直接在学习管理系统(LMS)中对已上传的作业进行检测。
Pangram 提供了Chrome 扩展程序以及与 Canvas/Blackboard 的集成功能,因此你无需导出学生的写作内容即可进行批改。不过,如果你更喜欢那种工作流程,那就尽管用吧!
运行文本分析后,您将获得一个评分。该评分并非“是”或“否”的二元结果,而是以量表或百分比形式显示该文本由大型语言模型(LLM)生成的可能性。这更多是供您初步判断的参考指标,而非任何形式的最终裁决。
如果文章的评分明确显示为100%由人类撰写,您可以继续下一步。 但如果得分较低,则表明需要进一步审查。
对于检测出一定比例AI内容而退回的论文,此时正是需要进一步审查的阶段。这也是严格检测工具与其他工具拉开差距的关键所在。
在这一阶段,Pangram(例如)可以突出显示论文中包含AI模式的具体段落。 您可以查看标记出现的位置、触发原因,以及是三句话引发了问题,还是整篇论文都受到怀疑。
如果您需要向学生或学术诚信委员会解释您的推理过程,这种精细的分析将大有帮助。
最后,你应该始终将任何被标记的段落甚至整篇作品与该学生的以往作品及其写作风格进行对比。
你正在分析的作品与以往的作品是否一致?它听起来是否与学生在考试或作业中的写作风格不同?这些问题的答案将有助于你形成判断。
在整个讨论过程中,请记住,AI检测工具的评分只是整个判断过程中的一环。
对于任何人来说,在选择人工智能论文检测工具时,首要考虑的应是准确性。如果该工具错误地将人类创作的作品标记为AI生成,不仅对任何人都无益,甚至可能造成很大危害。
如何避免这种情况?
在评估潜在的人工智能论文检测工具时,请关注以下六点:
如果你能找到一款通过这六项检测的检测工具,你就知道自己正在评估的是一款名副其实的高质量工具。
对在论文中使用人工智能以及如何识别人工智能生成的内容还有疑问吗?我们为您解答。
从技术上讲,确实有几款工具提供免费的AI论文检测功能,但这通常意味着在字数、每月检测次数或分析深度方面存在限制。
理论上听起来不错,但这些限制往往伴随着更高的误报率,这使得检测结果在维护学术诚信方面实用性较低。
一篇论文检测工具通常在检测率较高且误报率接近于零时,才能发挥良好效果。如果你正在评估的检测工具未公开其检测方法,请保持警惕。那些将相当一部分人类撰写的文章误判为AI生成的(或反之)工具,其运作方式对用户毫无帮助。
你当然可以找到免费的AI论文检测工具(在谷歌上搜索一下就能找到几十种),但这并不意味着它就能按你期望的方式运行。在信任任何工具之前——无论是否免费——请务必确保该工具已通过信誉良好的第三方机构的独立测试和验证。
归根结底,如果您需要对学生的写作进行查重,就必须确保所使用的任何工具都能提供值得信赖的结果。正因如此,我们对Pangram仅0.01%的误报率倍感自豪:这让教育工作者和学术管理者能够充满信心地采取有依据的措施。
想在学生的作业中试用一下吗?立即安装Pangram Chrome扩展程序,今天就在您的学习管理系统(LMS)中检查论文吧。

Destiny 是 Pangram 的研究分析师实习生。她目前就读于纽约市立技术学院,主修应用数学和化学。Destiny 在 Pangram 的工作为调查互联网上的 AI 垃圾内容做出了巨大贡献。在工作和学业之余,Destiny 热衷于创意写作和恐怖小说创作。