不,Pangram 的模型预测并不依赖于困惑度和突发性。Pangram 是一种被称为分类器模型的神经网络。Pangram 通过使用最难分类文档的“合成镜像”进行训练,随后会反复进行重新训练。这使其能够适应新的模型,也意味着随着 Pangram 通过我们的主动学习算法积累更多人类文本的经验,它的性能会逐渐提升。
什么是困惑度和突发性?
内容摘自我们关于困惑度和突发性的博客文章——如需了解这些方法的局限性,欢迎参考该文章以获取深入解析。
https://www.pangram.com/blog/why-perplexity-and-burstiness-fail-to-detect-ai
“困惑度”是指从特定语言模型或大型语言模型(LLM)的角度来看,文本中每个词的意外程度或令人惊讶的程度。
例如,这里有两句话。为了说明问题,我们来关注每句话的最后一个词。在第一个例子中,最后一个词的困惑度较低,而在第二个例子中,最后一个词的困惑度较高。
低困惑度:
今天中午,我吃了一碗*汤*。
高困惑度:
今天午饭,我吃了一碗*蜘蛛*。
第二句的困惑度之所以很高,是因为语言模型在训练数据集中极少见到人们吃一碗蜘蛛的例子,因此对于该句以“蜘蛛”结尾,而非“汤”、“三明治”或“沙拉”之类的内容,语言模型会感到非常意外。
突发性是指文档中熵值的变化情况。如果文档中穿插着一些出人意料的词语和短语,人们就会说该文档的突发性较高。
为什么 Pangram 不使用困惑度和突发性?
使用困惑度和突发性来检测AI生成的文本存在诸多弊端。关于以下内容的深入解释,请参阅我们关于该主题的博客文章:https://www.pangram.com/blog/why-perplexity-and-burstiness-fail-to-detect-ai。 由于语言模型在训练过程中被明确训练为在训练数据上最小化困惑度,因此像《独立宣言》和维基百科条目这类被频繁复制的人类文本常会被误判为AI生成内容——随着模型摄入的网络数据越来越多,这一问题只会愈演愈烈。此外,这些指标还与特定模型相关,因此针对某个生成器校准的检测器在另一个生成器上会产生不准确的结果,而且许多商业模型根本不公开计算困惑度所需的令牌概率。 这些指标会系统性地对非英语母语者造成不利影响——由于其词汇量有限且句式结构较为简单,自然会产生较低的困惑度和突发性。最根本的是,它们属于静态启发式方法,无法像深度学习方法那样通过更多数据和计算能力来提升性能,因此无法满足高风险应用所要求的可靠性。
