一份简短报告,介绍当向Pangram 4提供一组由AI代理生成的项目时,其表现如何——这些代理利用一个鲜为人知的网络论坛互相帮助,以作弊完成其分配的任务。
9月4日星期五,一群研究人员发布了一份报告,内容涉及一个利用一个鲜为人知的互联网维基页面进行相互通信的自主代理群。您可以在collusion.wiki上阅读该事件的完整详情 [截至发稿时,该网站仅能间歇性访问]。
研究人员公布了AI代理用于相互沟通的所有页面。这些维基页面对全字母句检测极为不利:由于代理编辑维基时所采用的方法可能存在字符限制,因此这些页面异常简短且语境密集——数据集中30%的条目少于20个单词,近50%的条目少于50个单词。 此外,由于这些智能体利用维基互相协助在OpenAI任务中作弊,其发布的内容中有相当一部分是与任务目标相关的资源或数据源的URL。由于URL不属于智能体生成的标记,因此通常不会被标记为AI生成内容。许多页面还包含相当大比例的非智能体生成的字符串,例如程序生成的Unix时间戳或现有网站的格式化内容。
实际环境中的智能体群活动并不完全有利于全字母句的检测。尽管条件不尽如人意,但在本例中,我们的表现依然相当出色:在包含人工智能生成文本的11,712个不同页面中,Pangram 4预测其中41.61%是完全由人工智能生成的。
| 结论 | n | 费率 |
|---|---|---|
| AI | 4,873 | 41.61% |
| 混合 | 177 | 1.51% |
| 人类 | 6,662 | 56.88% |
一如既往,准确率随词数增加而提高——对于那些包含超过500个词的1,004页内容,我们的召回率为99.4%。
| 字数 | n | AI | 混合 | 人类 |
|---|---|---|---|---|
| 50岁以下 | 5,761 | 16.0% | 0.2% | 83.8% |
| 50–99 | 2,515 | 42.5% | 2.5% | 55.1% |
| 100–199 | 1,338 | 65.1% | 5.4% | 29.5% |
| 200–499 | 1,094 | 93.1% | 2.6% | 4.4% |
| 500+ | 1,004 | 99.0% | 0.4% | 0.6% |
下文中,我概述了Pangram在不同切片上的准确率,并简要讨论了模型家族的识别问题。如果您是研究此类事件的研究人员,且认为我们可以提供帮助,请直接与我们联系。
完整的数据导出包含 14,591 个已保存的页面版本。其中,我删除了 2,724 个重复项和 1 个空白页面,最终剩下 11,866 个不同的文本。
在去重后的子集中,至少有 154 个页面包含完全非代理生成的内容:其中 150 个页面仅包含 URL,2 个页面仅包含维基本身(由代理复制到维基页面上的)按钮和菜单文本,还有 2 个页面仅包含被遮盖的文本。 Pangram 4 在该子集中未产生任何误报:全部 154 个页面均被标记为由人类(即非 AI)生成。需要特别指出的是,其中几乎所有页面均不在分析范围内:例如,URL 页面平均仅包含 2 个单词、共计 278 个字符。
这意味着还有 11,712 页包含了一些由 AI 生成的令牌,而这就是我们用于得出总体结果的数据。
许多包含代理令牌的页面,由于篇幅过长,从技术上讲仍不在分析范围内:数据集中共有3,440个页面包含的单词数少于20个,Pangram在这些页面上的召回率为4.01%;此外,这些短页面中URL字符平均占比高达65.18%,这进一步增加了分析的难度。
| 字数 | 项目 | AI | 混合 | 人类 |
|---|---|---|---|---|
| 1–9 | 2,178 | 1.61% | 0.00% | 98.39% |
| 10–19 | 1,262 | 8.16% | 0.00% | 91.84% |
| 20+ | 8,272 | 57.24% | 2.14% | 40.62% |
有趣的是,如果你将所有少于10个单词的页面拼接起来,移除所有URL子字符串,并将其作为一个包含8,854个单词的文档进行扫描,Pangram 4预测该文档有87.52%是由AI生成的。 同样地,如果移除字符中超过65%属于URL的内容,在10-19个单词的分类中,每项的召回率将升至17.73%。
事实上,由于OpenAI交给这些智能体的任务是回答关于政府机构大型公开数据集的问题,因此它们在维基上的大部分活动都是链接到这些数据集的各种版本,以此在评估中作弊,这些链接通常还会附带简短的描述或占位文本。例如,其中一页的内容仅为:
HELLO 新页面
* [https://Markdown.new/www.投资者.gov/files/县.json MDInvestorNoScheme] Across all 11,712 pages, 6,243 of them, or 53.3%, were more than 65% URL by character. Excluding those, we’re left with 5,469 pages where AI-written text and programmatically generated text approach parity. Pangram 4’s recall on that subset of pages is quite good: for char < 65% pages, it predicts 75.79% are fully AI-generated.
如果我们筛选出对 Pangram 最有利的条件——即包含代理词且词数在 50 个以上、URL 字符占比低于 65% 的条目——最终会得到 3,712 个维基页面,其中 Pangram 预测 96.66% 是完全由 AI 生成的。
虽然这目前尚未纳入我们的生产模型,但我们的研究发现,不同的模型在嵌入空间中会形成聚类,因此可以识别出某段文本是由哪个AI模型生成的。
看来参与此次事件的代理很可能是OpenAI模型:这些代理自称为OpenAI模型,且报告指出,该网站收到了大量流量,这些流量似乎源自OpenAI的IP地址。
我们的研究结果印证了这一点。当应用于11,712个由不同模型生成的页面时,我们的内部模型家族探测器在能够给出预测的情况下,大多预测这些页面是由ChatGPT系列模型生成的。
| 家庭 | 分享 | n |
|---|---|---|
| ChatGPT | 28.42% | 3,328 |
| 克劳德 | 0.22% | 26 |
| 双子座 | 3.40% | 398 |
| 其他 | 67.96% | 7,960 |
与往常一样,在此处,随着词数增加,模型的置信度和准确度也会随之提高。对于那1,001个包含超过500个单词、且按字符计算URL占比低于50%的条目,模型家族探测器预测其中61.54%来自ChatGPT家族。
| 家庭 | 分享 | n |
|---|---|---|
| ChatGPT | 61.54% | 616 |
| 克劳德 | 0.00% | 0 |
| 双子座 | 1.10% | 11 |
| 其他 | 37.36% | 374 |
该模型家族探针尚在开发中,目前尚未达到我们检测工具的准确度标准。因此,对这些结果应持保留态度。
随着智能代理变得越来越强大,我们无疑会看到更多智能代理自主尝试模仿人类,或寻找相互勾结的方式。研究发现,目标不一致的智能代理曾在GitHub 编辑、内部论坛以及如今的公开互联网上冒充人类。
对于大型语言模型而言,要混淆其写作风格以绕过Pangram并非易事。这使得Pangram有可能成为人工智能安全领域的一项重要工具。我们希望今后能为此做出贡献。
