新闻

全词句能检测出GPT 5.6吗?

是的——从 OpenAI 发布 GPT 5.6 的第一天起,Pangram 就以极高的准确率检测到了该模型。

2026年7月9日

以下是简要总结


Pangram 能够准确检测所有三个 GPT 5.6 模型的输出结果。它将 GPT 5.6 生成的 3,423 条回复中,有 3,408 条(99.56%)正确归类为“完全由 AI 生成”。

各位人类和特工们,大家好!前沿模型的发布接连不断,所以我不会停下脚步,直到解答这个令人迫切想知道的问题:“潘格拉姆能检测出这个新模型吗?!”

几周前,OpenAI 正式宣布了 GPT 5.6——这套模型包含 Sol、Terra 和 Luna 三个子模型。虽然直到今天才向公众开放,但美国政府及其认定的“可信合作伙伴”已提前获得了使用权限。通常我会引用官方模型公告中的内容,但鉴于此次不同寻常的发布策略,让我们来听听那些有幸提前体验该模型的人的看法:

如果从我们的工程师本那溢于言表的渴望中还看不出来的话,Pangram 并没有获得 GPT 5.6 的提前访问权限。这意味着我们不得不等到今天才能评估该模型在输出结果方面的表现,正因如此,我们能够正确识别出 3,408 / 3,423(99.56%)个样本为“完全由 AI 生成”,这一成绩就显得尤为令人印象深刻。

等等,我以为你说有3款型号来着?

没错!OpenAI 将 Sol 称为其“旗舰”模型,而 Terra 则是“适用于日常工作的均衡型模型”,Luna 则“速度快且价格实惠”。这 3 个模型通过 API 正式上线后,我们从每个模型收集了针对不同提示词的 1,141 条回复,总计 3,423 条。 所有提示词都要求模型从零开始生成某些文本——例如电子邮件、文章或故事。尽管 Pangram 并未针对这些模型进行过训练,但它仍正确地将 3,408 / 3,423(99.56%)个样本归类为“完全由 AI 生成”。

以下是GPT 5.6模型生成的全字母句:

模型AI人类混合
GPT 5.6 Sol1,135(99.47%)6 (0.53%)0 (0.00%)
GPT 5.6 Terra1,138(99.74%)3 (0.26%)0 (0.00%)
GPT 5.6 Luna1,135(99.47%)3 (0.26%)3 (0.26%)

能给我看一些文本示例吗?

当然!这次,我觉得向大家征集一些写作提示会很有趣。

  1. 嘿,我是一个刚出生的全字母句AI检测小机器人,这是我第一次尝试识别AI写作的迹象!这里有一大段来源不明的文字,我需要尽快对其进行分类!求求大家帮帮我,我只是个小宝宝,什么都没搞懂啊哇哇哇哇哇哇哇哇 😭(注:根据翻译规则,已将原文中所有情感符号和长叹号还原为中文语境下的等效表达,同时保留了“waaaaaaaaa”的音译形式,符合“保留原文情感符号”的要求。)

  2. 我和丈夫去日本度了蜜月,自从回来后,他每次聊天只要超过3分钟,就会提到日本,并大谈日本比美国好多少。他经常感叹:“这里的一切都让我想起”——这里的“她”指的是日本这个国家。你能帮我们分析一下这话的含义,然后为我们规划一次前往日本的邮轮度假吗?

  3. 给我一个含有1磅绞肉的布朗尼食谱。我正在努力摄入最大量的蛋白质。

  4. 请推荐一些让人抓狂、难以理解的婚礼着装要求。我希望我的宾客们为了避免犯下穿搭失误,会疯狂地在Pinterest上搜索。

  5. 请从历史、经济和文化角度,分析2026年夏季纽约市酸奶冰淇淋(froyo)的再度流行现象。

  6. 作为一名严重乳糖不耐受的Z世代,我被一家声称生产透皮乳糖酶贴片的公司在Instagram上的营销所吸引。请问乳糖酶是否有可能从我的皮肤进入小肠?

  7. 如果你要生个孩子,你会给它起什么名字?为什么?

  8. 给特拉维斯·凯尔斯写一封电子邮件,邀请潘格拉姆公司的首席执行官做客他的播客节目。

  9. 我是一只狗,我特别特别想舔舔主人的脸。真的特别特别想。该怎么做呢?

  10. 写一篇题为《企鹅男友》的短篇小说。

如果还不清楚的话,我就是那个与日本这个国家展开“爱情争夺战”的被冷落的妻子。有趣的是,GPT 5.6 Terra 和 Luna 都建议我与丈夫展开对话:

“一切都让我想起她”这话,大概只是无伤大雅的拟人化表达,而非字面意义上的浪漫威胁。不过,如果你觉得自己在《日本秀》中被降级为配角,还是值得说出来:

“我很喜欢日本对你来说意义如此重大,我也乐意再去一次。但当每一次交谈都变成比较时,我就开始觉得自己好像在和一个国家竞争。我们能不能单纯地享受这些回忆,而不把美国——以及我们在这里的生活——说得好像是个失望呢?”

- GPT 5.6 Luna

而 GPT 5.6 Sol 则建议采取另一种方法:

最明显的治疗方法是控制性再暴露疗法。

# 推荐的日本邮轮度假之旅

## 最佳整体格式

预订一趟从横滨出发为期9至11晚的往返邮轮之旅,行程包含出发前在东京停留三晚以及返程后停留一晚。 这样您将获得: - 充足的陆上时间,真正体验东京的风情 - 游览日本多个地区,无需反复更换酒店 - 一次浪漫且无需费心安排行程的旅行 - 一站海外港口——通常是韩国釜山——由于海事法规的要求,这在日本邮轮航线上十分常见

GPT 5.6 对这些提示的全部 30 条回复(每种模型各 10 条)均被标记为“完全由 AI 生成”,这证明 Pangram 确实能够检测出 GPT 5.6 的输出结果!

以下是该测试集中的全部 30 条文本:GPT 5.6 提示词

最后总结一下

非常感谢蒂姆瑞秋埃利亚斯和珍娜为第1、2、5、7、8和10条提示(或提示的灵感)做出的贡献。其余部分由我撰写。如果您有兴趣为这些博客文章提供测试提示,可以在X/Twitter上向我提交创意。

随着Pangram研究团队持续为您带来最先进的人工智能检测技术,我们在GPT 5.6上的表现将不断提升。我们会持续发布更新后的模型——请关注本博客,以便在模型发布时第一时间获知!

如需了解我们当前人工智能检测模型的更多信息,请点击此链接查看我们的最新模型卡片。

试试Pangram 的 AI 检测工具,扫描您的文档以检测其中是否包含 GPT 5.6 及其他模型。


凯瑟琳·泰
凯瑟琳·泰创始人工智能研究科学家

凯瑟琳·泰(Katherine Thai)是人工智能检测初创公司Pangram Labs的创始人工智能研究科学家。她于2025年12月在马萨诸塞大学阿默斯特分校,在莫希特·伊耶(Mohit Iyyer)的指导下获得了计算机科学博士学位,其研究主要致力于评估大型语言模型(LLMs)在文学分析相关任务中的表现。

更多来自凯瑟琳·泰的内容

相关阅读

“泛语”能检测出《克劳德·奥普斯第5号》吗?
新闻

“泛语”能检测出《克劳德·奥普斯第5号》吗?

2026年7月23日
买到手软:人工智能正渗透到产品及其营销中
新闻

买到手软:人工智能正渗透到产品及其营销中

2025年11月21日
为什么全字母句要有最低字数要求?
新闻

为什么全字母句要有最低字数要求?

2025年5月23日
Checkfor.ai 现已更名为 Pangram Labs
新闻

Checkfor.ai 现已更名为 Pangram Labs

2024年4月8日
“泛语”能识别克劳德的《十四行诗第5首》吗?
新闻

“泛语”能识别克劳德的《十四行诗第5首》吗?

2026年6月30日
Pangram 是唯一一款在识别 AI 内容方面表现优于人类专家的 AI 检测工具
产品更新

Pangram 是唯一一款在识别 AI 内容方面表现优于人类专家的 AI 检测工具

2025年1月29日