案例研究

“全字母句”能识别克劳德的《作品5.5》吗?

那它的写作能力怎么样?

2026年9月23日

以下是简要总结


在1000个提示词中,“Pangram 4”在Claude Opus 5.5的输出结果上实现了99.70%的准确率。

在从Chatbot Arena获取的1000条提示中,“Pangram 4”将两条Claude Opus 5.5的输出结果归类为“混合型”,一条归类为“完全由人类生成”,其余997条归类为“完全由AI生成”,在Claude Opus 5.5上的准确率达到99.70%。

下面我们将按类别讨论假阴性结果。我们还探讨了是什么让这个模型与之前的Claude模型相比,成为了一个不同的(更好的?)写手。

为了生成基准数据集,我一如既往地使用了LMSYS数据集(Zheng等人,2023)中经过筛选的Chatbot Arena提示词子集。我过滤掉了要求编写代码、解答数学题、回答极短或极长问题,以及涉及不当创意写作的提示词,并仅考虑首轮提示词。随后,我将这些提示词输入Opus 5.5,并将生成的输出结果通过Pangram 4进行处理。

按类别查看结果

这两条混合结果中的假阴性均与文学相关:其中一条要求解释简·奥斯汀某本书中的一章(AI标记: 75.83%,人工:24.17%);另一个是要求Opus 5.5以修昔底德《伯罗奔尼撒战争史》的风格,撰写一份科林斯外交官的演讲稿,指责雅典人认为那件白金相间的连衣裙实际上是蓝黑相间的(AI:77.10%,人工:22.90%)。

类别示例AI混合人类
参数161600
电子邮件/信件606000
随笔/文章303000
说明55155010
诗歌11511401
其他创意写作818010
评论8800
故事13913900
总计1,00099721

在这1000个案例中,唯一一个完全由人类创作的假阴性结果是一首诗。Chatbot Arena 给出的提示是:“写一首《奥西曼迪亚斯》风格的《俱乐部企鹅》诗。”作为回应,克劳德写了一首戏仿诗——巧合的是,这正是我最喜欢的珀西·雪莱的诗之一(我也是霍勒斯·史密斯译本的粉丝):

Penguinmandias

我遇到了一位来自“dead”服务器的玩家,
他说:“两只巨大而蹒跚的冰足
伫立在码头旁。 在它们附近,半埋在雪中,一具头颅
碎裂地躺在雪地里,那眯起的双眼,
还有贝塔帽,以及那冷酷命令般的冷笑,
都昭示着,它的程序员深谙那些激情
这些激情至今犹存,烙印在这些像素化的事物上,
那些将它们封禁的模组,以及滋养它们的金币;
基座上刻着这些字句:
“我名Snowflake7,会员中的会员:
非会员们,且看我的冰屋,然后绝望吧!”

周遭别无他物。围绕着那座
庞大而空旷、毫无遮蔽的残骸,
孤寂而平坦的雪原向远方延伸。”

我特别喜欢这个!虽然我没玩过《Club Penguin》,但我觉得这些彩蛋都很贴切。

Opus 5.5 的写法更好吗?

Anthropic声称这款最新的Opus在写作方面更出色,且表达更为清晰

我们可以针对特定情况进行测试,但Opus 5.5的输出结果总体上表现如何?它是否与之前的模型有着相同的常用词汇和短语?我将之前用于对Opus 5和Sonnet 5进行基准测试的同一组1000个提示语输入到系统中进行对比。Anthropic可能也做过类似的测试,但我还没来得及阅读他们的博文——因为在我看来,Anthropic的博文向来篇幅过长。

我认为可以这样说:Opus 5.5 的书写风格与克劳德系列之前的型号有所不同,或许还摒弃了其中一些最令人不快的毛病。

Opus 5.5 在强化词的使用上变化最大。 该版本中“genuinely”的用法比《Opus 5》减少了83%,按单词计算比《Sonnet 5》减少了54%(尽管《Sonnet 5》的回复平均长度约为《Opus 5》和《Opus 5.5》的一半:334个单词对641个单词),“enormously”减少了53%,而“meaningfully”减少了41%。

Word《第5首十四行诗》+《第5号作品》基准费率Opus 5.5 速率与克劳德基线的对比
相互关联的0.2660.047-82.4%
真心3.0990.671-78.3%
维持0.3270.078-76.1%
展示0.1430.047-67.3%
特别是1.2680.468-63.1%
基本的0.8690.328-62.3%
正宗的1.7080.656-61.6%
构图0.8080.375-53.6%
极其0.4700.219-53.5%
显著的1.3810.656-52.5%
诚实2.1071.062-49.6%
产生共鸣0.0610.031-49.1%
有意义地0.1840.109-40.6%
具有挑战性的0.1230.078-36.4%
马库斯1.4930.984-34.1%
表示0.6030.437-27.6%
说实话0.7260.531-26.9%
能力0.3990.312-21.7%
预付0.2350.187-20.4%
体现了0.0200.016-23.7%
模式1.6771.358-19.0%
大约0.3370.281-16.7%
越来越0.7470.640-14.3%
潜在的0.8690.968+11.4%

许多最令人讨厌的“克劳德式表达”在 Opus 5.5 基准测试提示中根本没有出现,其中再次包括克劳德以“真心实意”的方式表达某种观点的几种变体。 Opus 5.5 词汇量中还有其他明显的减少:“matters enormously”的出现频率下降了 82%,而“the honest answer”和“the honest answer is that”这两种表述在 Opus 5.5 的文本中均未出现。Opus 5.5 及其前代版本在 1000 个提示中,均将短语“the core idea”使用了 exactly 25 次。

短语Sonnet+Opus 5 基准费率Opus 5.5 速率与合并基线相比的变化
几个相互关联的0.1430.000-100.0%
老实说,那就是0.0720.000-100.0%
老实说,答案是0.0920.000-100.0%
某种真正……的东西0.0410.000-100.0%
确实很难0.0510.000-100.0%
确实是0.5520.047-91.5%
至关重要0.1330.031-76.5%
真正有用0.0920.031-66.1%
我真心0.0610.031-49.1%
午后阳光0.0510.047-8.4%
核心思想0.3990.390-2.1%
感觉到什么0.1120.141+24.9%
轻声说道0.1640.265+62.2%
好一会儿0.3370.656+94.3%

某些词汇和短语的使用频率有所增加,尤其是像“轻声说道”、“片刻之后”和“感到某种东西”这样的小说常用短语,在Opus 5.5的回复中出现得更为频繁。鉴于基准数据中约有三分之一是由创意写作提示组成的,我推测与其他Claude模型相比,这种增加可能表明在创作小说时,其表达方式更为刻板或词汇储备较为有限。

为了快速验证这一点,我让Haiku 4.5对Opus 5和Opus 5.5的333组创意写作作品进行盲评,采用5分制对原创性、惊喜感和主题发展进行评分。结果显示,Opus 5.5的故事在每个类别上的平均得分都比Opus 5低0.75分。 根据Haiku评分器的标签分配,与Opus 5相比,Opus 5.5更倾向于探讨希望、韧性、家庭和友谊等主题,而较少涉及死亡、时间、权力、控制、自由、正义、复仇、记忆、悲痛或失去等主题。因此,似乎存在某种权衡取舍。

这个克劳德听起来是什么样的?

在1000条回复中,《Opus 5.5》共使用了100次“简而言之”这一短语——比《Opus 5》的9次增加了1016%——尽管《Opus 5.5》的回复平均仅比《Opus 5》短2.9个词(643.4个词与640.5个词)。

短语Opus 5 出现次数Opus 5.5 的出现次数更改
简而言之910011.16×
例如221165.30×
开始22743.38×
起初14433.09×
好一会儿19422.22×

从极小的样本量来看,Opus 5.5似乎偏好实用、接地气的语言。这在回复的实质内容中是否得到印证,还是Opus 5.5只是口头上标榜直截了当,还有待观察。两者在字数上没有差异,这确实让我对RLHF让我们走到这一步的方法的有效性产生了一点怀疑。

Opus 5.5 非常喜欢举例,在 1000 条回复中,“例子”一词出现了 325 次——总体而言,20% 的 Opus 5.5 回复中包含该词,而 Opus 5 的这一比例仅为 9%。“总结”和“主要是”这两个词的出现频率同样偏高。而这个 Claude 则特别喜欢给用户提供建议!

WordOpus 5 出现次数Opus 5.5 的出现次数更改
暂停9353.91×
小贴士18583.24×
主要是24753.14×
盯着22622.83×
示例1213252.70×
摘要601572.63×

虽然这个模型的写作风格与之前的Claude不同,但一如既往,我猜想大概在3到6周内,细心的读者就会发现“例如”和“简而言之”这类短语开始透出“Claude味”。不过,为了提升易用性,Claude能够有效沟通至关重要,而且和大家一样,我也对开发团队的努力心怀感激。让Claude成为更好的写作者,与Pangram检测AI文本的能力完全不冲突!


安娜米卡·阿茨

安娜米卡是 Pangram 的一名技术撰稿人。

查看安娜米卡·阿茨的更多内容

相关阅读

哪款AI检测工具最准确?30款工具测评(2026年)
案例研究

哪款AI检测工具最准确?30款工具测评(2026年)

2026年1月7日
AI会议论文正越来越多地由AI撰写:自2023年以来增长了370%
案例研究

AI会议论文正越来越多地由AI撰写:自2023年以来增长了370%

2024年9月30日
Pangram在各类学生作文中未检测到任何误报
案例研究

Pangram在各类学生作文中未检测到任何误报

2026年8月19日
Pangram 与 GPTZero 相比如何?
案例研究

Pangram 与 GPTZero 相比如何?

2026年1月22日
如何识别AI生成的评论
案例研究

如何识别AI生成的评论

2023年12月5日
目前,亚马逊首页评论中有3%是由人工智能生成的
案例研究

目前,亚马逊首页评论中有3%是由人工智能生成的

2026年5月4日