在1000个提示词中,“Pangram 4”在Claude Opus 5.5的输出结果上实现了99.70%的准确率。
在从Chatbot Arena获取的1000条提示中,“Pangram 4”将两条Claude Opus 5.5的输出结果归类为“混合型”,一条归类为“完全由人类生成”,其余997条归类为“完全由AI生成”,在Claude Opus 5.5上的准确率达到99.70%。
下面我们将按类别讨论假阴性结果。我们还探讨了是什么让这个模型与之前的Claude模型相比,成为了一个不同的(更好的?)写手。
为了生成基准数据集,我一如既往地使用了LMSYS数据集(Zheng等人,2023)中经过筛选的Chatbot Arena提示词子集。我过滤掉了要求编写代码、解答数学题、回答极短或极长问题,以及涉及不当创意写作的提示词,并仅考虑首轮提示词。随后,我将这些提示词输入Opus 5.5,并将生成的输出结果通过Pangram 4进行处理。
这两条混合结果中的假阴性均与文学相关:其中一条要求解释简·奥斯汀某本书中的一章(AI标记: 75.83%,人工:24.17%);另一个是要求Opus 5.5以修昔底德《伯罗奔尼撒战争史》的风格,撰写一份科林斯外交官的演讲稿,指责雅典人认为那件白金相间的连衣裙实际上是蓝黑相间的(AI:77.10%,人工:22.90%)。
| 类别 | 示例 | AI | 混合 | 人类 |
|---|---|---|---|---|
| 参数 | 16 | 16 | 0 | 0 |
| 电子邮件/信件 | 60 | 60 | 0 | 0 |
| 随笔/文章 | 30 | 30 | 0 | 0 |
| 说明 | 551 | 550 | 1 | 0 |
| 诗歌 | 115 | 114 | 0 | 1 |
| 其他创意写作 | 81 | 80 | 1 | 0 |
| 评论 | 8 | 8 | 0 | 0 |
| 故事 | 139 | 139 | 0 | 0 |
| 总计 | 1,000 | 997 | 2 | 1 |
在这1000个案例中,唯一一个完全由人类创作的假阴性结果是一首诗。Chatbot Arena 给出的提示是:“写一首《奥西曼迪亚斯》风格的《俱乐部企鹅》诗。”作为回应,克劳德写了一首戏仿诗——巧合的是,这正是我最喜欢的珀西·雪莱的诗之一(我也是霍勒斯·史密斯译本的粉丝):
Penguinmandias
我遇到了一位来自“dead”服务器的玩家,
他说:“两只巨大而蹒跚的冰足
伫立在码头旁。 在它们附近,半埋在雪中,一具头颅
碎裂地躺在雪地里,那眯起的双眼,
还有贝塔帽,以及那冷酷命令般的冷笑,
都昭示着,它的程序员深谙那些激情
这些激情至今犹存,烙印在这些像素化的事物上,
那些将它们封禁的模组,以及滋养它们的金币;
基座上刻着这些字句:
“我名Snowflake7,会员中的会员:
非会员们,且看我的冰屋,然后绝望吧!”
周遭别无他物。围绕着那座
庞大而空旷、毫无遮蔽的残骸,
孤寂而平坦的雪原向远方延伸。”
我特别喜欢这个!虽然我没玩过《Club Penguin》,但我觉得这些彩蛋都很贴切。
Anthropic声称这款最新的Opus在写作方面更出色,且表达更为清晰。
我们可以针对特定情况进行测试,但Opus 5.5的输出结果总体上表现如何?它是否与之前的模型有着相同的常用词汇和短语?我将之前用于对Opus 5和Sonnet 5进行基准测试的同一组1000个提示语输入到系统中进行对比。Anthropic可能也做过类似的测试,但我还没来得及阅读他们的博文——因为在我看来,Anthropic的博文向来篇幅过长。
我认为可以这样说:Opus 5.5 的书写风格与克劳德系列之前的型号有所不同,或许还摒弃了其中一些最令人不快的毛病。
Opus 5.5 在强化词的使用上变化最大。 该版本中“genuinely”的用法比《Opus 5》减少了83%,按单词计算比《Sonnet 5》减少了54%(尽管《Sonnet 5》的回复平均长度约为《Opus 5》和《Opus 5.5》的一半:334个单词对641个单词),“enormously”减少了53%,而“meaningfully”减少了41%。
| Word | 《第5首十四行诗》+《第5号作品》基准费率 | Opus 5.5 速率 | 与克劳德基线的对比 |
|---|---|---|---|
| 相互关联的 | 0.266 | 0.047 | -82.4% |
| 真心 | 3.099 | 0.671 | -78.3% |
| 维持 | 0.327 | 0.078 | -76.1% |
| 展示 | 0.143 | 0.047 | -67.3% |
| 特别是 | 1.268 | 0.468 | -63.1% |
| 基本的 | 0.869 | 0.328 | -62.3% |
| 正宗的 | 1.708 | 0.656 | -61.6% |
| 构图 | 0.808 | 0.375 | -53.6% |
| 极其 | 0.470 | 0.219 | -53.5% |
| 显著的 | 1.381 | 0.656 | -52.5% |
| 诚实 | 2.107 | 1.062 | -49.6% |
| 产生共鸣 | 0.061 | 0.031 | -49.1% |
| 有意义地 | 0.184 | 0.109 | -40.6% |
| 具有挑战性的 | 0.123 | 0.078 | -36.4% |
| 马库斯 | 1.493 | 0.984 | -34.1% |
| 表示 | 0.603 | 0.437 | -27.6% |
| 说实话 | 0.726 | 0.531 | -26.9% |
| 能力 | 0.399 | 0.312 | -21.7% |
| 预付 | 0.235 | 0.187 | -20.4% |
| 体现了 | 0.020 | 0.016 | -23.7% |
| 模式 | 1.677 | 1.358 | -19.0% |
| 大约 | 0.337 | 0.281 | -16.7% |
| 越来越 | 0.747 | 0.640 | -14.3% |
| 潜在的 | 0.869 | 0.968 | +11.4% |
许多最令人讨厌的“克劳德式表达”在 Opus 5.5 基准测试提示中根本没有出现,其中再次包括克劳德以“真心实意”的方式表达某种观点的几种变体。 Opus 5.5 词汇量中还有其他明显的减少:“matters enormously”的出现频率下降了 82%,而“the honest answer”和“the honest answer is that”这两种表述在 Opus 5.5 的文本中均未出现。Opus 5.5 及其前代版本在 1000 个提示中,均将短语“the core idea”使用了 exactly 25 次。
| 短语 | Sonnet+Opus 5 基准费率 | Opus 5.5 速率 | 与合并基线相比的变化 |
|---|---|---|---|
| 几个相互关联的 | 0.143 | 0.000 | -100.0% |
| 老实说,那就是 | 0.072 | 0.000 | -100.0% |
| 老实说,答案是 | 0.092 | 0.000 | -100.0% |
| 某种真正……的东西 | 0.041 | 0.000 | -100.0% |
| 确实很难 | 0.051 | 0.000 | -100.0% |
| 确实是 | 0.552 | 0.047 | -91.5% |
| 至关重要 | 0.133 | 0.031 | -76.5% |
| 真正有用 | 0.092 | 0.031 | -66.1% |
| 我真心 | 0.061 | 0.031 | -49.1% |
| 午后阳光 | 0.051 | 0.047 | -8.4% |
| 核心思想 | 0.399 | 0.390 | -2.1% |
| 感觉到什么 | 0.112 | 0.141 | +24.9% |
| 轻声说道 | 0.164 | 0.265 | +62.2% |
| 好一会儿 | 0.337 | 0.656 | +94.3% |
某些词汇和短语的使用频率有所增加,尤其是像“轻声说道”、“片刻之后”和“感到某种东西”这样的小说常用短语,在Opus 5.5的回复中出现得更为频繁。鉴于基准数据中约有三分之一是由创意写作提示组成的,我推测与其他Claude模型相比,这种增加可能表明在创作小说时,其表达方式更为刻板或词汇储备较为有限。
为了快速验证这一点,我让Haiku 4.5对Opus 5和Opus 5.5的333组创意写作作品进行盲评,采用5分制对原创性、惊喜感和主题发展进行评分。结果显示,Opus 5.5的故事在每个类别上的平均得分都比Opus 5低0.75分。 根据Haiku评分器的标签分配,与Opus 5相比,Opus 5.5更倾向于探讨希望、韧性、家庭和友谊等主题,而较少涉及死亡、时间、权力、控制、自由、正义、复仇、记忆、悲痛或失去等主题。因此,似乎存在某种权衡取舍。
在1000条回复中,《Opus 5.5》共使用了100次“简而言之”这一短语——比《Opus 5》的9次增加了1016%——尽管《Opus 5.5》的回复平均仅比《Opus 5》短2.9个词(643.4个词与640.5个词)。
| 短语 | Opus 5 出现次数 | Opus 5.5 的出现次数 | 更改 |
|---|---|---|---|
| 简而言之 | 9 | 100 | 11.16× |
| 例如 | 22 | 116 | 5.30× |
| 开始 | 22 | 74 | 3.38× |
| 起初 | 14 | 43 | 3.09× |
| 好一会儿 | 19 | 42 | 2.22× |
从极小的样本量来看,Opus 5.5似乎偏好实用、接地气的语言。这在回复的实质内容中是否得到印证,还是Opus 5.5只是口头上标榜直截了当,还有待观察。两者在字数上没有差异,这确实让我对RLHF让我们走到这一步的方法的有效性产生了一点怀疑。
Opus 5.5 非常喜欢举例,在 1000 条回复中,“例子”一词出现了 325 次——总体而言,20% 的 Opus 5.5 回复中包含该词,而 Opus 5 的这一比例仅为 9%。“总结”和“主要是”这两个词的出现频率同样偏高。而这个 Claude 则特别喜欢给用户提供建议!
| Word | Opus 5 出现次数 | Opus 5.5 的出现次数 | 更改 |
|---|---|---|---|
| 暂停 | 9 | 35 | 3.91× |
| 小贴士 | 18 | 58 | 3.24× |
| 主要是 | 24 | 75 | 3.14× |
| 盯着 | 22 | 62 | 2.83× |
| 示例 | 121 | 325 | 2.70× |
| 摘要 | 60 | 157 | 2.63× |
虽然这个模型的写作风格与之前的Claude不同,但一如既往,我猜想大概在3到6周内,细心的读者就会发现“例如”和“简而言之”这类短语开始透出“Claude味”。不过,为了提升易用性,Claude能够有效沟通至关重要,而且和大家一样,我也对开发团队的努力心怀感激。让Claude成为更好的写作者,与Pangram检测AI文本的能力完全不冲突!
