1000件のプロンプトのうち、「Pangram 4」はClaude Opus 5.5の出力に対して99.70%の精度を達成しています。
Chatbot Arenaから収集した1000件のプロンプトのうち、「Pangram 4」は、Claude Opus 5.5の出力のうち2件を「混合」、1件を「完全な人間によるもの」、997件を「完全なAI生成」と分類し、Claude Opus 5.5において99.70%の精度を達成した。
以下では、偽陰性についてカテゴリー別に考察する。また、このモデルが従来のClaudeとはどのような点で異なる(あるいは優れた?)ライターであるのかについても検証する。
ベンチマークセットを生成するために、今回もLMSYSデータセット(Zheng et al., 2023)に含まれるChatbot Arenaのプロンプトから、フィルタリングしたサブセットを使用しました。コードや数学の問題、極端に短いまたは長い回答を求めるプロンプト、不適切な創作文章を要求するプロンプトを除外し、初回ターン(first-turn)のプロンプトのみを対象としました。その後、それらをOpus 5.5に入力し、その出力をPangram 4で処理しました。
2件の「混合結果(偽陰性)」はいずれも文学に関するもので、1件はジェーン・オースティンの小説の1章についての解説を求めたもの(AIによる判定: 75.83%、人間:24.17%)の解説を求め、もう1つは、トゥキディデスの『ペロポネソス戦争史』の文体で、アテネ人が白と金のドレスを実際には青と黒だと信じていると非難するコリントの外交官の演説をOpus 5.5に執筆するよう依頼したものでした(AI:77.10%、人間:22.90%)。
| カテゴリ | 例 | AI | 混合 | 人間 |
|---|---|---|---|---|
| 引数 | 16 | 16 | 0 | 0 |
| 電子メール/手紙 | 60 | 60 | 0 | 0 |
| エッセイ・記事 | 30 | 30 | 0 | 0 |
| 説明 | 551 | 550 | 1 | 0 |
| 詩 | 115 | 114 | 0 | 1 |
| その他の創作 | 81 | 80 | 1 | 0 |
| レビュー | 8 | 8 | 0 | 0 |
| ストーリー | 139 | 139 | 0 | 0 |
| 合計 | 1,000 | 997 | 2 | 1 |
1000件のデータセットの中で、唯一完全に人間による偽陰性だったのは詩だった。Chatbot Arenaからのプロンプトは、「『オジマンディアス』のスタイルでクラブペンギンの詩を書いて」というものだった。それに対し、クロードは偶然にも、私が最も好きなパーシー・シェリーの詩(ホレス・スミスによる訳も大好きだが)のパロディを書き上げた:
ペンギンマンディアス
あるサーバーのプレイヤーに出会ったが、彼はすでに死んでいた。
その者はこう言った。「巨大でよたよたと歩く二つの氷の足
が埠頭のそばに立っている。 その近くには、半分雪に埋もれた頭が
雪の中に粉々になって横たわっている。その細めた目、
ベータ帽、そして冷徹な命令を込めた嘲笑、
それらが、そのプログラマーがそれらの情熱を的確に読み取っていたことを物語っている
その情熱は今も生き続けており、これらのピクセル化された物体に刻み込まれている――
彼らをBANしたMODや、彼らを養ったコインに;
そして台座には、こう記されている:
「我が名はSnowflake7、メンバーの中のメンバー:
非メンバーよ、我がイグルーを仰ぎ見て、絶望せよ!」
他に何も残っていない。その朽ち果てた周囲には
果てしなく、何もない、あの巨大なラグが横たわり、
孤独で平坦な雪原が、遥か彼方まで広がっている。」
これ、かなり気に入りました!『クラブペンギン』はプレイしたことがないんですが、そのネタはぴったりだと思います。
Anthropic社は、この最新のOpusの方が文章作成能力が高く、より明確に意思疎通ができると主張している。
特定のケースについて検証することも可能ですが、Opus 5.5の出力結果は全体としてどのようなものなのでしょうか?以前のモデルと同じ「お気に入りの単語やフレーズ」が使われているのでしょうか?比較のために、Opus 5とSonnet 5でベンチマークを行ったのと同じ1000個のプロンプトを実行してみました。Anthropicも同様の検証を行っているかもしれませんが、私はまだ彼らのブログ記事を読み込んでいません。というのも、これまでの経験上、Anthropicのブログ記事は長すぎると思うからです。
Opus 5.5は、クロード・シリーズのこれまでのモデルとは書き味が異なり、おそらくそれらのモデルに見られた、最も耳障りな癖のいくつかを解消していると言っても過言ではないでしょう。
『オパス5.5』は、強調表現の使用において最も大きな変化が見られた。 「genuinely」の使用頻度はOpus 5より83%減少し、単語あたりの使用頻度はSonnet 5より54%減少した(ただし、Sonnet 5の回答は平均してOpus 5および5.5の回答の約半分程度の長さであった:334語対641語)。また、「enormously」は53%減、「meaningfully」は41%減少した。
| Word | ソネット第5番 + 作品第5番 基本金利 | Opus 5.5のレート | 「Change」と「Claude」のベースラインの比較 |
|---|---|---|---|
| 相互接続された | 0.266 | 0.047 | -82.4% |
| 心から | 3.099 | 0.671 | -78.3% |
| 維持 | 0.327 | 0.078 | -76.1% |
| 実証する | 0.143 | 0.047 | -67.3% |
| とりわけ | 1.268 | 0.468 | -63.1% |
| 基本的な | 0.869 | 0.328 | -62.3% |
| 本物の | 1.708 | 0.656 | -61.6% |
| フレーミング | 0.808 | 0.375 | -53.6% |
| とてつもなく | 0.470 | 0.219 | -53.5% |
| 重要な | 1.381 | 0.656 | -52.5% |
| 正直な | 2.107 | 1.062 | -49.6% |
| 共鳴する | 0.061 | 0.031 | -49.1% |
| 有意義に | 0.184 | 0.109 | -40.6% |
| やりがいのある | 0.123 | 0.078 | -36.4% |
| マーカス | 1.493 | 0.984 | -34.1% |
| を表す | 0.603 | 0.437 | -27.6% |
| 正直なところ | 0.726 | 0.531 | -26.9% |
| 機能 | 0.399 | 0.312 | -21.7% |
| 前払い | 0.235 | 0.187 | -20.4% |
| その好例である | 0.020 | 0.016 | -23.7% |
| パターン | 1.677 | 1.358 | -19.0% |
| およそ | 0.337 | 0.281 | -16.7% |
| ますます | 0.747 | 0.640 | -14.3% |
| 潜在的な | 0.869 | 0.968 | +11.4% |
最も煩わしい「クロード語」の多くは、Opus 5.5のベンチマークプロンプトにはまったく登場しませんでした。ここでもまた、クロードが何かを「心から」述べているという表現のいくつかが含まれていました。 Opus 5.5の語彙において他に顕著な減少が見られたのは、「matters enormously」が82%減少したこと、そして「the honest answer」と「the honest answer is that」の両方がOpus 5.5のテキストには全く登場しなかったことです。Opus 5.5とその前バージョンの両方で、「the core idea」というフレーズは、1000のプロンプト全体で正確に25回使用されていました。
| フレーズ | ソネット+オパス5 基本金利 | Opus 5.5のレート | 変化量対プールされたベースライン |
|---|---|---|---|
| 相互に関連し合ういくつかの | 0.143 | 0.000 | -100.0% |
| 正直なところ、それは | 0.072 | 0.000 | -100.0% |
| 正直なところ、答えは | 0.092 | 0.000 | -100.0% |
| 本当に何か | 0.041 | 0.000 | -100.0% |
| 本当に難しい | 0.051 | 0.000 | -100.0% |
| は本当に | 0.552 | 0.047 | -91.5% |
| 極めて重要である | 0.133 | 0.031 | -76.5% |
| 本当に役立つ | 0.092 | 0.031 | -66.1% |
| 私は心から | 0.061 | 0.031 | -49.1% |
| 午後の光 | 0.051 | 0.047 | -8.4% |
| 中心となる考え方 | 0.399 | 0.390 | -2.1% |
| 何かを感じた | 0.112 | 0.141 | +24.9% |
| 静かに言った | 0.164 | 0.265 | +62.2% |
| 長い間 | 0.337 | 0.656 | +94.3% |
一部の単語やフレーズは増加しており、特に「静かに言った」、「長い間」、「何かを感じた」といったフィクション特有の表現が、Opus 5.5の回答においてより頻繁に見られた。ベンチマークの約3分の1が創作の書き出し課題で構成されていたことを踏まえると、この増加は、他のClaudeモデルと比較して、フィクションを書く際により定型的あるいは限られた表現のレパートリーに依存していることを示唆しているのではないかと考えられる。
これを簡単に検証するため、Haiku 4.5 を使って、Opus 5 と Opus 5.5 の創作文章 333 組を、評価者が作品を知らない状態で、独創性、驚き、テーマの展開について 5 段階評価で採点してもらいました。その結果、Opus 5.5 の作品は、どのカテゴリーにおいても平均で 0.75 ポイント低い評価となりました。 Haiku採点システムのラベル割り当てによると、Opus 5.5はOpus 5と比較して、希望、回復力、家族、友情といったテーマについて書く傾向が強く、死、時間、権力、支配、自由、正義、復讐、記憶、悲嘆、喪失といったテーマについて書く傾向は弱かった。したがって、何らかのトレードオフが働いている可能性があるようだ。
Opus 5.5では、1000件の回答全体で「要するに」という表現が100回使用された。これは、Opus 5での使用回数(9回)に比べて1016%の増加である。なお、Opus 5.5の回答は、Opus 5に比べて平均でわずか2.9語短いだけだった(643.4語対640.5語)。
| フレーズ | 「Opus 5」の出現回数 | 『Opus 5.5』の出現箇所 | 変更 |
|---|---|---|---|
| 要するに | 9 | 100 | 11.16× |
| 例えば | 22 | 116 | 5.30× |
| ~し始めた | 22 | 74 | 3.38× |
| 最初は | 14 | 43 | 3.09× |
| 長い間 | 19 | 42 | 2.22× |
ごく少数のサンプルから判断すると、Opus 5.5 は実用的で地に足のついた表現を好むようだ。これが回答の核心部分でも当てはまるのか、それとも Opus 5.5 が単に「率直で直接的」であることを口先だけで主張しているだけなのかは、まだ不明だ。2つの回答の単語数に差が見られないことから、RLHF がここに至るまでに用いた手法の有効性について、私は少し疑問を抱かざるを得ない。
Opus 5.5は例を挙げるのがとても好きなようで、1000件の回答の中で「例」という単語が325回使用されていました。全体として、Opus 5.5の回答の20%にこの単語が含まれていましたが、Opus 5の回答では9%にとどまりました。「要約」や「主に」といった単語も同様に、使用頻度が際立って高かったです。そして、このClaudeはユーザーにヒントを与えるのが本当に好きなようです!
| Word | 「Opus 5」の出現回数 | 『Opus 5.5』の出現箇所 | 変更 |
|---|---|---|---|
| 一時停止 | 9 | 35 | 3.91× |
| ヒント | 18 | 58 | 3.24× |
| 主に | 24 | 75 | 3.14× |
| じっと見つめた | 22 | 62 | 2.83× |
| 例 | 121 | 325 | 2.70× |
| 概要 | 60 | 157 | 2.63× |
このモデルはこれまでのClaudeとは書き方が異なりますが、いつものように、おそらく3~6週間もすれば、「例えば」や「要するに」といった表現が、鋭い読者の目には「Claudeっぽさ」を感じさせるようになるでしょう。しかし、Claudeが効果的にコミュニケーションをとれることは使いやすさの観点から重要であり、私も皆と同じように、その取り組みに感謝しています。Claudeの文章力を向上させることは、PangramがAI生成テキストを検出する能力と、決して矛盾するものではありません!






