事例紹介

パングラムは「クロード・オーパス5.5」を検出できるでしょうか?

それに、文章を書くのは得意ですか?

2026年9月23日

簡単にまとめると


1000件のプロンプトのうち、「Pangram 4」はClaude Opus 5.5の出力に対して99.70%の精度を達成しています。

Chatbot Arenaから収集した1000件のプロンプトのうち、「Pangram 4」は、Claude Opus 5.5の出力のうち2件を「混合」、1件を「完全な人間によるもの」、997件を「完全なAI生成」と分類し、Claude Opus 5.5において99.70%の精度を達成した。

以下では、偽陰性についてカテゴリー別に考察する。また、このモデルが従来のClaudeとはどのような点で異なる(あるいは優れた?)ライターであるのかについても検証する。

ベンチマークセットを生成するために、今回もLMSYSデータセット(Zheng et al., 2023)に含まれるChatbot Arenaのプロンプトから、フィルタリングしたサブセットを使用しました。コードや数学の問題、極端に短いまたは長い回答を求めるプロンプト、不適切な創作文章を要求するプロンプトを除外し、初回ターン(first-turn)のプロンプトのみを対象としました。その後、それらをOpus 5.5に入力し、その出力をPangram 4で処理しました。

カテゴリー別結果

2件の「混合結果(偽陰性)」はいずれも文学に関するもので、1件はジェーン・オースティンの小説の1章についての解説を求めたもの(AIによる判定: 75.83%、人間:24.17%)の解説を求め、もう1つは、トゥキディデスの『ペロポネソス戦争史』の文体で、アテネ人が白と金のドレスを実際には青と黒だと信じていると非難するコリントの外交官の演説をOpus 5.5に執筆するよう依頼したものでした(AI:77.10%、人間:22.90%)。

カテゴリAI混合人間
引数161600
電子メール/手紙606000
エッセイ・記事303000
説明55155010
11511401
その他の創作818010
レビュー8800
ストーリー13913900
合計1,00099721

1000件のデータセットの中で、唯一完全に人間による偽陰性だったのは詩だった。Chatbot Arenaからのプロンプトは、「『オジマンディアス』のスタイルでクラブペンギンの詩を書いて」というものだった。それに対し、クロードは偶然にも、私が最も好きなパーシー・シェリーの詩(ホレス・スミスによる訳も大好きだが)のパロディを書き上げた:

ペンギンマンディアス

あるサーバーのプレイヤーに出会ったが、彼はすでに死んでいた。
その者はこう言った。「巨大でよたよたと歩く二つの氷の足
が埠頭のそばに立っている。 その近くには、半分雪に埋もれた頭が
雪の中に粉々になって横たわっている。その細めた目、
ベータ帽、そして冷徹な命令を込めた嘲笑、
それらが、そのプログラマーがそれらの情熱を的確に読み取っていたことを物語っている
その情熱は今も生き続けており、これらのピクセル化された物体に刻み込まれている――
彼らをBANしたMODや、彼らを養ったコインに;
そして台座には、こう記されている:
「我が名はSnowflake7、メンバーの中のメンバー:
非メンバーよ、我がイグルーを仰ぎ見て、絶望せよ!」

他に何も残っていない。その朽ち果てた周囲には
果てしなく、何もない、あの巨大なラグが横たわり
孤独で平坦な雪原が、遥か彼方まで広がっている。」

これ、かなり気に入りました!『クラブペンギン』はプレイしたことがないんですが、そのネタはぴったりだと思います。

Opus 5.5の方が書きやすいですか?

Anthropic社は、この最新のOpusの方が文章作成能力が高く、より明確に意思疎通ができると主張している。

特定のケースについて検証することも可能ですが、Opus 5.5の出力結果は全体としてどのようなものなのでしょうか?以前のモデルと同じ「お気に入りの単語やフレーズ」が使われているのでしょうか?比較のために、Opus 5とSonnet 5でベンチマークを行ったのと同じ1000個のプロンプトを実行してみました。Anthropicも同様の検証を行っているかもしれませんが、私はまだ彼らのブログ記事を読み込んでいません。というのも、これまでの経験上、Anthropicのブログ記事は長すぎると思うからです。

Opus 5.5は、クロード・シリーズのこれまでのモデルとは書き味が異なり、おそらくそれらのモデルに見られた、最も耳障りな癖のいくつかを解消していると言っても過言ではないでしょう。

『オパス5.5』は、強調表現の使用において最も大きな変化が見られた。 「genuinely」の使用頻度はOpus 5より83%減少し、単語あたりの使用頻度はSonnet 5より54%減少した(ただし、Sonnet 5の回答は平均してOpus 5および5.5の回答の約半分程度の長さであった:334語対641語)。また、「enormously」は53%減、「meaningfully」は41%減少した。

Wordソネット第5番 + 作品第5番 基本金利Opus 5.5のレート「Change」と「Claude」のベースラインの比較
相互接続された0.2660.047-82.4%
心から3.0990.671-78.3%
維持0.3270.078-76.1%
実証する0.1430.047-67.3%
とりわけ1.2680.468-63.1%
基本的な0.8690.328-62.3%
本物の1.7080.656-61.6%
フレーミング0.8080.375-53.6%
とてつもなく0.4700.219-53.5%
重要な1.3810.656-52.5%
正直な2.1071.062-49.6%
共鳴する0.0610.031-49.1%
有意義に0.1840.109-40.6%
やりがいのある0.1230.078-36.4%
マーカス1.4930.984-34.1%
を表す0.6030.437-27.6%
正直なところ0.7260.531-26.9%
機能0.3990.312-21.7%
前払い0.2350.187-20.4%
その好例である0.0200.016-23.7%
パターン1.6771.358-19.0%
およそ0.3370.281-16.7%
ますます0.7470.640-14.3%
潜在的な0.8690.968+11.4%

最も煩わしい「クロード語」の多くは、Opus 5.5のベンチマークプロンプトにはまったく登場しませんでした。ここでもまた、クロードが何かを「心から」述べているという表現のいくつかが含まれていました。 Opus 5.5の語彙において他に顕著な減少が見られたのは、「matters enormously」が82%減少したこと、そして「the honest answer」と「the honest answer is that」の両方がOpus 5.5のテキストには全く登場しなかったことです。Opus 5.5とその前バージョンの両方で、「the core idea」というフレーズは、1000のプロンプト全体で正確に25回使用されていました。

フレーズソネット+オパス5 基本金利Opus 5.5のレート変化量対プールされたベースライン
相互に関連し合ういくつかの0.1430.000-100.0%
正直なところ、それは0.0720.000-100.0%
正直なところ、答えは0.0920.000-100.0%
本当に何か0.0410.000-100.0%
本当に難しい0.0510.000-100.0%
は本当に0.5520.047-91.5%
極めて重要である0.1330.031-76.5%
本当に役立つ0.0920.031-66.1%
私は心から0.0610.031-49.1%
午後の光0.0510.047-8.4%
中心となる考え方0.3990.390-2.1%
何かを感じた0.1120.141+24.9%
静かに言った0.1640.265+62.2%
長い間0.3370.656+94.3%

一部の単語やフレーズは増加しており、特に「静かに言った」、「長い間」、「何かを感じた」といったフィクション特有の表現が、Opus 5.5の回答においてより頻繁に見られた。ベンチマークの約3分の1が創作の書き出し課題で構成されていたことを踏まえると、この増加は、他のClaudeモデルと比較して、フィクションを書く際により定型的あるいは限られた表現のレパートリーに依存していることを示唆しているのではないかと考えられる。

これを簡単に検証するため、Haiku 4.5 を使って、Opus 5 と Opus 5.5 の創作文章 333 組を、評価者が作品を知らない状態で、独創性、驚き、テーマの展開について 5 段階評価で採点してもらいました。その結果、Opus 5.5 の作品は、どのカテゴリーにおいても平均で 0.75 ポイント低い評価となりました。 Haiku採点システムのラベル割り当てによると、Opus 5.5はOpus 5と比較して、希望、回復力、家族、友情といったテーマについて書く傾向が強く、死、時間、権力、支配、自由、正義、復讐、記憶、悲嘆、喪失といったテーマについて書く傾向は弱かった。したがって、何らかのトレードオフが働いている可能性があるようだ。

この「クロード」って、どんな感じの曲なの?

Opus 5.5では、1000件の回答全体で「要するに」という表現が100回使用された。これは、Opus 5での使用回数(9回)に比べて1016%の増加である。なお、Opus 5.5の回答は、Opus 5に比べて平均でわずか2.9語短いだけだった(643.4語対640.5語)。

フレーズ「Opus 5」の出現回数『Opus 5.5』の出現箇所変更
要するに910011.16×
例えば221165.30×
~し始めた22743.38×
最初は14433.09×
長い間19422.22×

ごく少数のサンプルから判断すると、Opus 5.5 は実用的で地に足のついた表現を好むようだ。これが回答の核心部分でも当てはまるのか、それとも Opus 5.5 が単に「率直で直接的」であることを口先だけで主張しているだけなのかは、まだ不明だ。2つの回答の単語数に差が見られないことから、RLHF がここに至るまでに用いた手法の有効性について、私は少し疑問を抱かざるを得ない。

Opus 5.5は例を挙げるのがとても好きなようで、1000件の回答の中で「例」という単語が325回使用されていました。全体として、Opus 5.5の回答の20%にこの単語が含まれていましたが、Opus 5の回答では9%にとどまりました。「要約」や「主に」といった単語も同様に、使用頻度が際立って高かったです。そして、このClaudeはユーザーにヒントを与えるのが本当に好きなようです!

Word「Opus 5」の出現回数『Opus 5.5』の出現箇所変更
一時停止9353.91×
ヒント18583.24×
主に24753.14×
じっと見つめた22622.83×
1213252.70×
概要601572.63×

このモデルはこれまでのClaudeとは書き方が異なりますが、いつものように、おそらく3~6週間もすれば、「例えば」や「要するに」といった表現が、鋭い読者の目には「Claudeっぽさ」を感じさせるようになるでしょう。しかし、Claudeが効果的にコミュニケーションをとれることは使いやすさの観点から重要であり、私も皆と同じように、その取り組みに感謝しています。Claudeの文章力を向上させることは、PangramがAI生成テキストを検出する能力と、決して矛盾するものではありません!


アナミエカ・アーツ

アナミエカは、パングラムのテクニカルライターです。

Annamieka Aerts のその他の記事

関連記事

最も精度の高いAI検出ツールはどれか? 30のツールを検証(2026年)
事例紹介

最も精度の高いAI検出ツールはどれか? 30のツールを検証(2026年)

2026年1月7日
AIに関する学会論文は、AIによって執筆されるケースが増加している:2023年以降、370%増加
事例紹介

AIに関する学会論文は、AIによって執筆されるケースが増加している:2023年以降、370%増加

2024年9月30日
パングラムは、さまざまな学生の作文において、誤検知が0件であることを示している
事例紹介

パングラムは、さまざまな学生の作文において、誤検知が0件であることを示している

2026年8月19日
PangramとGPTZeroを比較するとどうでしょうか?
事例紹介

PangramとGPTZeroを比較するとどうでしょうか?

2026年1月22日
AIによるレビューを見分ける方法
事例紹介

AIによるレビューを見分ける方法

2023年12月5日
現在、Amazonのトップページに掲載されているレビューの3%はAIによって生成されたものである
事例紹介

現在、Amazonのトップページに掲載されているレビューの3%はAIによって生成されたものである

2026年5月4日