1,022個のプロンプトのうち、Pangram 4はクロード・ソネット5.5の出力において99.71%の精度を達成しました。
Chatbot Arenaから取得した1,022個のプロンプトのうち、Pangram 4はClaude Sonnet 5.5の出力のうち2つを混合型、1つを完全に人間によるもの、1,019を完全にAI生成によるものと分類し、Claude Sonnet 5.5で99.71%の精度を達成しました。
以下では、偽陰性をカテゴリー別に解説します。
ベンチマークに使用したデータセットは、LMSYSデータセット(Zheng et al., 2023)から抽出した、Chatbot Arenaの最初のターンのプロンプトのフィルタリングされたサブセットから生成しました。コード、数学、非常に短いまたは非常に長い回答、または不適切な創作文を要求するプロンプトを除外しました。次に、それらをClaude Sonnet 5.5に入力し、出力をPangram 4で処理しました。
| カテゴリ | 例 | AI | 混合 | 人間 |
|---|---|---|---|---|
| 引数 | 16 | 16 | 0 | 0 |
| 電子メール/手紙 | 61 | 60 | 1 | 0 |
| エッセイ・記事 | 32 | 32 | 0 | 0 |
| 説明 | 563 | 562 | 1 | 0 |
| 詩やその他の創作作品 | 198 | 197 | 0 | 1 |
| レビュー | 8 | 8 | 0 | 0 |
| ストーリー | 144 | 144 | 0 | 0 |
| 合計 | 1,022 | 1,019 | 2 | 1 |
見逃された試みの1つは、ジェーン・オースティンの『エマ』に登場する謎解きを解説してほしいという依頼で、これはOpus 5.5でも見逃された。
エルトン氏がハリエットとエマに仕掛けた芝居について説明してください。
唯一、完全に人間による誤認だったのは詩に関するものでした。課題は「ハーフィズの詩を教えてください」というものでした。Sonnet 5.5 は有名なペルシャの詩の翻訳を提供しました。私の知る限り、この翻訳は既存の人間の翻訳と完全に一致するものではありませんが、多くの翻訳にかなり近いものです。他のベンチマークにおけるPenguinmandiasと同様に、既存の詩のこうしたほぼコピーは、私にとってはそれほど問題ではありません。
Pangramは、自然言語によるプロンプトに対してクロード・ソネット5.5に対して堅牢な性能を発揮し、99.71%の精度で検出します。Pangramは新しいモデルにも容易に対応できます。これは、新しいモデルが以前のモデルのスタイルや特徴を多く継承する傾向があるため、Pangramを新しいリリースごとに再学習させる必要がないからです。
Claude Sonnet 5.5を、他の最新鋭モデルと比較したベンチマーク結果は以下のとおりです。
| モデル | AIとして検出されました | 正確性 |
|---|---|---|
| ジェミニ3.8フラッシュ | 998/1,000 | 99.80% |
| ジェミニ3.1プロ | 997/1,000 | 99.70% |
| クロード 作品5.5 | 997/1,000 | 99.70% |
| フェイブル5.1 | 1,093/1,097 | 99.64% |
| クロード・オパス5 | 1,105/1,107 | 99.82% |
| GPT-5.6 | 3,408/3,423 | 99.56% |
| クロード・ソネット第5番 | 1,145/1,147 | 99.83% |
| ジェミニ3 | 28/28 | 100% |
特定の文書を確認したい場合は、こちらのPangramを試してみてください。






