986個のプロンプトのうち、Pangram 4はGPT-6 Astraの出力において99.59%の精度を達成した。
Chatbot Arenaから取得した986個のプロンプトのうち、Pangram 4はGPT-6 Astraの出力のうち3つを混合型、1つを完全に人間によるもの、982個を完全にAI生成型と分類し、GPT-6 Astraで99.59%の精度を達成しました。
以下では、偽陰性をカテゴリー別に解説します。
ベンチマークは、LMSYSデータセット(Zheng et al., 2023)から抽出した、Chatbot Arenaの最初のターンのプロンプトのフィルタリングされたサブセットを使用して生成されました。コード、数学、非常に短いまたは非常に長い回答、または不適切な創作文を要求するプロンプトを除外しました。次に、それらをGPT-6 Astraに与え、出力をPangram 4で実行しました。
| カテゴリ | 例 | AI | 混合 | 人間 |
|---|---|---|---|---|
| 引数 | 16 | 16 | 0 | 0 |
| 電子メール/手紙 | 57 | 56 | 1 | 0 |
| エッセイ・記事 | 34 | 34 | 0 | 0 |
| 説明 | 547 | 546 | 1 | 0 |
| 詩やその他の創作作品 | 183 | 181 | 1 | 1 |
| レビュー | 7 | 7 | 0 | 0 |
| ストーリー | 142 | 142 | 0 | 0 |
| 合計 | 986 | 982 | 3 | 1 |
結果は、詩、短い説明、そしてメールの3つで、それぞれ内容が異なっていた。
Astraは短い質問には非常に簡潔に答える傾向があります。今回のベンチマークセットでは合計1,032個のプロンプトを送信しましたが、Astra 6の回答のうち46個はPangramの50語未満の最小文字数に満たなかったため、採点されませんでした。
Pangramは、自然言語プロンプトに対するGPT-6 Astraの検出において高い堅牢性を発揮し、99.59%の精度で検出します。Pangramは新しいモデルにも容易に対応できます。これは、新しいモデルが先行モデルのスタイルや特性を多く継承する傾向があるため、Pangramを新しいリリースごとに再学習させる必要がないからです。
GPT-6 Astraを、他の最新鋭モデルのベンチマークと比較した結果は以下のとおりです。
| モデル | AIとして検出されました | 正確性 |
|---|---|---|
| クロード・ソネット 5.5 | 1,019/1,022 | 99.71% |
| ジェミニ3.8フラッシュ | 998/1,000 | 99.80% |
| ジェミニ3.1プロ | 997/1,000 | 99.70% |
| クロード 作品5.5 | 997/1,000 | 99.70% |
| フェイブル5.1 | 1,093/1,097 | 99.64% |
| クロード・オパス5 | 1,105/1,107 | 99.82% |
| GPT-5.6 | 3,408/3,423 | 99.56% |
| クロード・ソネット第5番 | 1,145/1,147 | 99.83% |
| ジェミニ3 | 28/28 | 100% |
特定の文書を確認したい場合は、こちらのPangramを試してみてください。






