事例紹介

パングラムは GPT-6 アストラを検出できますか?

2026年9月4日

簡単にまとめると


986個のプロンプトのうち、Pangram 4はGPT-6 Astraの出力において99.59%の精度を達成した。

Chatbot Arenaから取得した986個のプロンプトのうち、Pangram 4はGPT-6 Astraの出力のうち3つを混合型、1つを完全に人間によるもの、982個を完全にAI生成型と分類し、GPT-6 Astraで99.59%の精度を達成しました。

以下では、偽陰性をカテゴリー別に解説します。

ベンチマークは、LMSYSデータセット(Zheng et al., 2023)から抽出した、Chatbot Arenaの最初のターンのプロンプトのフィルタリングされたサブセットを使用して生成されました。コード、数学、非常に短いまたは非常に長い回答、または不適切な創作文を要求するプロンプトを除外しました。次に、それらをGPT-6 Astraに与え、出力をPangram 4で実行しました。

カテゴリー別結果

カテゴリ例AI混合人間
引数161600
電子メール/手紙575610
エッセイ・記事343400
説明54754610
詩やその他の創作作品18318111
レビュー7700
ストーリー14214200
合計98698231

結果は、詩、短い説明、そしてメールの3つで、それぞれ内容が異なっていた。

Astraは短い質問には非常に簡潔に答える傾向があります。今回のベンチマークセットでは合計1,032個のプロンプトを送信しましたが、Astra 6の回答のうち46個はPangramの50語未満の最小文字数に満たなかったため、採点されませんでした。

結論

Pangramは、自然言語プロンプトに対するGPT-6 Astraの検出において高い堅牢性を発揮し、99.59%の精度で検出します。Pangramは新しいモデルにも容易に対応できます。これは、新しいモデルが先行モデルのスタイルや特性を多く継承する傾向があるため、Pangramを新しいリリースごとに再学習させる必要がないからです。

GPT-6 Astraを、他の最新鋭モデルのベンチマークと比較した結果は以下のとおりです。

モデルAIとして検出されました正確性
クロード・ソネット 5.51,019/1,02299.71%
ジェミニ3.8フラッシュ998/1,00099.80%
ジェミニ3.1プロ997/1,00099.70%
クロード 作品5.5997/1,00099.70%
フェイブル5.11,093/1,09799.64%
クロード・オパス51,105/1,10799.82%
GPT-5.63,408/3,42399.56%
クロード・ソネット第5番1,145/1,14799.83%
ジェミニ328/28100%

特定の文書を確認したい場合は、こちらのPangramを試してみてください。


アナミエカ・アーツ

アナミエカは、パングラムのテクニカルライターです。

Annamieka Aerts のその他の記事

関連記事

PangramはGemini 3.8 FlashとGemini 3.1 Proを検出できますか?
事例紹介

PangramはGemini 3.8 FlashとGemini 3.1 Proを検出できますか?

2026 年 9 月 30 日
パングラム社、ICLRの査読論文の21%がAIによって生成されたものと予測
事例紹介

パングラム社、ICLRの査読論文の21%がAIによって生成されたものと予測

2025年11月18日
AIに関する学会論文は、AIによって執筆されるケースが増加している:2023年以降、370%増加
事例紹介

AIに関する学会論文は、AIによって執筆されるケースが増加している:2023年以降、370%増加

2024年9月30日
最も精度の高いAI検出ツールはどれか? 30のツールを検証(2026年)
事例紹介

最も精度の高いAI検出ツールはどれか? 30のツールを検証(2026年)

2026年1月7日
AIによるレビューを見分ける方法
事例紹介

AIによるレビューを見分ける方法

2023年12月5日
パングラムは「クロード・オーパス5.5」を検出できるでしょうか?
事例紹介

パングラムは「クロード・オーパス5.5」を検出できるでしょうか?

2026年9月23日