すべての記事を閲覧する (65)
パングラムの仕組み

Pangramはパープレキシティとバースト性を用いているのでしょうか?

パングラムが、一部の旧式の検出器のように、パープレキシティやバースト性に依存しているかどうか。

最終更新日:2026年7月24日

いいえ、Pangramはモデルの予測において、パープレキシティやバースト性を頼りにしているわけではありません。Pangramは「分類器モデル」と呼ばれる種類のニューラルネットワークです。Pangramは、分類が最も困難な文書の「合成ミラー」を用いて学習され、その後、繰り返し再学習が行われます。これにより、新しいモデルへの適応が可能となり、アクティブラーニングアルゴリズムを通じて人間のテキストに関する経験が蓄積されるにつれて、Pangramの性能は徐々に向上していきます。

パープレキシティとバースト性とは何ですか?

「パープレキシティ」と「バースト性」に関する当社のブログ記事から抜粋したものです。これらの手法の欠点について詳しく知りたい場合は、ぜひこの記事をご参照ください。

https://www.pangram.com/blog/why-perplexity-and-burstiness-fail-to-detect-ai

「パープレクシティ」とは、特定の言語モデルやLLMの観点から見たとき、テキスト中の各単語がいかに予期せぬ、あるいは驚くべきものであるかを示す指標である。

例えば、ここに2つの文があります。説明のために、それぞれの文の最後の単語に注目してみましょう。最初の例では、最後の単語のパープレキシティは低いですが、2番目の例では、最後の単語のパープレキシティは高くなっています。

低パープレキシティ

今日の昼食は、*スープ*を一杯食べました。

高いパープレキシティ

今日の昼食は、*クモ*を一皿食べました。

2文目のパープレクシティが高い理由は、言語モデルが学習データセットの中で、人がクモの入った丼を食べているような例を目にすることは極めて稀であるためです。そのため、文の末尾が「スープ」や「サンドイッチ」、「サラダ」といった言葉ではなく「クモ」で終わっていることに、言語モデルは非常に驚いてしまうのです。

バースト性は、文書全体にわたるパープレキシティの変化を指します。文書全体に意外な単語やフレーズが散りばめられている場合、その文書のバースト性は高いと言えます。

なぜパングラムはパープレキシティやバースト性を用いないのでしょうか?

AIによる文章を検出するためにパープレキシティやバースト性を用いることには、多くの欠点があります。以下の内容に関する詳細な説明については、このテーマに関する当社のブログ記事(https://www.pangram.com/blog/why-perplexity-and-burstiness-fail-to-detect-ai)をご参照ください。 言語モデルは、学習データにおけるパープレキシティを最小化するよう明示的に訓練されているため、『独立宣言』やウィキペディアの記事など、頻繁に再現される人間の文章がAIによるものと誤分類されてしまうことがあります。この問題は、モデルがウェブ上のデータをより多く取り込むにつれてさらに深刻化します。また、これらの指標は特定のモデルに依存しているため、ある生成モデルに合わせて調整された検出器は、別の生成モデルでは不正確な結果を出します。さらに、多くの商用モデルは、パープレキシティの計算に必要なトークン確率をまったく公開していません。 これらは、英語が母語でない人々を体系的に不利な立場に追いやる。彼らの語彙は限られており、文構造も単純であるため、当然ながらパープレキシティやバースト性が低くなるからだ。そして最も根本的な問題として、これらは静的なヒューリスティックであり、ディープラーニングアプローチのように、より多くのデータや計算能力によって改善することができない。つまり、重要な用途で求められる信頼性を提供することはできないのである。

    Pangramはパープレキシティとバースト性を活用しているのか? | Pangram Labs | Pangram