AIによって生成された文章を確実に識別できることは重要だと考えているため、それを実現する検出ツールを開発しました。この問題は極めて重要であるため、その仕組みについて透明性を保つことが賢明であると考えます。
著者が文章を書く際、その構成について、意識的・無意識的に何千もの判断を下しています。根本的に、AI検出とは「著者識別」の問題であり、どの判断がどのような著者の典型的なものかを分類することです。 これが可能なのは、ChatGPTのようなLLM(大規模言語モデル)は人間ではないものの、それでも意思決定を行う単一の「著者」であるからです。また、彼らが下す可能性のある決定の種類にも制約があります。アシスタントモデルは、質問に効果的に答えるために、役に立ち、明確な文章を生成する必要があります。こうした傾向はトレーニングの過程でモデルに深く刻み込まれており、一度定着してしまうと、それが表に出るのを防ぐことは非常に困難です。
パングラムは、分類器モデルと呼ばれるニューラルネットワークの一種です。最も広い意味で言えば、パングラムは文章の一部を読み取り、学習済みの膨大なパターンセットを用いて、それがAIによって生成されたものかどうかを推定します。
Pangramは、執筆スタイルが似ている著者を近くに配置し、スタイルが異なる著者を遠くに配置するような「マップ」を構築することで、人間による文章とLLMによる文章を区別することを学びます。このマップ上では、人間が書いたテキストとAIが生成したテキストはそれぞれ明確なクラスターを形成しており、我々の研究によれば、PangramはChatGPTやClaudeといった主要な商用言語モデルさえも、異なる領域に位置づけることができることが示されています。

パングラムは、これまで見たことのない文章に出くわすと、すでに知っているテキストと比較することで、その文章をマップ上のどこに配置すべきかを判断します。文章のどの要素一つだけで配置先が決まるわけではないため、ChatGPTが長ダッシュなど、人間の執筆者が好んで使う表現手法を採用したからといって、その執筆者が誤って分類されるリスクはありません。目に見えるLLM特有の表現は、パングラムが考慮する数十万ものシグナルのうち、ほんの一部に過ぎません。
算出された座標が「人間が書いた領域」に該当する場合、Pangramはそのテキストが人間によるものだと予測します。一方、座標がより曖昧な領域に該当する場合、あるいは同じテキスト内の異なる箇所が異なる方向を指し示している場合、PangramはそのテキストにAIによる記述が含まれている可能性を疑い始めます。これが、Pangramに最低単語数という基準が設けられている理由です。単語数が多いほど、座標の精度が高まるからです。 このアプローチは、新しいAIモデルのリリースに対してもPangramが汎用性を発揮するのに役立ちます。新しいAIモデルは、先行モデルのスタイルや文体を多く受け継ぐ傾向があり、マップ上の非常に類似した領域に位置するためです。
これまでに行われたAIによる文章の検出の試みは、惨憺たる結果に終わり、公の場で失敗に終わってきました。その理由は、大規模言語モデル(LLM)がテキストを生成する仕組みをリバースエンジニアリングしようとしたためです。これらの検出器は、文の単語が一つ終わるたびに、「もし自分がLLMだったら、次にどの単語が続くと思うか?」と問いかけました。
例えば、「I’m going to take my dog for a …」といった文の断片が与えられた場合、AIモデルは「walk」や「run」を次の単語として非常に可能性が高いとみなす一方で、「harbinger」や「verglas」のような文脈にそぐわない単語は、有力な候補とは見なさないだろう。 初期の検出器は、LLMが算出した候補語の順位を再構築し、実際に現れた単語と比較しようと試みました。そのため、テキストが予測可能な選択に従う頻度が高いほど、検出器はそのテキストをAI生成と分類する可能性が高くなりました。本質的に、これはLLMが文の次に現れる単語にどれほど困惑するかを反映しているため、このAI検出手法は「パープレキシティ分析」と呼ばれました。

パープレキシティ分析には多くの問題がある。人間の文章もLLMが生成する文章と同様に定型化されていることが多いため、この手法は区別しようとしている対象を適切に測定する指標とはならない。そのため、予測可能あるいは構造化された人間の文章は、パープレキシティ検出器によって誤ってフラグ付けされることがよくある一方で、一方で、単語をあまり一般的ではない同義語に置き換えるといった明白な手法を用いるだけで、それらの検出器を容易に回避できてしまう。
よく知られているように、パープレキシティモデルは、コンピュータの登場以前に書かれた多くのテキストに対しても誤った判定を下してしまいます。パープレキシティに基づく検出手法では、聖書や独立宣言、あるいはメアリー・シェリーの『フランケンシュタイン』といった作品でさえ、100%AI生成であると判定してしまう傾向があります。これは、LLM(大規模言語モデル)が学習の過程で独立宣言を何千回も読み込んでいるため、そこに含まれる次の単語は、LLMの観点からはどれも極めて予想通りのものになってしまうからです。 検出器は、その「あり得る度合い」を、その文章がAIによって生成されたという証拠であると誤って解釈してしまうのです。
Pangramはこの問題を回避しています。なぜなら、PangramはLLMがテキストを生成する仕組みをリバースエンジニアリングしようとしているわけではないからです。Pangramは個々の単語を見て「LLMならここに何を書くだろうか?」と問うのではなく、テキスト全体を見て「これは誰の書き方に似ているか?」と問うのです。この方法であれば、ChatGPTの親しみやすさによって、Pangramが歴史的文書をAI生成物と誤分類してしまうことは決してありません――しかし、すべてのケースがこれほど単純なわけではありません。
分類器の精度を98%にするよう訓練するのは難しくない。AIによる文章のほとんどは容易に見分けがつき、ニューラルネットワークは最も明白な特徴を素早く学習できる。E・E・カミングスの詩と『カラマーゾフの兄弟』の引用文を比較して、それらが異なる著者によって書かれたと結論づけることができるのがほとんどの人であるのと同様に、基本的な分類器であれば、AIが生成したパスタのレシピと人間が書いた日記の記述を簡単に区別できる。 しかし、AI検出において98%の精度は極めて不十分です。2%の誤認識率とは、50件に1件の文書を誤分類することを意味し、それにより個々の予測の信頼性が疑われることになります。そこで考えてみてください。もしあなたがドストエフスキーの作品を識別する能力で上位2%にランクインしているとしたら、上位0.01%に入るためにどのような戦略を用いるでしょうか?
そのレベルでは、ドストエフスキーを直接読み返しても、その効果は次第に薄れていく。その差を埋めるには、ドストエフスキー以外には誰も生み出せない特徴を見つけ出す必要がある。有効な戦略としては、プロの物まね芸人を数人雇い、可能な限り説得力のあるドストエフスキーの「クローン」を書かせ、その違いを研究することだろう。 これが、私たちがPangramを訓練する方法です。商用ライセンスを取得した人間が書いたテキストのデータセットの各要素について、その原文に可能な限り近いAIによる「複製」を生成します。これらの複製は、長さ、トーン、トピックが原文と同じですが、AIによって生成されたものです。その後、これらの「人間によるテキスト」と「AIによるテキスト」のペアを用いて、Pangramモデルを訓練します。

これらのペアを区別することを学ぶ過程で、パングラムは内部マップ上の境界領域の解像度を効果的に高めています。パングラムのマップを可能な限り正確なものにするため、私たちはデータポイズニングに対して極めて慎重に対処しています。具体的には、既知の人間のテキストからなるデータセットを、AIがインターネット上に解き放たれる前の2021年以前のデータから抽出して使用しています。現時点ではこの手法はうまく機能していますが、言語の変化に合わせて調整が必要になるという事実を私たちは認識しています。 データドリフトが問題となる前に先手を打って対処することは、私たちの最優先の研究課題の一つです。
パングラムは、テキストのみに基づいて予測を行う統計モデルであるため、その精度も統計的に検証されなければなりません。それが私たちの取り組みです。私たちは、リリースするすべてのパングラムモデルについて、またAI研究所がLLMを更新するたびに、内部ベンチマークを公開しています。また、シカゴ大学やメリーランド大学のチームなど、独立した第三者機関による検証も受けています。
研究者の方、あるいは非常に優れたアイデアをお持ちで、その結果を公表することをお約束いただける方は、当社のAPIクレジット助成金に申請し、ご自身で当社のモデルをテストすることができます。私たちは常に改善の方法を模索しています。






