パングラムがAI生成コンテンツをどのように検出するか

Pangramが、誤検知率をほぼゼロに抑えながらAI生成テキストを検出できるよう、どのように訓練されているのかを見ていきます。

01

概要

Pangram Textは、誤検知率をほぼゼロに抑えつつ、AI生成コンテンツを検出するように設計されています。当社の厳格なトレーニング手法によりエラーを最小限に抑え、文章に含まれる微妙な手がかりを分析・理解することで、AI生成テキストを検出できるようにしています。

パングラムの学習方法:誤分類された人間による例を抽出・収集し、LLMが生成したテキストと照合した上で、モデルを再学習させる。
図1.Pangramが人間によるテキストとAI生成テキストを区別するように学習される仕組みの概要
02

初期研修プロセス

当分類器は、従来の言語モデルアーキテクチャを採用しています。入力テキストを受け取り、それをトークン化します。その後、モデルは各トークンを埋め込み(各トークンの意味を表す数値のベクトル)に変換します。

入力はニューラルネットワークを通過し、出力エンベディングが生成されます。分類器ヘッドは、この出力エンベディングを0または1の予測値に変換します。ここで、0は人間のラベル、1はAIのラベルを表します。

各トークンは埋め込みベクトルに変換され、3次元空間上にプロットされます。
図2.各トークンはその意味を表す数値のベクトルである「埋め込み」に変換され、モデルはそれを高次元空間(ここでは3Dで表示)上にプロットする。

私たちは、公開されているテキストやライセンス供与された人間が執筆したテキストなど、小規模ながらも多様な約100万件の文書からなるデータセットを用いて、初期モデルを学習させます。このデータセットには、GPT-4やその他の最先端言語モデルによって生成されたAI生成テキストも含まれています。この学習の結果、テキストが人間によって書かれたものかAIによって生成されたものかを確実に予測できるニューラルネットワークが完成しました。

テキストはトークン化され、ネットワークを経由して分類器のヘッドと埋め込み表現に送られ、ソフトマックスによって予測結果が生成される。
図3.初期モデルは人間およびAIによって生成された約100万件の文書を用いて学習されている。
03

反復による継続的な改善

ハードネガティブマイニング

初期のモデルはすでにかなり効果的でしたが、精度を最大限に高め、誤検知(人間が作成した文書をAI生成と誤って判定すること)の可能性を最小限に抑えたいと考えました。そのため、AI検出モデル専用のアルゴリズムを開発しました。

初期のデータセットでは、モデルの精度を99%から99.999%に引き上げるのに十分な特徴情報が得られませんでした。モデルはデータ内の初期パターンを素早く学習しますが、人間が書いたテキストとAIが生成したテキストを正確に区別するためには、困難な境界事例を学習する必要があります。

この問題を解決するために、モデルを用いて大規模なデータセットから誤検知を抽出し、再学習を行う前に、これらの追加された「難しい例」を用いて初期の学習データを拡張します。このプロセスを数回繰り返すことで、結果として得られるモデルは、誤検知率をほぼゼロに抑えるだけでなく、保留評価セットにおける全体的な性能も向上させます。

このモデルは、大規模なデータセットから困難な例を抽出しており、それらは再学習の前に学習データセットに追加される。
図4.このモデルは、大規模なデータセットから困難な例を抽出しており、それらは再学習の前に学習データセットに追加される。

ミラープロンプト

データセットのAI生成側については、スタイル、トーン、意味的内容の面で人間が作成した例に極力近づけるよう設計しています。人間が作成した各例に対して、元の文書と可能な限り多くの点で一致するAI生成例を作成することで、モデルがLLMによる文章の特定の特性のみに基づいて文書を分類できるよう学習することを保証しています。

人間が作成した文書ごとに、そのスタイル、口調、内容に合わせて作成されたAI生成の文書を生成します。
図5.人間が作成した文書ごとに、文体、口調、内容に合わせて調整されたAI生成文書を生成する。

再訓練

更新された学習データセットを用いてモデルを学習させ、各ステップでモデルの性能を評価します。この手法を用いることで、エラーを減らし、通常の学習では達成できないレベルの精度向上を実現できます。

各再学習サイクルが評価され、通常の学習では達成できないレベルまで、着実に誤差を低減させていきます。
図6.各再学習サイクルが評価され通常の学習では達成できないレベルまで、誤差が着実に減少していく。
04

詳細はこちら

arXivに掲載されている当社の技術ホワイトペーパーの全文をご覧ください。そこでは、トレーニングの詳細、性能、その他の実験について詳しく解説しています。

arxiv.orgパングラムAI生成テキスト分類器に関する技術報告書
    AI検出の仕組み | Pangram Labs