Cómo detecta Pangram el contenido generado por IA

Un análisis de cómo se entrena a Pangram para detectar textos generados por IA con una tasa de falsos positivos prácticamente nula.

01

Resumen

Pangram Text está diseñado para detectar contenido generado por IA con una tasa de falsos positivos cercana a cero. Nuestro riguroso enfoque de entrenamiento minimiza los errores y permite al modelo detectar texto generado por IA mediante el análisis y la comprensión de sutiles indicios en la redacción.

Cómo se entrena a Pangram: se recopilan ejemplos clasificados erróneamente por humanos y se comparan con texto generado por un modelo de lenguaje grande (LLM) antes de volver a entrenar el modelo.
Fig. 1. Resumen de cómo se entrena a Pangram para distinguir entre texto escrito por personas y texto generado por IA.
02

Proceso de formación inicial

Nuestro clasificador utiliza una arquitectura de modelo lingüístico tradicional. Recibe el texto de entrada y lo divide en tokens. A continuación, el modelo convierte cada token en una representación, que es un vector de números que representa el significado de cada token.

La entrada se procesa a través de la red neuronal, generando una representación de salida. Un módulo clasificador transforma dicha representación en una predicción de 0 o 1, donde 0 corresponde a la etiqueta humana y 1 a la etiqueta de la IA.

Cada token se convierte en un vector de incrustación y se representa en un espacio tridimensional.
Fig. 2. Cada token se convierte en una representación —un vector de números que representa su significado— que el modelo representa en un espacio de alta dimensión (que aquí se muestra en 3D).

Entrenamos un modelo inicial con un conjunto de datos pequeño pero diverso, compuesto por aproximadamente un millón de documentos que incluyen textos públicos y con licencia escritos por humanos. El conjunto de datos también incluye textos generados por IA producidos por GPT-4 y otros modelos lingüísticos de vanguardia. El resultado del entrenamiento es una red neuronal capaz de predecir de forma fiable si un texto ha sido escrito por un humano o por una IA.

El texto se divide en tokens y se envía a través de la red a un clasificador y a las representaciones, y la función softmax genera una predicción.
Fig. 3. El modelo inicial se ha entrenado con aproximadamente un millón de documentos, tanto humanos como generados por IA.
03

Mejora continua mediante la iteración

Minería de negativos duros

El modelo inicial ya era bastante eficaz, pero queríamos maximizar la precisión y reducir cualquier posibilidad de falsos positivos (es decir, que se identificaran erróneamente documentos redactados por personas como generados por IA). Para ello, desarrollamos un algoritmo específico para modelos de detección de IA.

Con el conjunto de datos inicial, nuestro modelo no disponía de suficiente información para pasar de una precisión del 99 % a una del 99,999 %. Aunque el modelo aprende rápidamente los patrones iniciales de los datos, necesita enfrentarse a casos extremos para poder distinguir con precisión entre el texto escrito por humanos y el generado por IA.

Resolvemos esto utilizando el modelo para buscar falsos positivos en grandes conjuntos de datos y ampliando el conjunto de entrenamiento inicial con estos ejemplos difíciles adicionales antes de volver a entrenar el modelo. Tras varios ciclos de este proceso, el modelo resultante presenta una tasa de falsos positivos cercana a cero, así como un rendimiento general mejorado en los conjuntos de evaluación reservados.

El modelo analiza grandes conjuntos de datos en busca de ejemplos difíciles, que se añaden al conjunto de entrenamiento antes de volver a entrenar el modelo.
Fig. 4. El modelo analiza grandes conjuntos de datos en busca de ejemplos difíciles, que se añaden al conjunto de entrenamiento antes de volver a entrenar el modelo.

Indicaciones del espejo

Diseñamos la parte de IA del conjunto de datos para que se parezca mucho a la parte humana en cuanto a estilo, tono y contenido semántico. Para cada ejemplo humano, generamos un ejemplo creado por IA que coincida con el documento original en tantos ejes como sea posible, para asegurarnos de que nuestro modelo aprenda a clasificar documentos basándose únicamente en características específicas de la escritura LLM.

Para cada documento redactado por personas, generamos un documento equivalente creado por IA que se ajusta al estilo, el tono y el contenido del original.
Fig. 5. Para cada documento escrito por una persona, generamos un documento equivalente creado por IA que se ajusta al estilo, el tono y el contenido del original.

Reciclar

Entrenamos el modelo con el conjunto de entrenamiento actualizado y evaluamos su rendimiento en cada paso. Gracias a este método, podemos reducir los errores y aumentar la precisión de nuestro modelo más allá de lo que es posible con un entrenamiento convencional.

Cada ciclo de reentrenamiento se evalúa, lo que permite reducir progresivamente los errores más allá de lo que se consigue con el entrenamiento normal.
Fig. 6. Se evalúa cada ciclo de reentrenamiento, reduciendo progresivamente los errores más allá de lo que se consigue con el entrenamiento normal.
04

Más información

Echa un vistazo a nuestro informe técnico completo en arXiv, donde analizamos en profundidad los detalles del entrenamiento, el rendimiento y otros experimentos.

arxiv.orgInforme técnico sobre el clasificador de textos generados por IA «Pangram»
    Cómo funciona la detección de IA | Pangram Labs