Pangram 4 no generó ningún falso positivo en los 25 996 ensayos escritos por personas que componen el corpus PERSUADE 2.0, incluyendo todos los subgrupos según discapacidad, género, curso escolar, origen étnico, estatus de estudiante de inglés como segunda lengua (ELL) y situación de desventaja económica.
Hemos evaluado Pangram 4 en el conjunto de datos PERSUADE 2.0, compuesto por ensayos de estudiantes de diversa procedencia, y no hemos encontrado ningún falso positivo en los 25 996 ensayos. Pangram no generó ningún falso positivo en ninguno de los subgrupos analizados.
Es importante comprender cómo funciona Pangram con distintos tipos de autores. No es fácil encontrar conjuntos de datos de redacciones escritas por personas que incluyan información demográfica sobre los autores, pero evaluar el rendimiento de Pangram con textos redactados por diferentes tipos de escritores —entre ellos, estudiantes con discapacidad, personas de color, hablantes no nativos de inglés y grupos en situación de desventaja económica— es esencial para comprender si el modelo trata a todos los escritores de forma justa.
El conjunto de datos PERSUADE contribuye a resolver esta cuestión. Desarrollado para impulsar la creación de algoritmos imparciales que evalúen la redacción de los alumnos, PERSUADE («Ensayos persuasivos para la valoración, selección y comprensión de elementos argumentativos y discursivos») es una colección etiquetada de casi 26 000 ensayos escritos por alumnos de secundaria y bachillerato estadounidenses entre 2010 y 2020. El conjunto de datos abarca a estudiantes de diversos orígenes y niveles de capacidad, y cada ensayo está etiquetado con información demográfica sobre el autor, como el curso, el género, el origen étnico y el contexto socioeconómico.
El conjunto de datos PERSUADE ofrece una excelente oportunidad para evaluar Pangram por dos razones. En primer lugar, Pangram no se entrena con el conjunto de datos PERSUADE, por lo que podemos utilizarlo para comprobar cómo se generaliza Pangram a textos de alumnos que no ha visto antes. En segundo lugar, los datos demográficos de PERSUADE —que incluyen muestras de redacción de poblaciones vulnerables— nos permiten examinar si Pangram funciona de forma equitativa en los distintos grupos demográficos.
Conclusión clave: Hemos evaluado Pangram 4 en el conjunto de datos PERSUADE 2.0, compuesto por ensayos de estudiantes de diversa procedencia, y no se han detectado falsos positivos en ninguno de los 25 996 ensayos. También hemos analizado los resultados en función de la discapacidad, el género, el curso, la raza y el origen étnico, la condición de estudiante de inglés como segunda lengua y la situación de desventaja económica. Pangram no ha generado ningún falso positivo en ninguno de los subgrupos analizados.
El desglose que figura a continuación describe cómo definieron los investigadores cada uno de los atributos demográficos del conjunto de datos PERSUADE y muestra el número de ensayos incluidos en cada grupo.
En el conjunto de datos PERSUADE 2.0, la condición de discapacidad se refiere a los alumnos que cuentan con un Plan de Educación Individualizado (IEP) o un Plan 504, y puede abarcar a alumnos con una amplia variedad de dificultades de aprendizaje o problemas de salud.
| Grupo | n | FPR |
|---|---|---|
| A quienes se les ha reconocido una discapacidad | 2,688 | 0% |
| No se le ha diagnosticado ninguna discapacidad | 18,135 | 0% |
| Desaparecidos/no denunciados | 5,173 | 0% |
El género en el conjunto de datos PERSUADE se identifica por el propio usuario, con una distribución aproximada del 50 % para hombres y del 50 % para mujeres. Pangram no ha detectado ningún falso positivo en ninguno de los dos grupos de género.
| Grupo | n | FPR |
|---|---|---|
| Mujer (M) | 13,142 | 0% |
| Hombre (H) | 12,854 | 0% |
Pangram 4 no generó ningún falso positivo en ninguno de los niveles de curso observados, lo que demuestra la solidez de Pangram para muchos niveles diferentes de competencia en la escritura.
| Grupo | n | FPR |
|---|---|---|
| 6.º curso | 1,372 | 0% |
| 8.º curso | 9,629 | 0% |
| 9.º curso | 2,066 | 0% |
| 10.º curso | 8,274 | 0% |
| 11.º curso | 3,083 | 0% |
| 12.º curso | 404 | 0% |
| Desaparecidos/no denunciados | 1,168 | 0% |
La mayoría de los autores que figuran en la base de datos PERSUADE se identificaron como blancos (45 %), seguidos de los hispanos (25 %) y, a continuación, los negros (19 %), lo que refleja aproximadamente la distribución demográfica de la población estudiantil de EE. UU.
| Grupo | n | FPR |
|---|---|---|
| Blanco | 11,571 | 0% |
| Hispano/Latino | 6,560 | 0% |
| Negro/afroamericano | 4,959 | 0% |
| De origen asiático o de las islas del Pacífico | 1,743 | 0% |
| Dos o más razas/Otros | 1,022 | 0% |
| Indígenas americanos/nativos de Alaska | 141 | 0% |
Aunque algunas investigaciones iniciales habían indicado que los antiguos programas de detección de IA podían mostrar un sesgo contra el inglés como segunda lengua y contra los estudiantes de inglés, Pangram ha demostrado que, en esencia, no presenta ningún sesgo contra estos autores y tiene una tasa de falsos positivos (FPR) observada del 0 % en los estudiantes de inglés como segunda lengua (ELL) del conjunto de datos PERSUADE.
| Grupo | n | FPR |
|---|---|---|
| ELL | 2,244 | 0% |
| No es un estudiante de inglés como segunda lengua (ELL) | 22,451 | 0% |
| Desaparecidos/no denunciados | 1,301 | 0% |
En el corpus PERSUADE, la situación de desventaja económica se define como el derecho de los alumnos a recibir determinadas ayudas federales, como el almuerzo escolar gratuito o a precio reducido y los Programas de Asistencia Nutricional Suplementaria.
| Grupo | n | FPR |
|---|---|---|
| En situación de desventaja económica | 9,643 | 0% |
| Probablemente no se encuentren en una situación de desventaja económica | 11,116 | 0% |
| Desaparecidos/no denunciados | 5,237 | 0% |
En los 25 996 ensayos escritos por personas que componen el corpus PERSUADE 2.0, Pangram 4 no generó ningún falso positivo en ninguno de los subgrupos, incluidos los relacionados con la discapacidad, el género, el nivel académico, el origen étnico, el estatus de estudiante de inglés y la situación de desventaja económica. Este resultado indica que Pangram se adapta bien a grupos de autores diversos sin clasificar erróneamente, de forma desproporcionada, los trabajos de estos escritores como generados por IA.
Nuestro objetivo es que los falsos positivos sean lo más infrecuentes posible en todos los grupos de autores, por lo que es importante llevar a cabo una evaluación continua. Sin embargo, en el marco de PERSUADE 2.0, Pangram 4 no presenta ningún falso positivo en ninguno de los subgrupos demográficos.

Katherine Thai es la investigadora científica fundadora especializada en inteligencia artificial de Pangram Labs, una empresa emergente dedicada a la detección mediante IA. En diciembre de 2025, se doctoró en Informática bajo la dirección de Mohit Iyyer en la Universidad de Massachusetts Amherst, donde su trabajo se centró en la evaluación de modelos de lenguaje a gran escala (LLM) en tareas relacionadas con el análisis literario.







