Casos prácticos

Evaluaciones de pangramas realizadas por terceros

Las evaluaciones independientes realizadas por terceros confirman sistemáticamente las cifras de precisión internas de Pangram: un resumen de las pruebas externas.

2 de agosto de 2026

Creemos que es importante que las instituciones puedan confiar en la alta precisión de Pangram; por ello, fomentamos la verificación por parte de terceros de nuestros indicadores de calidad (falsos positivos y falsos negativos). A continuación, destacaremos las evaluaciones de Pangram realizadas por investigadores de la Universidad de Chicago (UChicago) y la Universidad de Maryland (UMD), así como por revisores del sector privado.

Conclusión clave: Las pruebas internas de Pangram resisten el escrutinio de terceros.

Pangram alcanza una tasa de detección del 97,5 % en textos generados íntegramente por IA y cero falsos positivos en redacciones de estudiantes de inglés como segunda lengua (ESL).

En un artículo revisado por pares publicado en junio de 2026, un grupo de investigadores de la Vrije Universiteit Brussel probó cuatro herramientas de detección de IA —Pangram, GPTZero, Turnitin y Copyleaks— en 160 trabajos académicos de más de 4 000 palabras cada uno. El conjunto de datos estaba redactado en inglés y se dividía a partes iguales entre textos escritos por estudiantes de inglés como segunda lengua (ESL), textos generados por IA, textos híbridos (mezcla de texto humano y de IA) y textos de IA «humanizados».

Los investigadores descubrieron que Pangram era la única herramienta capaz de detectar de forma fiable el contenido generado por IA: «De las cuatro herramientas de detección de IA analizadas en este estudio, por el momento solo [Pangram] ha dado resultados satisfactorios».

Pangram fue la única herramienta capaz de detectar de forma fiable tanto los trabajos escritos íntegramente por IA como los humanizados (97,5 % y 95 %). En el conjunto de trabajos generados íntegramente por IA, las otras tres herramientas no detectaron prácticamente ninguno, con un resultado del 0 % en todos los casos. Ningún detector, salvo Pangram, gestionó de forma fiable el texto humanizado, aunque Turnitin logró detectar aproximadamente la mitad y Copyleaks, una cuarta parte.

HerramientaÍndice de detección (totalmente basado en IA)Tasa de detección (híbrida)Tasa de detección (humanizada)Índice de falsos positivos
Pangram97.5%95%95%0%
Turnitin0%60%52.5%0%
Copyleaks0%32.5%25%0%
GPTZero0%0%2.5%pequeño sesgo positivo (la única herramienta que no da un resultado de cero en el texto humano)

Investigaciones anteriores revelaron que otros detectores generaban falsos positivos en el caso de los autores que escriben en inglés como segunda lengua (ESL), pero este estudio independiente indica que Pangram no presenta un sesgo sustancial contra los textos escritos en inglés como segunda lengua.

Fiabilidad y precisión del pangram (Universidad de Chicago)

Experimento

En el Instituto Becker Friedman de Economía de la Universidad de Chicago, los investigadores compararon cuatro detectores de IA: Pangram, GPTZero, Originality AI y RoBERTa (un detector de IA de código abierto). El estudio utilizó cada uno de estos detectores para analizar 1.992 textos escritos por humanos antes de 2020 y 1.992 textos generados por IA, abarcando diferentes géneros y recuentos de palabras. Se analizaron dos tipos de errores en la detección de IA: las tasas de falsos positivos y las tasas de falsos negativos. Estas tasas se compararon para múltiples umbrales. Los detectores también clasificaron textos generados por IA a partir de modelos de lenguaje grandes (LLM) populares como ChatGPT, Claude y Gemini. Los investigadores establecieron múltiples límites máximos de la política de FPR entre los detectores para observar los cambios en la FNR.

Resultados

Del estudio «Escritura artificial y detección automatizada », de Brian Jabarian y Alex Imas, de agosto de 2025:

Pangram supera a los demás detectores en todos los umbrales.

Pangram es el único detector que cumple con un límite estricto establecido por la política (FPR ≤ 0,005) sin comprometer la capacidad de detectar con precisión el texto generado por IA.

Pangram sigue siendo el líder en cuanto a bajo coste en todos los géneros y, de media, cuesta 0,0228 dólares por pasaje detectado correctamente por IA, frente a los 0,0416 dólares de OriginalityAI y los 0,0575 dólares de GPTZero, lo que convierte a Pangram en el detector más rentable tanto para pasajes completos como para fragmentos.

El estudio reveló que:

Pangram alcanza tasas de falsos positivos y falsos negativos prácticamente nulas en fragmentos de longitud media a larga.

La alta precisión de Pangram fue elogiada en distintos tipos de textos, como blogs, reseñas, currículos, noticias y novelas. En textos más breves, las tasas de falsos positivos y falsos negativos aumentan ligeramente, «pero se mantienen muy por debajo de los umbrales razonables establecidos».

Tasa media de falsos positivos (textos escritos por humanos marcados como generados por IA) y tasa media de falsos negativos (textos generados por IA no detectados) para cada detector, en los seis géneros y los cuatro modelos de lenguaje a gran escala (LLM). En ambos casos, cuanto menor sea el valor, mejor.

HerramientaÍndice de falsos positivosTasa de falsos negativos¿Es «Robust» compatible con el humanizador de StealthGPT?
Pangram0.0010.01Sí (detección cercana al 100 %)
Originality.ai0.0020.035En parte (hasta un 0,21 de FNR en textos cortos)
GPTZero0.0070.06No (FNR 0,50+)
RoBERTa (de código abierto)0.50poco fiable (marca la mayor parte del texto como «IA»)n/a (no aplicable)

Pangram ya no ofrece predicciones para textos de menos de 50 palabras, pero, tal y como se señala en el estudio,

Pangram’s performance largely holds up on very short passages (< 50 words) and is robust to “humanizer” tools (e.g., StealthGPT), the performance of other detectors becomes case-dependent.

Actuación de Pangram frente a los Humanizers (Universidad de Maryland)

Experimento

En el Experimento 1 de este estudio de la UMD, se recurrió a anotadores con distintos niveles de conocimiento sobre los modelos de lenguaje grande (LLM) para predecir si un texto había sido generado por IA o no. Tras observar que un anotador era casi perfecto a la hora de identificar textos generados por IA, se recurrió a otros cuatro anotadores expertos con una experiencia similar en el uso de los LLM para clasificar la misma muestra de 60 textos. Los resultados de las votaciones de los expertos se compararon con detectores comerciales como Pangram, Pangram Humanizer y GPTZero, así como con herramientas de código abierto como Fast-DetectGPT. Durante este proceso, se comparó Pangram con otros detectores.

Porcentaje de artículos generados por IA detectados (TPR) y tasa de falsos positivos en todas las condiciones, incluida la más difícil: el texto «o1-pro» humanizado. Solo Pangram estuvo a la altura de los expertos humanos.

DetectorDetección global (TPR)Índice de falsos positivosDetección en texto humanizado
Expertos (voto mayoritario)99.3%0%100%
Humanizadores de pangramas99.3%2.7%96.7%
Pangram (básico)98.0%2%90.0%
GPTZero85.3%0.7%46.7%
Fast-DetectGPT80.0%7.2%23.3%
Prismáticos (modo de precisión)66.7%1.3%6.7%
RADAR15.3%2%0%

Resultados

Pangram es capaz de detectar con precisión el texto generado por IA y humanizado. Así lo confirman los informáticos de la UMD, quienes han señalado que Pangram obtuvo la puntuación global más alta en la detección de humanizadores y texto parafraseado, superando a otros programas de detección de IA con una precisión del 99,3 %.

Descubre más sobre cómo se comporta Pangram frente a los humanizadores

Evaluaciones de pangramas fuera de las instituciones de investigación

Amanda Caswell, de Tom’s Guide, afirmó en un artículo que, tras probar docenas de herramientas de detección de IA, Pangram «superó a las demás que probé». Además, se ha demostrado que Pangram está trabajando con ahínco para reducir los ya escasos casos de falsos positivos.

David Gewirtz, de ZDNET, describe a Pangram como «un recién llegado a nuestras pruebas que se ha aupado de inmediato al grupo de los ganadores».

Dado que el uso de la IA en los artículos de investigación ha aumentado, existe la preocupación de que esto pueda ser un indicio de conducta indebida. El artículo de Adam Day en Medium utilizó la detección de IA de Pangram para obtener resultados fiables sobre la prevalencia del contenido generado por IA, al tiempo que concluía que existen casos de uso legítimos de la IA generativa en la investigación. Day recomienda utilizar Pangram para llevar a cabo investigaciones y afirma: «Si alguien quiere realizar un estudio sobre el uso de la IA generativa en la literatura publicada, creo que las herramientas de Pangram ofrecen una gran oportunidad para hacerlo».

Conclusión

En Pangram, creemos que la transparencia es fundamental para generar confianza. Nos encantaría colaborar contigo para llevar la transparencia en la IA a tu organización.


Destiny Akinode
Destiny AkinodeBecaria de investigación

Destiny es becaria de análisis de investigación en Pangram. Además, estudia Matemáticas Aplicadas y Química en el NYC College of Technology. El trabajo de Destiny en Pangram ha contribuido enormemente a la investigación sobre el contenido de IA en Internet. Fuera del ámbito laboral y académico, a Destiny le apasiona la escritura creativa y la ficción de terror.

Más de Destiny Akinode

Lecturas relacionadas

Cada vez son más los artículos de congresos sobre IA redactados por la propia IA: un aumento del 370 % desde 2023
Casos prácticos

Cada vez son más los artículos de congresos sobre IA redactados por la propia IA: un aumento del 370 % desde 2023

30 de septiembre de 2024
¿Qué detector de IA es el más preciso? 30 herramientas analizadas (2026)
Casos prácticos

¿Qué detector de IA es el más preciso? 30 herramientas analizadas (2026)

7 de enero de 2026
El tres por ciento de las reseñas que aparecen en la primera página de Amazon están generadas por IA
Casos prácticos

El tres por ciento de las reseñas que aparecen en la primera página de Amazon están generadas por IA

4 de mayo de 2026
Pangram no detecta ningún falso positivo en diversos redacciones de los alumnos
Casos prácticos

Pangram no detecta ningún falso positivo en diversos redacciones de los alumnos

19 de agosto de 2026
Cómo utiliza Gradpilot el pangram para ayudar a los estudiantes a encontrar su voz
Casos prácticos

Cómo utiliza Gradpilot el pangram para ayudar a los estudiantes a encontrar su voz

15 de septiembre de 2025
¿En qué se diferencia Pangram de GPTZero?
Casos prácticos

¿En qué se diferencia Pangram de GPTZero?

22 de enero de 2026