Las evaluaciones independientes realizadas por terceros confirman sistemáticamente las cifras de precisión internas de Pangram: un resumen de las pruebas externas.
Creemos que es importante que las instituciones puedan confiar en la alta precisión de Pangram; por ello, fomentamos la verificación por parte de terceros de nuestros indicadores de calidad (falsos positivos y falsos negativos). A continuación, destacaremos las evaluaciones de Pangram realizadas por investigadores de la Universidad de Chicago (UChicago) y la Universidad de Maryland (UMD), así como por revisores del sector privado.
Conclusión clave: Las pruebas internas de Pangram resisten el escrutinio de terceros.
En un artículo revisado por pares publicado en junio de 2026, un grupo de investigadores de la Vrije Universiteit Brussel probó cuatro herramientas de detección de IA —Pangram, GPTZero, Turnitin y Copyleaks— en 160 trabajos académicos de más de 4 000 palabras cada uno. El conjunto de datos estaba redactado en inglés y se dividía a partes iguales entre textos escritos por estudiantes de inglés como segunda lengua (ESL), textos generados por IA, textos híbridos (mezcla de texto humano y de IA) y textos de IA «humanizados».
Los investigadores descubrieron que Pangram era la única herramienta capaz de detectar de forma fiable el contenido generado por IA: «De las cuatro herramientas de detección de IA analizadas en este estudio, por el momento solo [Pangram] ha dado resultados satisfactorios».
Pangram fue la única herramienta capaz de detectar de forma fiable tanto los trabajos escritos íntegramente por IA como los humanizados (97,5 % y 95 %). En el conjunto de trabajos generados íntegramente por IA, las otras tres herramientas no detectaron prácticamente ninguno, con un resultado del 0 % en todos los casos. Ningún detector, salvo Pangram, gestionó de forma fiable el texto humanizado, aunque Turnitin logró detectar aproximadamente la mitad y Copyleaks, una cuarta parte.
| Herramienta | Índice de detección (totalmente basado en IA) | Tasa de detección (híbrida) | Tasa de detección (humanizada) | Índice de falsos positivos |
|---|---|---|---|---|
| Pangram | 97.5% | 95% | 95% | 0% |
| Turnitin | 0% | 60% | 52.5% | 0% |
| Copyleaks | 0% | 32.5% | 25% | 0% |
| GPTZero | 0% | 0% | 2.5% | pequeño sesgo positivo (la única herramienta que no da un resultado de cero en el texto humano) |
Investigaciones anteriores revelaron que otros detectores generaban falsos positivos en el caso de los autores que escriben en inglés como segunda lengua (ESL), pero este estudio independiente indica que Pangram no presenta un sesgo sustancial contra los textos escritos en inglés como segunda lengua.
En el Instituto Becker Friedman de Economía de la Universidad de Chicago, los investigadores compararon cuatro detectores de IA: Pangram, GPTZero, Originality AI y RoBERTa (un detector de IA de código abierto). El estudio utilizó cada uno de estos detectores para analizar 1.992 textos escritos por humanos antes de 2020 y 1.992 textos generados por IA, abarcando diferentes géneros y recuentos de palabras. Se analizaron dos tipos de errores en la detección de IA: las tasas de falsos positivos y las tasas de falsos negativos. Estas tasas se compararon para múltiples umbrales. Los detectores también clasificaron textos generados por IA a partir de modelos de lenguaje grandes (LLM) populares como ChatGPT, Claude y Gemini. Los investigadores establecieron múltiples límites máximos de la política de FPR entre los detectores para observar los cambios en la FNR.
Del estudio «Escritura artificial y detección automatizada », de Brian Jabarian y Alex Imas, de agosto de 2025:
Pangram supera a los demás detectores en todos los umbrales.
Pangram es el único detector que cumple con un límite estricto establecido por la política (FPR ≤ 0,005) sin comprometer la capacidad de detectar con precisión el texto generado por IA.
Pangram sigue siendo el líder en cuanto a bajo coste en todos los géneros y, de media, cuesta 0,0228 dólares por pasaje detectado correctamente por IA, frente a los 0,0416 dólares de OriginalityAI y los 0,0575 dólares de GPTZero, lo que convierte a Pangram en el detector más rentable tanto para pasajes completos como para fragmentos.
El estudio reveló que:
Pangram alcanza tasas de falsos positivos y falsos negativos prácticamente nulas en fragmentos de longitud media a larga.
La alta precisión de Pangram fue elogiada en distintos tipos de textos, como blogs, reseñas, currículos, noticias y novelas. En textos más breves, las tasas de falsos positivos y falsos negativos aumentan ligeramente, «pero se mantienen muy por debajo de los umbrales razonables establecidos».
Tasa media de falsos positivos (textos escritos por humanos marcados como generados por IA) y tasa media de falsos negativos (textos generados por IA no detectados) para cada detector, en los seis géneros y los cuatro modelos de lenguaje a gran escala (LLM). En ambos casos, cuanto menor sea el valor, mejor.
| Herramienta | Índice de falsos positivos | Tasa de falsos negativos | ¿Es «Robust» compatible con el humanizador de StealthGPT? |
|---|---|---|---|
| Pangram | 0.001 | 0.01 | Sí (detección cercana al 100 %) |
| Originality.ai | 0.002 | 0.035 | En parte (hasta un 0,21 de FNR en textos cortos) |
| GPTZero | 0.007 | 0.06 | No (FNR 0,50+) |
| RoBERTa (de código abierto) | 0.50 | poco fiable (marca la mayor parte del texto como «IA») | n/a (no aplicable) |
Pangram ya no ofrece predicciones para textos de menos de 50 palabras, pero, tal y como se señala en el estudio,
Pangram’s performance largely holds up on very short passages (< 50 words) and is robust to “humanizer” tools (e.g., StealthGPT), the performance of other detectors becomes case-dependent.
En el Experimento 1 de este estudio de la UMD, se recurrió a anotadores con distintos niveles de conocimiento sobre los modelos de lenguaje grande (LLM) para predecir si un texto había sido generado por IA o no. Tras observar que un anotador era casi perfecto a la hora de identificar textos generados por IA, se recurrió a otros cuatro anotadores expertos con una experiencia similar en el uso de los LLM para clasificar la misma muestra de 60 textos. Los resultados de las votaciones de los expertos se compararon con detectores comerciales como Pangram, Pangram Humanizer y GPTZero, así como con herramientas de código abierto como Fast-DetectGPT. Durante este proceso, se comparó Pangram con otros detectores.
Porcentaje de artículos generados por IA detectados (TPR) y tasa de falsos positivos en todas las condiciones, incluida la más difícil: el texto «o1-pro» humanizado. Solo Pangram estuvo a la altura de los expertos humanos.
| Detector | Detección global (TPR) | Índice de falsos positivos | Detección en texto humanizado |
|---|---|---|---|
| Expertos (voto mayoritario) | 99.3% | 0% | 100% |
| Humanizadores de pangramas | 99.3% | 2.7% | 96.7% |
| Pangram (básico) | 98.0% | 2% | 90.0% |
| GPTZero | 85.3% | 0.7% | 46.7% |
| Fast-DetectGPT | 80.0% | 7.2% | 23.3% |
| Prismáticos (modo de precisión) | 66.7% | 1.3% | 6.7% |
| RADAR | 15.3% | 2% | 0% |
Pangram es capaz de detectar con precisión el texto generado por IA y humanizado. Así lo confirman los informáticos de la UMD, quienes han señalado que Pangram obtuvo la puntuación global más alta en la detección de humanizadores y texto parafraseado, superando a otros programas de detección de IA con una precisión del 99,3 %.
Descubre más sobre cómo se comporta Pangram frente a los humanizadores
Amanda Caswell, de Tom’s Guide, afirmó en un artículo que, tras probar docenas de herramientas de detección de IA, Pangram «superó a las demás que probé». Además, se ha demostrado que Pangram está trabajando con ahínco para reducir los ya escasos casos de falsos positivos.
David Gewirtz, de ZDNET, describe a Pangram como «un recién llegado a nuestras pruebas que se ha aupado de inmediato al grupo de los ganadores».
Dado que el uso de la IA en los artículos de investigación ha aumentado, existe la preocupación de que esto pueda ser un indicio de conducta indebida. El artículo de Adam Day en Medium utilizó la detección de IA de Pangram para obtener resultados fiables sobre la prevalencia del contenido generado por IA, al tiempo que concluía que existen casos de uso legítimos de la IA generativa en la investigación. Day recomienda utilizar Pangram para llevar a cabo investigaciones y afirma: «Si alguien quiere realizar un estudio sobre el uso de la IA generativa en la literatura publicada, creo que las herramientas de Pangram ofrecen una gran oportunidad para hacerlo».
En Pangram, creemos que la transparencia es fundamental para generar confianza. Nos encantaría colaborar contigo para llevar la transparencia en la IA a tu organización.

Destiny es becaria de análisis de investigación en Pangram. Además, estudia Matemáticas Aplicadas y Química en el NYC College of Technology. El trabajo de Destiny en Pangram ha contribuido enormemente a la investigación sobre el contenido de IA en Internet. Fuera del ámbito laboral y académico, a Destiny le apasiona la escritura creativa y la ficción de terror.






