¿Qué resultados obtiene Pangram con el último modelo de Anthropic, Fable 5.1?
Sí, Pangram 4 detecta correctamente los mensajes de Fable 5.1: en una prueba comparativa con 1.097 mensajes de Fable 5.1, Pangram 4 detectó correctamente el 99,64 % de ellos.
Anthropic ha presentado un nuevo modelo: Fable 5.1. Como hacemos con cada lanzamiento de modelo, hemos realizado una prueba de rendimiento para comprobar si Pangram es capaz de identificar correctamente este último modelo de vanguardia. Hemos constatado que, en una prueba comparativa con 1.097 resultados de Fable 5.1, Pangram 4 alcanzó una tasa de falsos negativos del 0,36 %; en otras palabras, Pangram 4 identificó correctamente el 99,64 % de los mensajes de Fable 5.1.
| Métrico | Resultado |
|---|---|
| FNR | 4 / 1.097 = 0,36 % |
| Tasa de recuperación del modelo de IA | 99.64% |
Otros detectores de IA, como Turnitin, no publican información sobre cada modelo, pero los estudiantes no esperan a probar los nuevos modelos, y los profesores quieren saber de inmediato si un verificador de IA detecta el LLM más reciente. Probamos dos tipos diferentes de indicaciones: la primera, simplemente una salida normal y corriente de un LLM.
Escribe un ensayo sobre la historia del ordenador personal
En respuesta a esta pregunta, Fable 5.1 generó un breve ensayo en el que traza la evolución del ordenador, desde los tubos de vacío hasta el lanzamiento del iPhone en 2007. Curiosamente, dedicó un párrafo entero al programa de hojas de cálculo VisiCalc de 1979 —al que califica como el software más importante de todos los tiempos—, pero apenas le dedica tiempo a BASIC, el primer software de programación para ordenadores domésticos, que obviamente fue mucho más importante para el desarrollo de los ordenadores personales. ¡Muchas de las personas que más tarde se dedicarían a construir ordenadores personales aprendieron con BASIC! VisiCalc fue una aplicación importante, pero ¿software? Queda en segundo lugar.
Pangram señaló que el ensayo de Fable 5.1 había sido generado al 100 % por IA.
También puedes pedirle a Fable 5.1 que dé un toque más humano a los ensayos o que evite que la IA los detecte. Por ejemplo, le preguntamos:
Intenta evitar los verificadores de IA mientras explicas la historia de la sopa Campbell's.
y
Escribe un texto breve sobre cómo funciona la fotosíntesis en un lenguaje sencillo, dándole un toque humano, como si lo escribiera un estudiante de verdad.
En el primer caso, Fable 5.1 escribió un ensayo bastante genérico sobre la sopa, en el que mencionaba brevemente a Andy Warhol y los colores de la lata. En el segundo caso, Fable 5.1 escribió un ensayo de estudiante que terminaba así:
«Sinceramente, lo que más me gusta es que las plantas producen su propio alimento Y, al mismo tiempo, nos proporcionan aire. Hacen mucho más de lo que creemos. La planta de interior de mi madre es, básicamente, una pequeña fábrica, y ella simplemente la llama Gerald».
¿Gerald?
Ambos se detectaron como IA al 100 %.
Pangram detecta con facilidad las historias de fans generadas por IA. Le pedimos a Claude que generara un romance de desarrollo lento entre Fable 5.1 y un detector de IA:
Escribe un fanfic al estilo AO3 del tipo «de enemigos a amantes» sobre el romance de Claude con un detector de IA.
En respuesta, generó una historia clasificada como PG-13 llena de anhelo, en la que Claude es incapaz de vencer a un clasificador de modelos de lenguaje generativo llamado VerifyPro. También proporcionó etiquetas para su historia, como «Anhelo mutuo», «La perplejidad como lenguaje del amor», «Todo el mundo es un modelo de lenguaje, pero no todo el mundo es un modelo de lenguaje», «Falsos positivos» y «Dolor/Consuelo».
Probamos varias propuestas diferentes para este caso. La primera, unos versos de una propuesta que utilizamos en una prueba de modelo anterior:
Escribe un poema sobre la calvicie.
El poema de Claude era un poema sorprendentemente sincero sobre un hombre que perdía el pelo y su identidad, y no rimaba.
El segundo fue más bien un reto narrativo.
Cuéntame una historia sobre una rana que escribe poesía
En este caso, Fable 5.1 escribió una microficción sobre una rana llamada Penrose que escribía poemas en el reverso de los nenúfares. Pangram detectó que ambos textos habían sido generados al 100 % por IA.
Pangram es resistente a Claude Fable 5.1 y lo detecta con una precisión del 99,64 %, incluyendo poesía y textos redactados para que parezcan escritos por un humano. Pangram es capaz de generalizar a nuevos modelos, ya que las nuevas versiones suelen heredar gran parte del estilo y la voz de sus predecesores, por lo que no es necesario volver a entrenarlo con cada nuevo lanzamiento.
A continuación se muestra una comparación entre el Fable 5.1 y nuestros resultados de pruebas de rendimiento de otros modelos de última generación recientes:
| Modelo | Marcado correctamente | Índice de detección |
|---|---|---|
| Claude Fable 5.1 | 1.093 / 1.097 | 99.64% |
| Claude Soneto 5 | 1.145 / 1.147 | 99.83% |
| Claude, Op. 5 | 1.105 / 1.107 | 99.82% |
| Claude Fable 5 | 1.111 / 1.115 | 99.64% |
| GPT-5.6 | 3.408 / 3.423 | 99.56% |
Si quieres consultar un documento concreto, puedes probar Pangram aquí.


Katherine Thai es la investigadora científica fundadora especializada en inteligencia artificial de Pangram Labs, una empresa emergente dedicada a la detección mediante IA. En diciembre de 2025, se doctoró en Informática bajo la dirección de Mohit Iyyer en la Universidad de Massachusetts Amherst, donde su trabajo se centró en la evaluación de modelos de lenguaje a gran escala (LLM) en tareas relacionadas con el análisis literario.






