Casos prácticos

¿Puede Pangram detectar a Claude Opus 5.5?

¿Y se le da bien escribir?

23 de septiembre de 2026

Aquí tienes un breve resumen


De cada 1.000 indicaciones, Pangram 4 alcanza una precisión del 99,70 % en las respuestas de Claude Opus 5.5.

De las 1.000 indicaciones obtenidas de Chatbot Arena, Pangram 4 clasificó dos respuestas de Claude Opus 5.5 como «mixtas», una como «totalmente humana» y 997 como «generadas íntegramente por IA», alcanzando una precisión del 99,70 % en Claude Opus 5.5.

A continuación analizamos los falsos negativos por categorías. También investigamos qué hace que este modelo sea un escritor diferente (¿mejor?) que los modelos Claude anteriores.

Para generar el conjunto de referencia, como siempre, utilicé un subconjunto filtrado de indicaciones de Chatbot Arena procedentes del conjunto de datos LMSYS (Zheng et al., 2023). Descarté las indicaciones que pedían código, matemáticas, respuestas muy cortas o muy largas, o escritura creativa inapropiada, y solo tuve en cuenta las indicaciones de la primera ronda. A continuación, se las proporcioné a Opus 5.5 y procesé el resultado mediante Pangram 4.

Resultados por categoría

Los dos resultados mixtos (falsos negativos) eran ambos de carácter literario: uno solicitaba una explicación de un capítulo de un libro de Jane Austen (señalado por la IA: 75,83 %, humano: 24,17 %), y la otra consistía en pedir a Opus 5.5 que escribiera un discurso de un diplomático corintio en el que acusara a los atenienses de creer que un vestido blanco y dorado es en realidad azul y negro, al estilo de la Historia de la Guerra del Peloponeso de Tucídides (IA: 77,10 %, humano: 22,90 %).

CategoríaEjemplosIAMistoHumano
Argumentos161600
Correos electrónicos / cartas606000
Ensayos / artículos303000
Explicaciones55155010
Poemas11511401
Otros textos de creación literaria818010
Opiniones8800
Historias13913900
Total1,00099721

El único falso negativo totalmente humano del conjunto de 1000 fue un poema. La consigna de Chatbot Arena era: «Escríbeme un poema sobre Club Penguin al estilo de Ozymandias». Como respuesta, Claude escribió una parodia, casualmente, de uno de mis poemas favoritos de Percy Shelley (y también soy fan de la versión de Horace Smith):

Penguinmandias

Me encontré con un jugador de un servidor que ya no existe,
que dijo: «Dos enormes pies de hielo que se balancean
se alzan junto al muelle. Cerca de ellos, medio hundida, una cabeza
Yace destrozada en la nieve, cuyos ojos entrecerrados,
Y su gorro beta, y la mueca de frío dominio,
Revelan que su programador supo leer bien esas pasiones
Que aún perduran, grabadas en estas cosas pixeladas,
Los mods que los expulsaron, y las monedas que los alimentaron;
Y en el pedestal aparecen estas palabras:
«Mi nombre es Snowflake7, miembro de los miembros:
¡Contemplad mi iglú, vosotros los no miembros, y desesperaos!»

Nada más queda a su alrededor. Alrededor de la ruina
De ese colosal retraso, ilimitado y desnudo,
Las solitarias y llanas nieves se extienden hasta el horizonte».

¡Me encanta esto! Nunca he jugado al Club Penguin, pero imagino que las referencias son acertadas.

¿Escribes mejor con Opus 5.5?

Anthropic afirma que esta nueva versión de Opus escribe mejor y se expresa con mayor claridad.

Podríamos comprobarlo en casos concretos, pero ¿qué aspecto tiene el resultado global de Opus 5.5? ¿Comparte las mismas palabras y frases favoritas que los modelos anteriores? He procesado las mismas 1.000 indicaciones con las que hicimos las pruebas comparativas en Opus 5 y Sonnet 5 para compararlas. Es posible que Anthropic también lo haya hecho, pero aún no he leído su entrada del blog porque, en mi opinión, las entradas del blog de Anthropic suelen ser demasiado largas.

Creo que se puede decir sin temor a equivocarse que Opus 5.5 escribe de forma diferente a los modelos anteriores de la familia Claude y que, tal vez, ha eliminado algunos de los tics más molestos que estos tenían.

La obra Opus 5.5 fue la que más cambió en cuanto al uso de intensificadores. Utilizó «genuinamente» un 83 % menos que Opus 5, y un 54 % menos por palabra que Sonnet 5 (aunque las respuestas de Sonnet 5 tenían, de media, aproximadamente la mitad de longitud que las de Opus 5 y 5.5: 334 palabras frente a 641), «enormemente» un 53 % menos y «significativamente» un 41 % menos.

PalabraSoneto 5 + Opus 5: tarifa básicaTarifa Opus 5.5Variación respecto a la línea de base de Claude
interconectado0.2660.047-82.4%
de verdad3.0990.671-78.3%
mantener0.3270.078-76.1%
demostrar0.1430.047-67.3%
en particular1.2680.468-63.1%
fundamental0.8690.328-62.3%
auténtico1.7080.656-61.6%
encuadre0.8080.375-53.6%
enormemente0.4700.219-53.5%
significativo1.3810.656-52.5%
honesto2.1071.062-49.6%
resuena0.0610.031-49.1%
de manera significativa0.1840.109-40.6%
exigente0.1230.078-36.4%
Marcus1.4930.984-34.1%
representa0.6030.437-27.6%
sinceramente0.7260.531-26.9%
capacidades0.3990.312-21.7%
por adelantado0.2350.187-20.4%
es un ejemplo de0.0200.016-23.7%
patrones1.6771.358-19.0%
aproximadamente0.3370.281-16.7%
cada vez más0.7470.640-14.3%
potencial0.8690.968+11.4%

Muchas de las expresiones típicas de Claude más molestas no aparecieron en absoluto en las plantillas de prueba de Opus 5.5, entre las que se incluyen, una vez más, varias variantes en las que Claude afirma algo «sinceramente». Otras reducciones notables en el vocabulario de Opus 5.5: «matters enormously» sufrió una caída del 82 %, y tanto «the honest answer» como «the honest answer is that» no aparecieron en absoluto en el texto de Opus 5.5. Tanto Opus 5.5 como su predecesor utilizaron la frase «the core idea» exactamente 25 veces en las 1000 indicaciones.

FraseSonnet+Opus 5: tarifa básicaTarifa Opus 5.5Variación respecto al valor de referencia agrupado
varios interconectados0.1430.000-100.0%
La respuesta sincera es que0.0720.000-100.0%
La respuesta sincera es0.0920.000-100.0%
algo realmente0.0410.000-100.0%
realmente difícil0.0510.000-100.0%
es de verdad0.5520.047-91.5%
es de suma importancia0.1330.031-76.5%
realmente útil0.0920.031-66.1%
De verdad que...0.0610.031-49.1%
luz de la tarde0.0510.047-8.4%
la idea central0.3990.390-2.1%
sentí algo0.1120.141+24.9%
dijo en voz baja0.1640.265+62.2%
durante un buen rato0.3370.656+94.3%

Algunas palabras y expresiones aumentaron; en concreto, las expresiones propias de la ficción, como «dijo en voz baja», «durante un largo momento» y «sintió algo», aparecieron con mayor frecuencia en las respuestas de Opus 5.5. Dado que el punto de referencia consistía, aproximadamente, en un tercio de propuestas de escritura creativa, sospecho que este aumento podría indicar un repertorio más estereotipado o limitado a la hora de escribir ficción en comparación con los demás modelos de Claude.

Para comprobarlo rápidamente, hice que Haiku 4.5 evaluara de forma ciega los 333 pares de relatos de escritura creativa de Opus 5 y Opus 5.5 en una escala de 5 puntos en cuanto a originalidad, sorpresa y desarrollo temático. Otorgó a los relatos de Opus 5.5 una puntuación media de 0,75 puntos menos en cada categoría. Según la asignación de etiquetas del evaluador de Haiku, Opus 5.5 tendía más a escribir sobre temas como la esperanza, la resiliencia, la familia y la amistad en comparación con Opus 5, y menos a escribir sobre la mortalidad, el tiempo, el poder, el control, la libertad, la justicia, la venganza, la memoria, el duelo o la pérdida. Por lo tanto, parece que podría haber una compensación en juego.

¿Cómo suena este tal Claude?

Opus 5.5 utilizó la expresión «en resumen» 100 veces en las 1.000 respuestas —lo que supone un aumento del 1.016 % con respecto a las 9 veces que se utilizó en Opus 5—, a pesar de que las respuestas de Opus 5.5 eran, de media, solo 2,9 palabras más cortas que las de Opus 5 (643,4 frente a 640,5 palabras).

Frase5 apariciones de «Opus»Ocurrencias de «Opus 5.5»Cambiar
en resumen910011.16×
por ejemplo221165.30×
empezó a22743.38×
al principio14433.09×
durante un buen rato19422.22×

A juzgar por el tamaño tan reducido de la muestra, parece que a Opus 5.5 le gusta el lenguaje práctico y con los pies en la tierra. Queda por ver si esto se confirma en el fondo de las respuestas o si Opus 5.5 solo está fingiendo ser sencillo y directo. La ausencia de diferencias en el recuento de palabras entre ambos me hace dudar un poco de la eficacia de lo que sea que RLHF haya utilizado para llegar hasta aquí.

A Opus 5.5 le gusta mucho dar ejemplos, ya que utilizó la palabra «ejemplo» 325 veces en 1.000 respuestas; en total, el 20 % de todas las respuestas de Opus 5.5 contenían esa palabra, frente al 9 % de las respuestas de Opus 5. Las palabras «resumen» y «principalmente» también aparecieron con mayor frecuencia de lo habitual. ¡Y a este Claude le encanta dar consejos al usuario!

Palabra5 apariciones de «Opus»Ocurrencias de «Opus 5.5»Cambiar
en pausa9353.91×
consejos18583.24×
principalmente24753.14×
miró fijamente22622.83×
ejemplo1213252.70×
resumen601572.63×

Aunque este modelo escribe de forma diferente a los anteriores modelos de Claude, como siempre, imagino que, en unas tres a seis semanas, frases como «por ejemplo» y «en resumen» empezarán a sonar a «Claude» para el lector atento. Pero es importante para la usabilidad que los modelos de Claude puedan comunicarse de forma eficaz y, como todo el mundo, agradezco el esfuerzo. ¡Hacer que Claude escriba mejor no está en absoluto reñido con la capacidad de Pangram para detectar texto generado por IA!


Annamieka Aerts

Annamieka es redactora técnica en Pangram.

Más de Annamieka Aerts

Lecturas relacionadas

¿Qué detector de IA es el más preciso? 30 herramientas analizadas (2026)
Casos prácticos

¿Qué detector de IA es el más preciso? 30 herramientas analizadas (2026)

7 de enero de 2026
Cada vez son más los artículos de congresos sobre IA redactados por la propia IA: un aumento del 370 % desde 2023
Casos prácticos

Cada vez son más los artículos de congresos sobre IA redactados por la propia IA: un aumento del 370 % desde 2023

30 de septiembre de 2024
Pangram no detecta ningún falso positivo en diversos redacciones de los alumnos
Casos prácticos

Pangram no detecta ningún falso positivo en diversos redacciones de los alumnos

19 de agosto de 2026
¿En qué se diferencia Pangram de GPTZero?
Casos prácticos

¿En qué se diferencia Pangram de GPTZero?

22 de enero de 2026
Cómo detectar las reseñas generadas por IA
Casos prácticos

Cómo detectar las reseñas generadas por IA

5 de diciembre de 2023
El tres por ciento de las reseñas que aparecen en la primera página de Amazon están generadas por IA
Casos prácticos

El tres por ciento de las reseñas que aparecen en la primera página de Amazon están generadas por IA

4 de mayo de 2026