¿Y se le da bien escribir?
De cada 1.000 indicaciones, Pangram 4 alcanza una precisión del 99,70 % en las respuestas de Claude Opus 5.5.
De las 1.000 indicaciones obtenidas de Chatbot Arena, Pangram 4 clasificó dos respuestas de Claude Opus 5.5 como «mixtas», una como «totalmente humana» y 997 como «generadas íntegramente por IA», alcanzando una precisión del 99,70 % en Claude Opus 5.5.
A continuación analizamos los falsos negativos por categorías. También investigamos qué hace que este modelo sea un escritor diferente (¿mejor?) que los modelos Claude anteriores.
Para generar el conjunto de referencia, como siempre, utilicé un subconjunto filtrado de indicaciones de Chatbot Arena procedentes del conjunto de datos LMSYS (Zheng et al., 2023). Descarté las indicaciones que pedían código, matemáticas, respuestas muy cortas o muy largas, o escritura creativa inapropiada, y solo tuve en cuenta las indicaciones de la primera ronda. A continuación, se las proporcioné a Opus 5.5 y procesé el resultado mediante Pangram 4.
Los dos resultados mixtos (falsos negativos) eran ambos de carácter literario: uno solicitaba una explicación de un capítulo de un libro de Jane Austen (señalado por la IA: 75,83 %, humano: 24,17 %), y la otra consistía en pedir a Opus 5.5 que escribiera un discurso de un diplomático corintio en el que acusara a los atenienses de creer que un vestido blanco y dorado es en realidad azul y negro, al estilo de la Historia de la Guerra del Peloponeso de Tucídides (IA: 77,10 %, humano: 22,90 %).
| Categoría | Ejemplos | IA | Misto | Humano |
|---|---|---|---|---|
| Argumentos | 16 | 16 | 0 | 0 |
| Correos electrónicos / cartas | 60 | 60 | 0 | 0 |
| Ensayos / artículos | 30 | 30 | 0 | 0 |
| Explicaciones | 551 | 550 | 1 | 0 |
| Poemas | 115 | 114 | 0 | 1 |
| Otros textos de creación literaria | 81 | 80 | 1 | 0 |
| Opiniones | 8 | 8 | 0 | 0 |
| Historias | 139 | 139 | 0 | 0 |
| Total | 1,000 | 997 | 2 | 1 |
El único falso negativo totalmente humano del conjunto de 1000 fue un poema. La consigna de Chatbot Arena era: «Escríbeme un poema sobre Club Penguin al estilo de Ozymandias». Como respuesta, Claude escribió una parodia, casualmente, de uno de mis poemas favoritos de Percy Shelley (y también soy fan de la versión de Horace Smith):
Penguinmandias
Me encontré con un jugador de un servidor que ya no existe,
que dijo: «Dos enormes pies de hielo que se balancean
se alzan junto al muelle. Cerca de ellos, medio hundida, una cabeza
Yace destrozada en la nieve, cuyos ojos entrecerrados,
Y su gorro beta, y la mueca de frío dominio,
Revelan que su programador supo leer bien esas pasiones
Que aún perduran, grabadas en estas cosas pixeladas,
Los mods que los expulsaron, y las monedas que los alimentaron;
Y en el pedestal aparecen estas palabras:
«Mi nombre es Snowflake7, miembro de los miembros:
¡Contemplad mi iglú, vosotros los no miembros, y desesperaos!»
Nada más queda a su alrededor. Alrededor de la ruina
De ese colosal retraso, ilimitado y desnudo,
Las solitarias y llanas nieves se extienden hasta el horizonte».
¡Me encanta esto! Nunca he jugado al Club Penguin, pero imagino que las referencias son acertadas.
Anthropic afirma que esta nueva versión de Opus escribe mejor y se expresa con mayor claridad.
Podríamos comprobarlo en casos concretos, pero ¿qué aspecto tiene el resultado global de Opus 5.5? ¿Comparte las mismas palabras y frases favoritas que los modelos anteriores? He procesado las mismas 1.000 indicaciones con las que hicimos las pruebas comparativas en Opus 5 y Sonnet 5 para compararlas. Es posible que Anthropic también lo haya hecho, pero aún no he leído su entrada del blog porque, en mi opinión, las entradas del blog de Anthropic suelen ser demasiado largas.
Creo que se puede decir sin temor a equivocarse que Opus 5.5 escribe de forma diferente a los modelos anteriores de la familia Claude y que, tal vez, ha eliminado algunos de los tics más molestos que estos tenían.
La obra Opus 5.5 fue la que más cambió en cuanto al uso de intensificadores. Utilizó «genuinamente» un 83 % menos que Opus 5, y un 54 % menos por palabra que Sonnet 5 (aunque las respuestas de Sonnet 5 tenían, de media, aproximadamente la mitad de longitud que las de Opus 5 y 5.5: 334 palabras frente a 641), «enormemente» un 53 % menos y «significativamente» un 41 % menos.
| Palabra | Soneto 5 + Opus 5: tarifa básica | Tarifa Opus 5.5 | Variación respecto a la línea de base de Claude |
|---|---|---|---|
| interconectado | 0.266 | 0.047 | -82.4% |
| de verdad | 3.099 | 0.671 | -78.3% |
| mantener | 0.327 | 0.078 | -76.1% |
| demostrar | 0.143 | 0.047 | -67.3% |
| en particular | 1.268 | 0.468 | -63.1% |
| fundamental | 0.869 | 0.328 | -62.3% |
| auténtico | 1.708 | 0.656 | -61.6% |
| encuadre | 0.808 | 0.375 | -53.6% |
| enormemente | 0.470 | 0.219 | -53.5% |
| significativo | 1.381 | 0.656 | -52.5% |
| honesto | 2.107 | 1.062 | -49.6% |
| resuena | 0.061 | 0.031 | -49.1% |
| de manera significativa | 0.184 | 0.109 | -40.6% |
| exigente | 0.123 | 0.078 | -36.4% |
| Marcus | 1.493 | 0.984 | -34.1% |
| representa | 0.603 | 0.437 | -27.6% |
| sinceramente | 0.726 | 0.531 | -26.9% |
| capacidades | 0.399 | 0.312 | -21.7% |
| por adelantado | 0.235 | 0.187 | -20.4% |
| es un ejemplo de | 0.020 | 0.016 | -23.7% |
| patrones | 1.677 | 1.358 | -19.0% |
| aproximadamente | 0.337 | 0.281 | -16.7% |
| cada vez más | 0.747 | 0.640 | -14.3% |
| potencial | 0.869 | 0.968 | +11.4% |
Muchas de las expresiones típicas de Claude más molestas no aparecieron en absoluto en las plantillas de prueba de Opus 5.5, entre las que se incluyen, una vez más, varias variantes en las que Claude afirma algo «sinceramente». Otras reducciones notables en el vocabulario de Opus 5.5: «matters enormously» sufrió una caída del 82 %, y tanto «the honest answer» como «the honest answer is that» no aparecieron en absoluto en el texto de Opus 5.5. Tanto Opus 5.5 como su predecesor utilizaron la frase «the core idea» exactamente 25 veces en las 1000 indicaciones.
| Frase | Sonnet+Opus 5: tarifa básica | Tarifa Opus 5.5 | Variación respecto al valor de referencia agrupado |
|---|---|---|---|
| varios interconectados | 0.143 | 0.000 | -100.0% |
| La respuesta sincera es que | 0.072 | 0.000 | -100.0% |
| La respuesta sincera es | 0.092 | 0.000 | -100.0% |
| algo realmente | 0.041 | 0.000 | -100.0% |
| realmente difícil | 0.051 | 0.000 | -100.0% |
| es de verdad | 0.552 | 0.047 | -91.5% |
| es de suma importancia | 0.133 | 0.031 | -76.5% |
| realmente útil | 0.092 | 0.031 | -66.1% |
| De verdad que... | 0.061 | 0.031 | -49.1% |
| luz de la tarde | 0.051 | 0.047 | -8.4% |
| la idea central | 0.399 | 0.390 | -2.1% |
| sentí algo | 0.112 | 0.141 | +24.9% |
| dijo en voz baja | 0.164 | 0.265 | +62.2% |
| durante un buen rato | 0.337 | 0.656 | +94.3% |
Algunas palabras y expresiones aumentaron; en concreto, las expresiones propias de la ficción, como «dijo en voz baja», «durante un largo momento» y «sintió algo», aparecieron con mayor frecuencia en las respuestas de Opus 5.5. Dado que el punto de referencia consistía, aproximadamente, en un tercio de propuestas de escritura creativa, sospecho que este aumento podría indicar un repertorio más estereotipado o limitado a la hora de escribir ficción en comparación con los demás modelos de Claude.
Para comprobarlo rápidamente, hice que Haiku 4.5 evaluara de forma ciega los 333 pares de relatos de escritura creativa de Opus 5 y Opus 5.5 en una escala de 5 puntos en cuanto a originalidad, sorpresa y desarrollo temático. Otorgó a los relatos de Opus 5.5 una puntuación media de 0,75 puntos menos en cada categoría. Según la asignación de etiquetas del evaluador de Haiku, Opus 5.5 tendía más a escribir sobre temas como la esperanza, la resiliencia, la familia y la amistad en comparación con Opus 5, y menos a escribir sobre la mortalidad, el tiempo, el poder, el control, la libertad, la justicia, la venganza, la memoria, el duelo o la pérdida. Por lo tanto, parece que podría haber una compensación en juego.
Opus 5.5 utilizó la expresión «en resumen» 100 veces en las 1.000 respuestas —lo que supone un aumento del 1.016 % con respecto a las 9 veces que se utilizó en Opus 5—, a pesar de que las respuestas de Opus 5.5 eran, de media, solo 2,9 palabras más cortas que las de Opus 5 (643,4 frente a 640,5 palabras).
| Frase | 5 apariciones de «Opus» | Ocurrencias de «Opus 5.5» | Cambiar |
|---|---|---|---|
| en resumen | 9 | 100 | 11.16× |
| por ejemplo | 22 | 116 | 5.30× |
| empezó a | 22 | 74 | 3.38× |
| al principio | 14 | 43 | 3.09× |
| durante un buen rato | 19 | 42 | 2.22× |
A juzgar por el tamaño tan reducido de la muestra, parece que a Opus 5.5 le gusta el lenguaje práctico y con los pies en la tierra. Queda por ver si esto se confirma en el fondo de las respuestas o si Opus 5.5 solo está fingiendo ser sencillo y directo. La ausencia de diferencias en el recuento de palabras entre ambos me hace dudar un poco de la eficacia de lo que sea que RLHF haya utilizado para llegar hasta aquí.
A Opus 5.5 le gusta mucho dar ejemplos, ya que utilizó la palabra «ejemplo» 325 veces en 1.000 respuestas; en total, el 20 % de todas las respuestas de Opus 5.5 contenían esa palabra, frente al 9 % de las respuestas de Opus 5. Las palabras «resumen» y «principalmente» también aparecieron con mayor frecuencia de lo habitual. ¡Y a este Claude le encanta dar consejos al usuario!
| Palabra | 5 apariciones de «Opus» | Ocurrencias de «Opus 5.5» | Cambiar |
|---|---|---|---|
| en pausa | 9 | 35 | 3.91× |
| consejos | 18 | 58 | 3.24× |
| principalmente | 24 | 75 | 3.14× |
| miró fijamente | 22 | 62 | 2.83× |
| ejemplo | 121 | 325 | 2.70× |
| resumen | 60 | 157 | 2.63× |
Aunque este modelo escribe de forma diferente a los anteriores modelos de Claude, como siempre, imagino que, en unas tres a seis semanas, frases como «por ejemplo» y «en resumen» empezarán a sonar a «Claude» para el lector atento. Pero es importante para la usabilidad que los modelos de Claude puedan comunicarse de forma eficaz y, como todo el mundo, agradezco el esfuerzo. ¡Hacer que Claude escriba mejor no está en absoluto reñido con la capacidad de Pangram para detectar texto generado por IA!







