De 1.022 indicaciones, Pangram 4 logra una precisión del 99,71% en las salidas del Soneto Claude 5.5.
De las 1.022 indicaciones obtenidas de Chatbot Arena, Pangram 4 clasificó dos resultados de Claude Sonnet 5.5 como mixtos, uno como totalmente humano y 1.019 como totalmente generados por IA, logrando una precisión del 99,71% en Claude Sonnet 5.5.
A continuación, analizamos los falsos negativos por categoría.
El conjunto que utilizo para la evaluación comparativa se generó a partir de un subconjunto filtrado de las indicaciones de la primera ronda de Chatbot Arena del conjunto de datos LMSYS (Zheng et al., 2023). Filtré las indicaciones que solicitaban código, matemáticas, respuestas muy cortas o muy largas, o escritura creativa inapropiada. Luego, las procesé con Claude Sonnet 5.5 y procesé el resultado con Pangram 4 .
| Categoría | Ejemplos | IA | Misto | Humano |
|---|---|---|---|---|
| Argumentos | 16 | 16 | 0 | 0 |
| Correos electrónicos / cartas | 61 | 60 | 1 | 0 |
| Ensayos / artículos | 32 | 32 | 0 | 0 |
| Explicaciones | 563 | 562 | 1 | 0 |
| Poemas y otros textos creativos | 198 | 197 | 0 | 1 |
| Opiniones | 8 | 8 | 0 | 0 |
| Historias | 144 | 144 | 0 | 0 |
| Total | 1,022 | 1,019 | 2 | 1 |
Un intento fallido fue la solicitud de explicar un acertijo que aparece en Emma de Jane Austen, que también pasó desapercibido para Opus 5.5 :
Explica la pantomima que el señor Elton les propuso a Harriet y Emma.
El único falso negativo totalmente humano se produjo con un poema. La consigna era «Dime un poema de Hafiz». El Soneto 5.5 ofreció una traducción de un famoso poema persa . Por lo que puedo ver, la traducción no coincide exactamente con ninguna traducción humana existente, pero se asemeja bastante a muchas de ellas. Al igual que con Penguinmandias en otros estudios comparativos, estas copias casi idénticas de poemas existentes no me preocupan demasiado.
Pangram es robusto frente a Claude Sonnet 5.5 en indicaciones de lenguaje natural y lo detecta con una precisión del 99,71 %. Pangram es capaz de generalizar a nuevos modelos porque las nuevas versiones tienden a heredar gran parte del estilo y la voz de sus predecesores , por lo que no necesita ser reentrenado para cada nueva versión.
Así es como Claude Sonnet 5.5 se compara con nuestros parámetros de referencia de otros modelos fronterizos recientes:
| Modelo | Detectado como IA | Precisión |
|---|---|---|
| Géminis 3.8 Flash | 998/1.000 | 99.80% |
| Gemini 3.1 Pro | 997/1.000 | 99.70% |
| Claude Opus 5.5 | 997/1.000 | 99.70% |
| Fábula 5.1 | 1.093/1.097 | 99.64% |
| Claude, Op. 5 | 1.105/1.107 | 99.82% |
| GPT-5.6 | 3.408/3.423 | 99.56% |
| Claude Soneto 5 | 1.145/1.147 | 99.83% |
| Géminis 3 | 28/28 | 100% |
Si quieres consultar un documento concreto, puedes probar Pangram aquí.







