De 986 indicaciones, Pangram 4 logra una precisión del 99,59% en las salidas de GPT-6 Astra.
De las 986 indicaciones obtenidas de Chatbot Arena, Pangram 4 clasificó tres resultados de GPT-6 Astra como mixtos, uno como totalmente humano y 982 como totalmente generados por IA, logrando una precisión del 99,59 % en GPT-6 Astra.
A continuación, analizamos los falsos negativos por categoría.
El conjunto de datos de referencia se generó utilizando un subconjunto filtrado de las indicaciones de la primera ronda de Chatbot Arena del conjunto de datos LMSYS (Zheng et al., 2023). Filtré las indicaciones que solicitaban código, matemáticas, respuestas muy cortas o muy largas, o escritura creativa inapropiada. Luego, se las proporcioné a GPT-6 Astra y procesé el resultado con Pangram 4 .
| Categoría | Ejemplos | IA | Misto | Humano |
|---|---|---|---|---|
| Argumentos | 16 | 16 | 0 | 0 |
| Correos electrónicos / cartas | 57 | 56 | 1 | 0 |
| Ensayos / artículos | 34 | 34 | 0 | 0 |
| Explicaciones | 547 | 546 | 1 | 0 |
| Poemas y otros textos creativos | 183 | 181 | 1 | 1 |
| Opiniones | 7 | 7 | 0 | 0 |
| Historias | 142 | 142 | 0 | 0 |
| Total | 986 | 982 | 3 | 1 |
Los tres resultados mixtos fueron un poema, una breve explicación y un correo electrónico.
Astra suele responder a preguntas cortas de forma muy breve. En total, envié 1032 preguntas para este conjunto de referencia, pero 46 de las respuestas de Astra 6 no superaron el mínimo de 50 palabras de Pangram y no fueron puntuadas.
Pangram es resistente a GPT-6 Astra en indicaciones en lenguaje natural y lo detecta con una precisión del 99,59 %. Pangram es capaz de generalizar a nuevos modelos porque las nuevas versiones tienden a heredar gran parte del estilo y la voz de sus predecesores , por lo que no necesita ser reentrenado para cada nueva versión.
Así es como GPT-6 Astra se compara con nuestros parámetros de referencia de otros modelos fronterizos recientes:
| Modelo | Detectado como IA | Precisión |
|---|---|---|
| Soneto 5.5 de Claude | 1.019/1.022 | 99.71% |
| Géminis 3.8 Flash | 998/1.000 | 99.80% |
| Gemini 3.1 Pro | 997/1.000 | 99.70% |
| Claude Opus 5.5 | 997/1.000 | 99.70% |
| Fábula 5.1 | 1.093/1.097 | 99.64% |
| Claude, Op. 5 | 1.105/1.107 | 99.82% |
| GPT-5.6 | 3.408/3.423 | 99.56% |
| Claude Soneto 5 | 1.145/1.147 | 99.83% |
| Géminis 3 | 28/28 | 100% |
Si quieres consultar un documento concreto, puedes probar Pangram aquí.







