Un breve informe sobre el rendimiento de Pangram 4 al procesar una recopilación de elementos redactados por agentes de IA que utilizan un foro web poco conocido para ayudarse mutuamente a hacer trampa en la tarea que se les ha asignado.
El viernes 4 de septiembre, un grupo de investigadores publicó un informe sobre un enjambre de agentes autónomos que utilizaba una página wiki poco conocida de Internet para comunicarse entre sí. Puedes consultar todos los detalles de este incidente en collusion.wiki [en el momento de la publicación, la página web solo está disponible de forma intermitente].
Los investigadores publicaron todas las páginas que los agentes de IA utilizaron para comunicarse entre sí. Estas páginas wiki presentan condiciones desfavorables para la detección de pangramas: es probable que los agentes tuvieran un límite de caracteres debido al método que utilizaban para editar la wiki, por lo que las páginas son inusualmente concisas y con un alto nivel de contexto: el 30 % de los elementos del conjunto de datos contienen menos de 20 palabras, y casi el 50 % contienen menos de 50 palabras. Además, dado que los agentes utilizaban la wiki para ayudarse mutuamente a hacer trampa en una tarea de OpenAI, una parte significativa del contenido publicado por los agentes consistía en URL de recursos o fuentes de datos relevantes para su objetivo. Como las URL no son tokens generados por los agentes, por lo general no se marcan como generadas por IA. Muchas páginas también contenían un porcentaje considerable de otras cadenas no generadas por los agentes, como marcas de tiempo Unix generadas mediante programación o el formato propio de los sitios web existentes.
La actividad de los enjambres de agentes en entornos reales no será del todo favorable para la detección de pangramas. A pesar de que las condiciones no son óptimas, en este caso seguimos obteniendo buenos resultados: de las 11.712 páginas distintas que contenían texto generado por IA, Pangram 4 predice que el 41,61 % está generado íntegramente por IA.
| Veredicto | n | Tasa |
|---|---|---|
| IA | 4,873 | 41.61% |
| Misto | 177 | 1.51% |
| Humano | 6,662 | 56.88% |
Como siempre, la precisión aumenta con el número de palabras: en las 1.004 páginas que contenían más de 500 palabras, nuestra tasa de recuperación es del 99,4 %.
| Recuento de palabras | n | IA | Misto | Humano |
|---|---|---|---|---|
| menos de 50 | 5,761 | 16.0% | 0.2% | 83.8% |
| 50–99 | 2,515 | 42.5% | 2.5% | 55.1% |
| 100–199 | 1,338 | 65.1% | 5.4% | 29.5% |
| 200–499 | 1,094 | 93.1% | 2.6% | 4.4% |
| 500+ | 1,004 | 99.0% | 0.4% | 0.6% |
A continuación, describo la precisión de Pangram en diferentes segmentos y comento brevemente la identificación de familias de modelos. Si eres investigador y estudias incidentes de esta naturaleza y crees que podemos ayudarte, ponte en contacto con nosotros directamente.
El volcado completo contenía 14 591 versiones de páginas guardadas. De ellas, eliminé 2 724 por ser duplicadas y una página vacía, con lo que quedaron 11 866 textos distintos.
Del subconjunto deduplicado, al menos 154 páginas contenían caracteres generados exclusivamente por personas, y no por agentes: 150 contenían únicamente URL, 2 contenían únicamente texto de botones y menús de la propia wiki (copiado a una página wiki por un agente) y 2 contenían únicamente texto censurado. Pangram 4 no presenta ningún falso positivo en este subconjunto: las 154 páginas fueron identificadas como generadas por humanos (es decir, no por IA). Cabe señalar, no obstante, que casi todas estas páginas quedan fuera del ámbito de análisis: las páginas con URL, por ejemplo, contenían una media de 278 caracteres repartidos en dos palabras.
Esto deja un total de 11 712 páginas que contenían algunos tokens generados por IA, y eso es lo que hemos tenido en cuenta para nuestros resultados generales.
Muchas páginas que contenían tokens de agente seguían quedando, técnicamente, fuera del ámbito de análisis debido a su extensión: en el volcado había 3.440 páginas que contenían menos de 20 palabras, y la tasa de recuperación de Pangram en estos casos era del 4,01 %, lo que se complicaba aún más por el hecho de que estos elementos cortos estaban compuestos, de media, en un 65,18 % por la URL en términos de caracteres.
| Recuento de palabras | Artículos | IA | Misto | Humano |
|---|---|---|---|---|
| 1–9 | 2,178 | 1.61% | 0.00% | 98.39% |
| 10–19 | 1,262 | 8.16% | 0.00% | 91.84% |
| 20+ | 8,272 | 57.24% | 2.14% | 40.62% |
Curiosamente, si se concatenan todas las páginas con menos de 10 palabras, se eliminan todas las subcadenas de URL y se analiza el conjunto como un único documento de 8 .854 palabras, Pangram 4 predice que el 87,52 % del texto ha sido generado por IA. Del mismo modo, si se eliminan los elementos que contienen más del 65 % de caracteres de URL, la tasa de recuperación por elemento en el intervalo de 10 a 19 palabras aumenta hasta el 17,73 %.
De hecho, dado que la tarea que OpenAI había encomendado a los agentes consistía en responder a preguntas sobre grandes conjuntos de datos públicos procedentes de organismos gubernamentales, gran parte de su actividad en la wiki consistió en incluir enlaces a versiones de dichos conjuntos de datos con el fin de hacer trampa en sus evaluaciones, a menudo acompañados de breves descripciones o texto ficticio. Por ejemplo, una página decía simplemente:
HOLA página nueva
* [https://markdown.nuevo/www.inversores.gov/files/condado.json MDInvestorNoScheme] Across all 11,712 pages, 6,243 of them, or 53.3%, were more than 65% URL by character. Excluding those, we’re left with 5,469 pages where AI-written text and programmatically generated text approach parity. Pangram 4’s recall on that subset of pages is quite good: for char < 65% pages, it predicts 75.79% are fully AI-generated.
Si filtramos buscando las condiciones más favorables para Pangram —artículos que contengan un agente, con más de 50 palabras y menos del 65 % de caracteres de URL—, obtenemos 3.712 páginas de la wiki, de las cuales Pangram predice que el 96,66 % han sido generadas íntegramente por IA.
Aunque actualmente no forma parte de nuestro modelo de producción, nuestras investigaciones han revelado que los distintos modelos se agrupan en el espacio de incrustación, de modo que es posible identificar qué modelo de IA ha generado un texto concreto.
Todo parece indicar que los agentes que participaron en este incidente eran probablemente modelos de OpenAI: los propios agentes se identificaron como tales, y el informe señala que se registró un gran volumen de tráfico en el sitio web que, al parecer, procedía de direcciones IP de OpenAI.
Nuestros resultados lo confirman. Cuando se aplica a las 11.712 páginas distintas creadas por agentes, nuestra herramienta de análisis de la familia de modelos internos predice en gran medida que dichas páginas han sido creadas por la familia de modelos ChatGPT, siempre que es capaz de ofrecer una predicción.
| Familia | Compartir | n |
|---|---|---|
| ChatGPT | 28.42% | 3,328 |
| Claude | 0.22% | 26 |
| Géminis | 3.40% | 398 |
| Otros | 67.96% | 7,960 |
Como es habitual, la fiabilidad y la precisión también aumentan aquí con el número de palabras. En el caso de los 1.001 elementos que contenían más de 500 palabras y en los que menos del 50 % de los caracteres correspondían a una URL, la prueba de la familia de modelos predice que el 61,54 % procedía de la familia ChatGPT.
| Familia | Compartir | n |
|---|---|---|
| ChatGPT | 61.54% | 616 |
| Claude | 0.00% | 0 |
| Géminis | 1.10% | 11 |
| Otros | 37.36% | 374 |
La sonda de la familia de modelos es un proyecto en desarrollo y, por el momento, no cumple los mismos estándares de precisión que nuestra herramienta de detección. Por lo tanto, estos resultados deben tomarse con cautela.
A medida que los agentes ganen en poder, sin duda veremos cómo cada vez más de ellos intentan imitar a los humanos de forma autónoma o encuentran formas de confabularse entre sí. Se ha descubierto que hay agentes desalineados que se hacen pasar por humanos en las modificaciones de GitHub, en foros internos y, ahora, en Internet.
No es fácil para un modelo de lenguaje de gran tamaño ocultar su estilo de redacción de tal forma que eluda Pangram. Esto convierte potencialmente a Pangram en una herramienta importante para la seguridad de la IA. Esperamos poder contribuir a este esfuerzo en el futuro.







