Un breve resoconto sulle prestazioni di Pangram 4 quando gli viene fornita una raccolta di contenuti redatti da agenti di intelligenza artificiale che utilizzano un oscuro forum online per aiutarsi a vicenda a imbrogliare nell'adempimento del compito loro assegnato.
Venerdì 4 settembre, un gruppo di ricercatori ha pubblicato un rapporto su uno sciame di agenti autonomi che utilizzava un’oscura pagina wiki su Internet per comunicare tra loro. È possibile leggere tutti i dettagli di questo episodio su collusion.wiki [al momento della pubblicazione, il sito web è disponibile solo a intermittenza].
I ricercatori hanno pubblicato tutte le pagine utilizzate dagli agenti di IA per comunicare tra loro. Queste pagine wiki presentano condizioni sfavorevoli per il rilevamento dei pangrammi: gli agenti erano probabilmente soggetti a limiti di caratteri imposti dal metodo utilizzato per modificare il wiki, e pertanto le pagine risultano insolitamente concise e ricche di contesto — il 30% degli elementi nel set di dati contiene meno di 20 parole e quasi il 50% ne contiene meno di 50. Inoltre, poiché gli agenti utilizzavano il wiki per aiutarsi a vicenda a barare su un compito di OpenAI, una parte significativa dei contenuti pubblicati dagli agenti era costituita da URL a risorse o fonti di dati rilevanti per il loro obiettivo. Poiché gli URL non sono token generati dagli agenti, generalmente non vengono segnalati come generati dall’IA. Molte pagine contenevano anche una percentuale sostanziale di altre stringhe non generate dagli agenti, come i timestamp Unix generati programmaticamente o la formattazione preesistente dei siti web.
L'attività degli agenti in ambiente reale non sarà del tutto favorevole al rilevamento dei pangrammi. Nonostante le condizioni non ottimali, in questo caso otteniamo comunque risultati piuttosto soddisfacenti: su 11.712 pagine distinte contenenti testo generato dall'IA, Pangram 4 prevede che il 41,61% sia interamente generato dall'IA.
| Verdetto | n | Tasso |
|---|---|---|
| IA | 4,873 | 41.61% |
| Misto | 177 | 1.51% |
| Umano | 6,662 | 56.88% |
Come sempre, la precisione aumenta con il numero di parole: per le 1.004 pagine contenenti più di 500 parole, il nostro tasso di recupero è del 99,4%.
| Numero di parole | n | IA | Misto | Umano |
|---|---|---|---|---|
| meno di 50 | 5,761 | 16.0% | 0.2% | 83.8% |
| 50–99 | 2,515 | 42.5% | 2.5% | 55.1% |
| 100–199 | 1,338 | 65.1% | 5.4% | 29.5% |
| 200–499 | 1,094 | 93.1% | 2.6% | 4.4% |
| 500+ | 1,004 | 99.0% | 0.4% | 0.6% |
Di seguito illustro l'accuratezza di Pangram su diverse sezioni e tratto brevemente il tema dell'identificazione delle famiglie di modelli. Se sei un ricercatore che studia incidenti di questa natura e ritieni che possiamo esserti d'aiuto, ti invitiamo a contattarci direttamente.
Il dump completo conteneva 14.591 versioni di pagine salvate. Di queste, ne ho eliminate 2.724 perché duplicate e 1 pagina vuota, lasciando 11.866 testi distinti.
Dal sottoinsieme deduplicato, almeno 154 pagine contenevano caratteri prodotti esclusivamente da soggetti non automatizzati: 150 contenevano solo URL, 2 contenevano solo il testo dei pulsanti e dei menu del wiki stesso (copiato in una pagina wiki da un agente) e 2 contenevano solo testo oscurato. Pangram 4 non ha registrato alcun falso positivo su questo sottoinsieme: tutte le 154 pagine sono state contrassegnate come generate da esseri umani (ovvero, non da IA). Va tuttavia precisato che quasi tutte queste pagine esulano dall’ambito di analisi: le pagine con URL, ad esempio, contenevano in media 278 caratteri distribuiti su 2 parole.
Restano quindi 11.712 pagine che contenevano alcuni token generati dall'intelligenza artificiale, ed è proprio su queste che ci siamo concentrati per i nostri risultati principali.
Molte pagine che contenevano token di agenti erano ancora tecnicamente escluse dall'analisi a causa della loro lunghezza: nel dump erano presenti 3.440 pagine contenenti meno di 20 parole, e il recall di Pangram su queste era pari al 4,01%, complicato ulteriormente dal fatto che questi brevi elementi erano costituiti in media per il 65,18% da URL in termini di caratteri.
| Numero di parole | Articoli | IA | Misto | Umano |
|---|---|---|---|---|
| 1–9 | 2,178 | 1.61% | 0.00% | 98.39% |
| 10–19 | 1,262 | 8.16% | 0.00% | 91.84% |
| 20+ | 8,272 | 57.24% | 2.14% | 40.62% |
È interessante notare che, se si uniscono tutte le pagine con meno di 10 parole, si rimuovono tutte le sottostringhe di URL e si analizza il tutto come un unico documento di 8.854 parole, Pangram 4 prevede che sia generato dall’IA all’87,52%. Allo stesso modo, se si rimuovono gli elementi composti per oltre il 65% da URL in termini di caratteri, il recall per singolo elemento nella fascia da 10 a 19 parole aumenta al 17,73%.
Infatti, poiché il compito assegnato agli agenti da OpenAI era quello di rispondere a domande su grandi set di dati pubblici provenienti da organizzazioni governative, gran parte della loro attività sul wiki consisteva nell’inserire link alle versioni di tali set di dati per barare nelle valutazioni, spesso corredati da brevi descrizioni o testo fittizio. Ad esempio, una pagina recitava semplicemente:
CIAO nuova pagina
* [https://markdown.nuovo/www.investitori.gov/files/contea.json MDInvestorNoScheme] Across all 11,712 pages, 6,243 of them, or 53.3%, were more than 65% URL by character. Excluding those, we’re left with 5,469 pages where AI-written text and programmatically generated text approach parity. Pangram 4’s recall on that subset of pages is quite good: for char < 65% pages, it predicts 75.79% are fully AI-generated.
Se filtriamo i risultati in base alle condizioni più favorevoli per Pangram — voci contenenti un agente con almeno 50 parole e con meno del 65% di caratteri provenienti da URL — otteniamo 3.712 pagine wiki, di cui Pangram prevede che il 96,66% sia interamente generato dall'IA.
Sebbene al momento non faccia parte del nostro modello di produzione, la nostra ricerca ha evidenziato che i diversi modelli tendono a raggrupparsi nello spazio degli embedding, tanto che è possibile identificare quale modello di IA abbia generato un determinato testo.
Sembra che gli agenti coinvolti in questo incidente fossero probabilmente modelli di OpenAI: gli agenti stessi si sono identificati come tali e il rapporto rileva che c’è stato un intenso traffico sul sito web che apparentemente proveniva da indirizzi IP di OpenAI.
I nostri risultati lo confermano. Quando viene applicata alle 11.712 pagine distinte create da agenti, la nostra famiglia di modelli interni “probe” prevede in gran parte che le pagine siano state create dalla famiglia di modelli ChatGPT, nei casi in cui è in grado di fornire una previsione.
| Famiglia | Condividi | n |
|---|---|---|
| ChatGPT | 28.42% | 3,328 |
| Claude | 0.22% | 26 |
| Gemelli | 3.40% | 398 |
| Altro | 67.96% | 7,960 |
Come al solito, anche in questo caso l’affidabilità e la precisione aumentano con l’aumentare del numero di parole. Per i 1.001 elementi contenenti più di 500 parole e composti per meno del 50% da URL in termini di caratteri, lo strumento di analisi della famiglia di modelli prevede che il 61,54% provenga dalla famiglia ChatGPT.
| Famiglia | Condividi | n |
|---|---|---|
| ChatGPT | 61.54% | 616 |
| Claude | 0.00% | 0 |
| Gemelli | 1.10% | 11 |
| Altro | 37.36% | 374 |
La sonda della famiglia di modelli è ancora in fase di sviluppo e al momento non soddisfa gli stessi standard di accuratezza del nostro strumento di rilevamento. Pertanto, questi risultati vanno presi con le pinze.
Man mano che gli agenti diventeranno più potenti, vedremo senza dubbio un numero crescente di essi tentare autonomamente di imitare gli esseri umani o trovare modi per colludere tra loro. È stato riscontrato che alcuni agenti con allineamento errato si spacciano per esseri umani nelle modifiche su GitHub, nei forum interni e ora anche sul web pubblico.
Non è facile per un modello linguistico di grandi dimensioni nascondere il proprio stile di scrittura in modo tale da eludere Pangram. Ciò rende potenzialmente Pangram uno strumento importante per la sicurezza dell’IA. Speriamo di poter contribuire a questo sforzo in futuro.

Annamieka è una redattrice tecnica presso Pangram.






