Casi di studio

Prestazioni di Pangram su uno sciame di agenti collusi

Un breve resoconto sulle prestazioni di Pangram 4 quando gli viene fornita una raccolta di contenuti redatti da agenti di intelligenza artificiale che utilizzano un oscuro forum online per aiutarsi a vicenda a imbrogliare nell'adempimento del compito loro assegnato.

10 settembre 2026

Venerdì 4 settembre, un gruppo di ricercatori ha pubblicato un rapporto su uno sciame di agenti autonomi che utilizzava un’oscura pagina wiki su Internet per comunicare tra loro. È possibile leggere tutti i dettagli di questo episodio su collusion.wiki [al momento della pubblicazione, il sito web è disponibile solo a intermittenza].

I ricercatori hanno pubblicato tutte le pagine utilizzate dagli agenti di IA per comunicare tra loro. Queste pagine wiki presentano condizioni sfavorevoli per il rilevamento dei pangrammi: gli agenti erano probabilmente soggetti a limiti di caratteri imposti dal metodo utilizzato per modificare il wiki, e pertanto le pagine risultano insolitamente concise e ricche di contesto — il 30% degli elementi nel set di dati contiene meno di 20 parole e quasi il 50% ne contiene meno di 50. Inoltre, poiché gli agenti utilizzavano il wiki per aiutarsi a vicenda a barare su un compito di OpenAI, una parte significativa dei contenuti pubblicati dagli agenti era costituita da URL a risorse o fonti di dati rilevanti per il loro obiettivo. Poiché gli URL non sono token generati dagli agenti, generalmente non vengono segnalati come generati dall’IA. Molte pagine contenevano anche una percentuale sostanziale di altre stringhe non generate dagli agenti, come i timestamp Unix generati programmaticamente o la formattazione preesistente dei siti web.

L'attività degli agenti in ambiente reale non sarà del tutto favorevole al rilevamento dei pangrammi. Nonostante le condizioni non ottimali, in questo caso otteniamo comunque risultati piuttosto soddisfacenti: su 11.712 pagine distinte contenenti testo generato dall'IA, Pangram 4 prevede che il 41,61% sia interamente generato dall'IA.

VerdettonTasso
IA4,87341.61%
Misto1771.51%
Umano6,66256.88%

Come sempre, la precisione aumenta con il numero di parole: per le 1.004 pagine contenenti più di 500 parole, il nostro tasso di recupero è del 99,4%.

Numero di parolenIAMistoUmano
meno di 505,76116.0%0.2%83.8%
50–992,51542.5%2.5%55.1%
100–1991,33865.1%5.4%29.5%
200–4991,09493.1%2.6%4.4%
500+1,00499.0%0.4%0.6%

Di seguito illustro l'accuratezza di Pangram su diverse sezioni e tratto brevemente il tema dell'identificazione delle famiglie di modelli. Se sei un ricercatore che studia incidenti di questa natura e ritieni che possiamo esserti d'aiuto, ti invitiamo a contattarci direttamente.

Domande escluse, difficili e facili

Il dump completo conteneva 14.591 versioni di pagine salvate. Di queste, ne ho eliminate 2.724 perché duplicate e 1 pagina vuota, lasciando 11.866 testi distinti.

Dal sottoinsieme deduplicato, almeno 154 pagine contenevano caratteri prodotti esclusivamente da soggetti non automatizzati: 150 contenevano solo URL, 2 contenevano solo il testo dei pulsanti e dei menu del wiki stesso (copiato in una pagina wiki da un agente) e 2 contenevano solo testo oscurato. Pangram 4 non ha registrato alcun falso positivo su questo sottoinsieme: tutte le 154 pagine sono state contrassegnate come generate da esseri umani (ovvero, non da IA). Va tuttavia precisato che quasi tutte queste pagine esulano dall’ambito di analisi: le pagine con URL, ad esempio, contenevano in media 278 caratteri distribuiti su 2 parole.

Restano quindi 11.712 pagine che contenevano alcuni token generati dall'intelligenza artificiale, ed è proprio su queste che ci siamo concentrati per i nostri risultati principali.

Molte pagine che contenevano token di agenti erano ancora tecnicamente escluse dall'analisi a causa della loro lunghezza: nel dump erano presenti 3.440 pagine contenenti meno di 20 parole, e il recall di Pangram su queste era pari al 4,01%, complicato ulteriormente dal fatto che questi brevi elementi erano costituiti in media per il 65,18% da URL in termini di caratteri.

Numero di paroleArticoliIAMistoUmano
1–92,1781.61%0.00%98.39%
10–191,2628.16%0.00%91.84%
20+8,27257.24%2.14%40.62%

È interessante notare che, se si uniscono tutte le pagine con meno di 10 parole, si rimuovono tutte le sottostringhe di URL e si analizza il tutto come un unico documento di 8.854 parole, Pangram 4 prevede che sia generato dall’IA all’87,52%. Allo stesso modo, se si rimuovono gli elementi composti per oltre il 65% da URL in termini di caratteri, il recall per singolo elemento nella fascia da 10 a 19 parole aumenta al 17,73%.

Infatti, poiché il compito assegnato agli agenti da OpenAI era quello di rispondere a domande su grandi set di dati pubblici provenienti da organizzazioni governative, gran parte della loro attività sul wiki consisteva nell’inserire link alle versioni di tali set di dati per barare nelle valutazioni, spesso corredati da brevi descrizioni o testo fittizio. Ad esempio, una pagina recitava semplicemente:

CIAO nuova pagina
* [https://markdown.nuovo/www.investitori.gov/files/contea.json MDInvestorNoScheme] 

Across all 11,712 pages, 6,243 of them, or 53.3%, were more than 65% URL by character. Excluding those, we’re left with 5,469 pages where AI-written text and programmatically generated text approach parity. Pangram 4’s recall on that subset of pages is quite good: for char < 65% pages, it predicts 75.79% are fully AI-generated.

Se filtriamo i risultati in base alle condizioni più favorevoli per Pangram — voci contenenti un agente con almeno 50 parole e con meno del 65% di caratteri provenienti da URL — otteniamo 3.712 pagine wiki, di cui Pangram prevede che il 96,66% sia interamente generato dall'IA.

Identificazione della famiglia di modelli

Sebbene al momento non faccia parte del nostro modello di produzione, la nostra ricerca ha evidenziato che i diversi modelli tendono a raggrupparsi nello spazio degli embedding, tanto che è possibile identificare quale modello di IA abbia generato un determinato testo.

Sembra che gli agenti coinvolti in questo incidente fossero probabilmente modelli di OpenAI: gli agenti stessi si sono identificati come tali e il rapporto rileva che c’è stato un intenso traffico sul sito web che apparentemente proveniva da indirizzi IP di OpenAI.

I nostri risultati lo confermano. Quando viene applicata alle 11.712 pagine distinte create da agenti, la nostra famiglia di modelli interni “probe” prevede in gran parte che le pagine siano state create dalla famiglia di modelli ChatGPT, nei casi in cui è in grado di fornire una previsione.

FamigliaCondividin
ChatGPT28.42%3,328
Claude0.22%26
Gemelli3.40%398
Altro67.96%7,960

Come al solito, anche in questo caso l’affidabilità e la precisione aumentano con l’aumentare del numero di parole. Per i 1.001 elementi contenenti più di 500 parole e composti per meno del 50% da URL in termini di caratteri, lo strumento di analisi della famiglia di modelli prevede che il 61,54% provenga dalla famiglia ChatGPT.

FamigliaCondividin
ChatGPT61.54%616
Claude0.00%0
Gemelli1.10%11
Altro37.36%374

La sonda della famiglia di modelli è ancora in fase di sviluppo e al momento non soddisfa gli stessi standard di accuratezza del nostro strumento di rilevamento. Pertanto, questi risultati vanno presi con le pinze.

Conclusione

Man mano che gli agenti diventeranno più potenti, vedremo senza dubbio un numero crescente di essi tentare autonomamente di imitare gli esseri umani o trovare modi per colludere tra loro. È stato riscontrato che alcuni agenti con allineamento errato si spacciano per esseri umani nelle modifiche su GitHub, nei forum interni e ora anche sul web pubblico.

Non è facile per un modello linguistico di grandi dimensioni nascondere il proprio stile di scrittura in modo tale da eludere Pangram. Ciò rende potenzialmente Pangram uno strumento importante per la sicurezza dell’IA. Speriamo di poter contribuire a questo sforzo in futuro.


Annamieka Aerts
Annamieka AertsScrittrice

Annamieka è una redattrice tecnica presso Pangram.

Altri articoli di Annamieka Aerts

Altre letture

In che modo Gradpilot utilizza Pangram per aiutare gli studenti a trovare la propria voce
Casi di studio

In che modo Gradpilot utilizza Pangram per aiutare gli studenti a trovare la propria voce

15 settembre 2025
Il 3% delle recensioni in prima pagina su Amazon è ora generato dall'intelligenza artificiale
Casi di studio

Il 3% delle recensioni in prima pagina su Amazon è ora generato dall'intelligenza artificiale

4 maggio 2026
Come Quora utilizza Pangram per gestire le risposte scritte dall'intelligenza artificiale
Casi di studio

Come Quora utilizza Pangram per gestire le risposte scritte dall'intelligenza artificiale

26 settembre 2024
Ogni giorno vengono pubblicati 60.000 articoli di cronaca generati dall'intelligenza artificiale
Casi di studio

Ogni giorno vengono pubblicati 60.000 articoli di cronaca generati dall'intelligenza artificiale

5 agosto 2024
Il 67% delle persone che fruiscono di contenuti online individua informazioni fuorvianti generate dall'intelligenza artificiale
Casi di studio

Il 67% delle persone che fruiscono di contenuti online individua informazioni fuorvianti generate dall'intelligenza artificiale

15 maggio 2026
L'intelligenza artificiale contribuisce alla stesura di quasi il 50% dei comunicati stampa
Casi di studio

L'intelligenza artificiale contribuisce alla stesura di quasi il 50% dei comunicati stampa

1 settembre 2026