Estudos de caso

Desempenho do Pangram num enxame de agentes em conluio

Um breve relatório sobre o desempenho do Pangram 4 quando lhe é apresentado um conjunto de itens escritos por agentes de IA que utilizam um fórum obscuro na Internet para se ajudarem mutuamente a fazer batota na tarefa que lhes foi atribuída.

10 de setembro de 2026

Na sexta-feira, 4 de setembro, um grupo de investigadores publicou um relatório sobre um enxame de agentes autónomos que utilizava uma página wiki pouco conhecida na Internet para comunicar entre si. Pode ler todos os pormenores deste incidente em collusion.wiki [à data da publicação, o site só está disponível de forma intermitente].

Os investigadores publicaram todas as páginas que os agentes de IA utilizaram para comunicarem entre si. Estas páginas wiki apresentam condições desfavoráveis para a deteção de pangramas: os agentes estavam provavelmente limitados em termos de caracteres devido ao método que utilizaram para editar a wiki e, por isso, as páginas são invulgarmente sucintas e ricas em contexto — 30 % dos itens no conjunto de dados contêm menos de 20 palavras e quase 50 % contêm menos de 50 palavras. Além disso, como os agentes estavam a utilizar o wiki para se ajudarem mutuamente a fazer batota numa tarefa da OpenAI, uma parte significativa do conteúdo publicado pelos agentes consistia em URLs para recursos ou fontes de dados relevantes para o seu objetivo. Como os URLs não são tokens gerados pelos agentes, geralmente não são identificados como gerados por IA. Muitas páginas também continham uma percentagem substancial de outras sequências de caracteres não geradas pelos agentes, como carimbos de data/hora Unix gerados programaticamente ou formatação existente do site.

A atividade do enxame de agentes em condições reais não será perfeitamente favorável à deteção de pangramas. Apesar das condições não ideais, neste caso, continuamos a ter um desempenho bastante bom: de um total de 11 712 páginas distintas que continham texto gerado por IA, o Pangram 4 prevê que 41,61 % sejam totalmente geradas por IA.

VeredictonTaxa
IA4,87341.61%
Misto1771.51%
Humano6,66256.88%

Como sempre, a precisão aumenta com o número de palavras — nas 1 004 páginas que continham mais de 500 palavras, a nossa taxa de recuperação é de 99,4%.

Número de palavrasnIAMistoHumano
menos de 505,76116.0%0.2%83.8%
50–992,51542.5%2.5%55.1%
100–1991,33865.1%5.4%29.5%
200–4991,09493.1%2.6%4.4%
500+1,00499.0%0.4%0.6%

A seguir, apresento a precisão do Pangram em diferentes segmentos e abordo brevemente a identificação da família de modelos. Se for um investigador que estuda incidentes desta natureza e acredita que podemos ajudar, entre em contacto connosco diretamente.

Questões excluídas, difíceis e fáceis

O dump completo continha 14 591 versões de páginas guardadas. Dessas, eliminei 2 724 por serem duplicadas e 1 página em branco, ficando com 11 866 textos distintos.

Do subconjunto deduplicado, pelo menos 154 páginas continham caracteres produzidos estritamente por humanos: 150 continham apenas URLs, 2 continham apenas texto de botões e menus da própria wiki (copiado para uma página da wiki por um agente) e 2 continham apenas texto censurado. O Pangram 4 não apresenta falsos positivos neste subconjunto: todas as 154 páginas foram identificadas como geradas por humanos (ou seja, não por IA). É importante referir que quase todas estas páginas estão fora do âmbito do estudo: as páginas com URLs, por exemplo, continham, em média, 278 caracteres distribuídos por 2 palavras.

Isso deixa um total de 11 712 páginas que continham alguns tokens gerados por IA, e foi isso que levámos em consideração para os nossos resultados principais.

Muitas páginas que continham tokens de agente continuavam, tecnicamente, fora do âmbito da análise devido ao seu comprimento: havia 3 440 páginas no conjunto de dados que continham menos de 20 palavras, e a taxa de recuperação do Pangram nestas páginas foi de 4,01%, o que se complicava ainda mais pelo facto de estes itens curtos serem, em média, compostos por 65,18% de URL por carácter.

Número de palavrasArtigosIAMistoHumano
1–92,1781.61%0.00%98.39%
10–191,2628.16%0.00%91.84%
20+8,27257.24%2.14%40.62%

Curiosamente, se concatenarmos todas as páginas com menos de 10 palavras, removemos todas as subcadeias de URL e analisarmos o conjunto como um único documento de 8 854 palavras, o Pangram 4 prevê que 87,52 % do texto foi gerado por IA. Da mesma forma, se remover os itens em que mais de 65% dos caracteres correspondem a URLs, a taxa de recuperação por item no intervalo de 10 a 19 palavras aumenta para 17,73%.

Na verdade, uma vez que a tarefa atribuída aos agentes pela OpenAI consistia em responder a perguntas sobre grandes conjuntos de dados públicos provenientes de organizações governamentais, grande parte da sua atividade na wiki consistiu em inserir links para versões desses conjuntos de dados, com o objetivo de fazer batota nas suas avaliações, muitas vezes acompanhados de breves descrições ou texto fictício. Por exemplo, uma página dizia simplesmente:

OLÁ nova página
* [https://markdown.novo/www.investidor.gov/files/county.json MDInvestorNoScheme] 

Across all 11,712 pages, 6,243 of them, or 53.3%, were more than 65% URL by character. Excluding those, we’re left with 5,469 pages where AI-written text and programmatically generated text approach parity. Pangram 4’s recall on that subset of pages is quite good: for char < 65% pages, it predicts 75.79% are fully AI-generated.

Se filtrarmos as condições mais favoráveis para o Pangram — artigos que contenham um agente, com mais de 50 palavras e menos de 65% de caracteres de URL —, ficamos com 3 712 páginas da Wikipédia, das quais o Pangram prevê que 96,66% sejam totalmente geradas por IA.

Identificação da família de modelos

Embora não faça atualmente parte do nosso modelo de produção, a nossa investigação revelou que os diferentes modelos agrupam-se no espaço de incorporação, de tal forma que é possível identificar qual o modelo de IA que produziu um determinado texto.

Tudo indica que os agentes que participaram neste incidente eram provavelmente modelos da OpenAI: os próprios agentes identificaram-se como tal e o relatório refere que se registou um grande volume de tráfego no site, que aparentemente teve origem em endereços IP da OpenAI.

Os nossos resultados confirmam esta conclusão. Quando aplicada às 11 712 páginas distintas criadas por agentes, a nossa família de modelos internos prevê, na maioria dos casos, que as páginas foram criadas pela família de modelos ChatGPT, sempre que consegue apresentar uma previsão.

FamíliaPartilharn
ChatGPT28.42%3,328
Claude0.22%26
Gémeos3.40%398
Outros67.96%7,960

Como é habitual, também aqui a confiança e a precisão aumentam com o número de palavras. No caso dos 1 001 itens com mais de 500 palavras e cuja percentagem de caracteres de URL fosse inferior a 50%, a ferramenta de análise da família de modelos prevê que 61,54% pertenciam à família do ChatGPT.

FamíliaPartilharn
ChatGPT61.54%616
Claude0.00%0
Gémeos1.10%11
Outros37.36%374

A sonda da família de modelos ainda se encontra em fase de desenvolvimento e, neste momento, não cumpre os mesmos padrões de precisão que a nossa ferramenta de deteção. Como tal, estes resultados devem ser interpretados com alguma cautela.

Conclusão

À medida que os agentes se tornam mais poderosos, iremos, sem dúvida, ver cada vez mais exemplos de agentes que tentam, de forma autónoma, imitar os seres humanos ou encontrar formas de agir em conluio uns com os outros. Verificou-se que agentes desalinhados se fazem passar por seres humanos em edições no GitHub, em fóruns internos e, agora, na Internet aberta.

Não é fácil para um modelo de linguagem de grande dimensão ocultar o seu estilo de escrita de forma a contornar o Pangram. Isto torna o Pangram, potencialmente, uma ferramenta importante para a segurança da IA. Esperamos poder contribuir para este esforço no futuro.


Annamieka Aerts

A Annamieka é redatora técnica na Pangram.

Mais de Annamieka Aerts

Leitura relacionada

Como o Gradpilot utiliza o Pangram para ajudar os alunos a encontrar a sua voz
Estudos de caso

Como o Gradpilot utiliza o Pangram para ajudar os alunos a encontrar a sua voz

15 de setembro de 2025
Três por cento das críticas na primeira página da Amazon são agora geradas por IA
Estudos de caso

Três por cento das críticas na primeira página da Amazon são agora geradas por IA

4 de maio de 2026
Como o Quora utiliza o Pangram para gerir respostas escritas por IA
Estudos de caso

Como o Quora utiliza o Pangram para gerir respostas escritas por IA

26 de setembro de 2024
Todos os dias são publicados 60 000 artigos noticiosos gerados por IA
Estudos de caso

Todos os dias são publicados 60 000 artigos noticiosos gerados por IA

5 de agosto de 2024
67 % das pessoas que consomem conteúdos online estão a identificar informações enganosas geradas por IA
Estudos de caso

67 % das pessoas que consomem conteúdos online estão a identificar informações enganosas geradas por IA

15 de maio de 2026
A IA ajuda a redigir quase 50 % dos comunicados de imprensa
Estudos de caso

A IA ajuda a redigir quase 50 % dos comunicados de imprensa

1 de setembro de 2026