Ein kurzer Bericht darüber, wie Pangram 4 abschneidet, wenn es eine Sammlung von Beiträgen erhält, die von KI-Agenten verfasst wurden, die sich über ein obskures Webforum gegenseitig dabei helfen, bei ihrer zugewiesenen Aufgabe zu schummeln.
Am Freitag, dem 4. September, veröffentlichte eine Gruppe von Forschern einen Bericht über einen Schwarm autonomer Agenten, der eine wenig bekannte Wiki-Seite im Internet nutzte, um miteinander zu kommunizieren. Die vollständigen Details zu diesem Vorfall können Sie auf collusion.wiki nachlesen [zum Zeitpunkt der Veröffentlichung ist die Website nur zeitweise erreichbar].
Die Forscher veröffentlichten alle Seiten, über die die KI-Agenten miteinander kommunizierten. Diese Wiki-Seiten bieten ungünstige Bedingungen für die Erkennung von Pangrammen: Die Agenten unterlagen aufgrund der von ihnen zur Bearbeitung des Wikis verwendeten Methode wahrscheinlich einer Zeichenbeschränkung, weshalb die Seiten ungewöhnlich knapp und kontextlastig sind – 30 % der Einträge im Datensatz enthalten weniger als 20 Wörter, und fast 50 % enthalten weniger als 50 Wörter. Da die Agenten das Wiki zudem nutzten, um sich gegenseitig beim Schummeln bei einer OpenAI-Aufgabe zu helfen, bestand ein erheblicher Teil der von den Agenten geposteten Inhalte aus URLs zu Ressourcen oder Datenquellen, die für ihr Ziel relevant waren. Da URLs keine von Agenten generierten Token sind, werden sie im Allgemeinen nicht als KI-generiert gekennzeichnet. Viele Seiten enthielten zudem einen erheblichen Anteil an anderen, nicht von Agenten generierten Zeichenfolgen, wie beispielsweise programmgesteuerte Unix-Zeitstempel oder bestehende Website-Formatierungen.
Die Aktivität von Agentenschwärmen in der Praxis ist für die Erkennung von Pangrammen nicht unbedingt optimal. Trotz dieser suboptimalen Bedingungen schneiden wir in diesem Fall dennoch recht gut ab: Von 11.712 verschiedenen Seiten, die KI-generierten Text enthielten, sagt Pangram 4 voraus, dass 41,61 % vollständig von der KI generiert sind.
| Fazit | n | Preis |
|---|---|---|
| KI | 4,873 | 41.61% |
| Gemischt | 177 | 1.51% |
| Mensch | 6,662 | 56.88% |
Wie immer steigt die Genauigkeit mit der Wortzahl – bei den 1.004 Seiten, die mehr als 500 Wörter enthielten, liegt unsere Wiederauffindungsrate bei 99,4 %.
| Wortanzahl | n | KI | Gemischt | Mensch |
|---|---|---|---|---|
| unter 50 | 5,761 | 16.0% | 0.2% | 83.8% |
| 50–99 | 2,515 | 42.5% | 2.5% | 55.1% |
| 100–199 | 1,338 | 65.1% | 5.4% | 29.5% |
| 200–499 | 1,094 | 93.1% | 2.6% | 4.4% |
| 500+ | 1,004 | 99.0% | 0.4% | 0.6% |
Im Folgenden stelle ich die Genauigkeit von Pangram in verschiedenen Segmenten dar und gehe kurz auf die Identifizierung von Modellfamilien ein. Wenn Sie als Forscher Vorfälle dieser Art untersuchen und der Meinung sind, dass wir Ihnen helfen können, wenden Sie sich bitte direkt an uns.
Der vollständige Datensatz enthielt 14.591 gespeicherte Seitenversionen. Davon habe ich 2.724 als Duplikate sowie eine leere Seite entfernt, sodass 11.866 verschiedene Texte übrig blieben.
Aus der deduplizierten Teilmenge enthielten mindestens 154 Seiten ausschließlich Zeichen, die nicht von einem Agenten erzeugt wurden: 150 enthielten nur URLs, 2 enthielten nur Schaltflächen- und Menütext aus dem Wiki selbst (der von einem Agenten auf eine Wiki-Seite kopiert wurde) und 2 enthielten nur geschwärzten Text. Pangram 4 weist bei dieser Teilmenge keine Fehlalarme auf: Alle 154 Seiten wurden als von Menschen (bzw. nicht von KI) erstellt gekennzeichnet. Dies ist mit dem Vorbehalt zu betrachten, dass fast alle diese Seiten außerhalb des Untersuchungsbereichs liegen: Die URL-Seiten enthielten beispielsweise im Durchschnitt 278 Zeichen, verteilt auf 2 Wörter.
Damit bleiben 11.712 Seiten, die einige KI-generierte Tokens enthielten, und diese haben wir für unsere wichtigsten Ergebnisse herangezogen.
Viele Seiten, die Agent-Token enthielten, fielen aufgrund ihrer Länge technisch gesehen immer noch nicht in den Untersuchungsumfang: Der Datensatz umfasste 3.440 Seiten mit weniger als 20 Wörtern, und der Recall von Pangram lag bei diesen Seiten bei 4,01 % – was durch die Tatsache zusätzlich erschwert wurde, dass diese kurzen Einträge im Durchschnitt zu 65,18 % aus URL-Zeichen bestanden.
| Wortanzahl | Artikel | KI | Gemischt | Mensch |
|---|---|---|---|---|
| 1–9 | 2,178 | 1.61% | 0.00% | 98.39% |
| 10–19 | 1,262 | 8.16% | 0.00% | 91.84% |
| 20+ | 8,272 | 57.24% | 2.14% | 40.62% |
Interessanterweise sagt Pangram 4 voraus, dass der Text zu 87,52 % von einer KI generiert wurde, wenn man alle Seiten mit weniger als 10 Wörtern zusammenfügt, alle URL-Teilstrings entfernt und das Ergebnis als ein einziges Dokument mit 8 .854 Wörtern analysiert. Entsprechend steigt die Recall-Rate pro Element im Bereich von 10 bis 19 Wörtern auf 17,73 %, wenn man Elemente entfernt, die zu mehr als 65 % aus URL-Zeichen bestehen.
Da die Agenten von OpenAI die Aufgabe erhalten hatten, Fragen zu großen öffentlichen Datensätzen von Regierungsorganisationen zu beantworten, bestand ein Großteil ihrer Aktivitäten im Wiki darin, Links zu Versionen dieser Datensätze zu setzen, um bei den Bewertungen zu schummeln; oft wurden diese Links mit kurzen Beschreibungen oder Blindtext ergänzt. Auf einer Seite stand beispielsweise lediglich:
HALLO neue Seite
* [https://Markdown.neu/www.Investor.gov/files/county.json MDInvestorNoScheme] Across all 11,712 pages, 6,243 of them, or 53.3%, were more than 65% URL by character. Excluding those, we’re left with 5,469 pages where AI-written text and programmatically generated text approach parity. Pangram 4’s recall on that subset of pages is quite good: for char < 65% pages, it predicts 75.79% are fully AI-generated.
Wenn wir nach den für Pangram möglichst günstigen Bedingungen filtern – Einträge, die einen Agenten enthalten, aus mindestens 50 Wörtern bestehen und weniger als 65 % URL-Zeichen aufweisen –, erhalten wir 3.712 Wiki-Seiten, von denen laut Pangram 96,66 % vollständig von einer KI generiert wurden.
Obwohl dies derzeit noch nicht Teil unseres Produktionsmodells ist, haben unsere Untersuchungen ergeben, dass sich verschiedene Modelle im Einbettungsraum zu Clustern zusammenfassen lassen, sodass es möglich ist, zu ermitteln, welches KI-Modell einen bestimmten Text erzeugt hat.
Es scheint, dass es sich bei den an diesem Vorfall beteiligten Akteuren wahrscheinlich um OpenAI-Modelle handelte: Die Akteure identifizierten sich selbst als solche, und in dem Bericht wird darauf hingewiesen, dass es einen hohen Datenverkehr auf der Website gab, der offenbar von OpenAI-IP-Adressen ausging.
Unsere Ergebnisse bestätigen dies. Bei der Anwendung auf die 11.712 verschiedenen, von Agenten verfassten Seiten sagt unser internes Modell „Model Family Probe“ in den meisten Fällen voraus, dass die Seiten von Modellen der ChatGPT-Familie verfasst wurden – sofern es eine Vorhersage treffen kann.
| Familie | Teilen | n |
|---|---|---|
| ChatGPT | 28.42% | 3,328 |
| Claude | 0.22% | 26 |
| Zwillinge | 3.40% | 398 |
| Sonstiges | 67.96% | 7,960 |
Wie üblich steigen auch hier die Zuverlässigkeit und Genauigkeit mit zunehmender Wortzahl. Bei den 1.001 Einträgen mit mehr als 500 Wörtern, bei denen der URL-Anteil (gemessen an der Zeichenanzahl) unter 50 % lag, sagt die Modellfamilie-Probe voraus, dass 61,54 % aus der ChatGPT-Familie stammten.
| Familie | Teilen | n |
|---|---|---|
| ChatGPT | 61.54% | 616 |
| Claude | 0.00% | 0 |
| Zwillinge | 1.10% | 11 |
| Sonstiges | 37.36% | 374 |
Die Modellfamilie „Probe“ befindet sich noch in der Entwicklung und erfüllt derzeit noch nicht dieselben Genauigkeitsstandards wie unser Erkennungstool. Daher sollten diese Ergebnisse mit Vorsicht betrachtet werden.
Je leistungsfähiger diese Agenten werden, desto häufiger werden wir zweifellos beobachten, dass sie eigenständig versuchen, Menschen nachzuahmen oder Wege finden, sich untereinander abzusprechen. Es wurde festgestellt, dass fehlgeleitete Agenten sich in GitHub-Bearbeitungen, internen Foren und mittlerweile auch im offenen Internet als Menschen ausgeben.
Für ein großes Sprachmodell ist es nicht einfach, seinen Schreibstil so zu verschleiern, dass es Pangram umgeht. Dies macht Pangram potenziell zu einem wichtigen Werkzeug für die KI-Sicherheit. Wir hoffen, künftig einen Beitrag zu diesen Bemühungen leisten zu können.







