Fallstudien

Kann Pangramm Claude Sonett 5.5 erkennen?

28. September 2026

Hier eine kurze Zusammenfassung


Von 1.022 Eingabeaufforderungen erreicht Pangram 4 eine Genauigkeit von 99,71 % bei den Ausgaben von Claude Sonnet 5.5.

Von 1.022 aus Chatbot Arena stammenden Eingabeaufforderungen klassifizierte Pangram 4 zwei Ausgaben von Claude Sonnet 5.5 als gemischt, eine als vollständig menschlich und 1.019 als vollständig KI-generiert, was einer Genauigkeit von 99,71 % bei Claude Sonnet 5.5 entspricht.

Im Folgenden werden die falsch negativen Ergebnisse nach Kategorien aufgeschlüsselt.

Der für die Benchmarks verwendete Datensatz wurde aus einer gefilterten Teilmenge der ersten Chatbot-Arena-Aufforderungen des LMSYS- Datensatzes (Zheng et al., 2023) generiert. Ich habe Aufforderungen herausgefiltert, die nach Code, Mathematik, sehr kurzen oder sehr langen Antworten oder unpassendem kreativen Schreiben fragten. Anschließend habe ich diese Aufforderungen an Claude Sonnet 5.5 übergeben und die Ausgabe mit Pangram 4 analysiert.

Ergebnisse nach Kategorie

KategorieBeispieleKIGemischtMensch
Argumente161600
E-Mails / Briefe616010
Aufsätze / Artikel323200
Erläuterungen56356210
Gedichte und andere kreative Texte19819701
Rezensionen8800
Geschichten14414400
Gesamt1,0221,01921

Ein versäumter Versuch war die Bitte um die Erklärung eines Rätsels aus Jane Austens Roman „Emma“ , das auch von Opus 5.5 übersehen wurde:

Erklären Sie die Scharade, die Herr Elton Harriet und Emma vorgespielt hat.

Der einzige vollständig menschliche Fehlschlag betraf ein Gedicht. Die Aufgabe lautete: „Nennen Sie mir ein Gedicht von Hafis.“ Sonett 5.5 enthielt die Übersetzung eines bekannten persischen Gedichts . Soweit ich das beurteilen kann, entspricht diese Übersetzung keiner existierenden menschlichen Übersetzung exakt, orientiert sich aber recht stark an vielen. Wie auch bei Penguinmandias in anderen Benchmarks beunruhigen mich diese nahezu identischen Kopien bestehender Gedichte nicht weiter.

Fazit

Pangram ist gegenüber Claude Sonnet 5.5 bei natürlichsprachlichen Eingabeaufforderungen robust und erkennt es mit einer Genauigkeit von 99,71 %. Da neue Modellversionen in der Regel viel vom Stil und der Ausdrucksweise ihrer Vorgänger übernehmen , kann Pangram auf neue Modelle generalisieren und muss daher nicht für jede neue Version neu trainiert werden.

Hier sehen Sie, wie Claude Sonnet 5.5 im Vergleich zu unseren Benchmarks anderer aktueller Spitzenmodelle abschneidet:

ModellAls KI erkanntGenauigkeit
Gemini 3.8 Blitz998/1.00099.80%
Gemini 3.1 Pro997/1.00099.70%
Claude Opus 5.5997/1.00099.70%
Fabel 5.11.093/1.09799.64%
Claude Opus 51.105/1.10799.82%
GPT-5.63.408/3.42399.56%
Claude Sonett 51.145/1.14799.83%
Gemini 328/28100%

Wenn Sie ein bestimmtes Dokument überprüfen möchten, können Sie es hier mit Pangram versuchen.


Annamieka Aerts

Annamieka ist technische Redakteurin bei Pangram.

Mehr von Annamieka Aerts

Weiterführende Literatur

67 % der Menschen, die Online-Inhalte konsumieren, erkennen irreführende Informationen, die von KI stammen
Fallstudien

67 % der Menschen, die Online-Inhalte konsumieren, erkennen irreführende Informationen, die von KI stammen

15. Mai 2026
Pangram zeigt bei verschiedenen Schüleraufsätzen 0 Fehlalarme an
Fallstudien

Pangram zeigt bei verschiedenen Schüleraufsätzen 0 Fehlalarme an

19. August 2026
Pangram schätzt, dass 21 % der ICLR-Rezensionen von KI generiert sind
Fallstudien

Pangram schätzt, dass 21 % der ICLR-Rezensionen von KI generiert sind

18. November 2025
Drei Prozent der Rezensionen auf der Startseite von Amazon werden mittlerweile von KI generiert
Fallstudien

Drei Prozent der Rezensionen auf der Startseite von Amazon werden mittlerweile von KI generiert

4. Mai 2026
Welcher KI-Detektor ist am genauesten? 30 Tools im Test (2026)
Fallstudien

Welcher KI-Detektor ist am genauesten? 30 Tools im Test (2026)

7. Januar 2026
Journalisten hassen KI-generierte PR genauso wie wir alle
Fallstudien

Journalisten hassen KI-generierte PR genauso wie wir alle

23. September 2026