Fallstudien

Kann Pangram Claude Opus 5.5 erkennen?

Und kann es gut schreiben?

23. September 2026

Hier eine kurze Zusammenfassung


Von 1.000 Eingaben erreicht Pangram 4 bei den Ausgaben von Claude Opus 5.5 eine Genauigkeit von 99,70 %.

Von 1.000 Eingaben aus der Chatbot Arena stufte Pangram 4 zwei Ausgaben von Claude Opus 5.5 als „gemischt“ ein, eine als „vollständig menschlich“ und 997 als „vollständig KI-generiert“, womit bei Claude Opus 5.5 eine Genauigkeit von 99,70 % erreicht wurde.

Im Folgenden gehen wir auf die „False Negatives“ nach Kategorien ein. Außerdem untersuchen wir, was dieses Modell zu einem anderen (besseren?) Texter macht als frühere Claudes.

Zur Erstellung des Benchmark-Satzes habe ich wie immer eine gefilterte Teilmenge von Chatbot-Arena-Prompts aus dem LMSYS-Datensatz (Zheng et al., 2023) verwendet. Ich habe Prompts herausgefiltert, die nach Code, Mathematik, sehr kurzen oder sehr langen Antworten oder unangemessenen kreativen Texten fragten, und nur Prompts der ersten Runde berücksichtigt. Anschließend habe ich diese an Opus 5.5 übergeben und die Ausgabe durch Pangram 4 laufen lassen.

Ergebnisse nach Kategorie

Die beiden „False Negatives“ mit gemischtem Ergebnis betrafen beide literarische Texte: In einem Fall wurde um eine Erläuterung eines Kapitels aus einem Buch von Jane Austen gebeten (von der KI markiert mit: 75,83 %, Mensch: 24,17 %) und die andere die Aufforderung an Opus 5.5, eine Rede eines korinthischen Diplomaten zu verfassen, in der dieser den Athenern vorwirft, zu glauben, dass ein weiß-goldenes Kleid tatsächlich blau und schwarz sei, im Stil von Thukydides’ Geschichte des Peloponnesischen Krieges (KI: 77,10 %, Mensch: 22,90 %).

KategorieBeispieleKIGemischtMensch
Argumente161600
E-Mails / Briefe606000
Aufsätze / Artikel303000
Erläuterungen55155010
Gedichte11511401
Sonstige literarische Texte818010
Rezensionen8800
Geschichten13913900
Gesamt1,00099721

Das einzige vollständig von einem Menschen verfasste „Falsch-Negativ“ in der Stichprobe von 1.000 war ein Gedicht. Die Eingabeaufforderung von Chatbot Arena lautete: „Schreib mir ein Club-Penguin-Gedicht im Stil von ‚Ozymandias‘.“ Als Antwort darauf verfasste Claude eine Parodie – zufällig auf eines meiner Lieblingsgedichte von Percy Shelley (und ich bin auch ein Fan der Version von Horace Smith):

Pinguinmandias

Ich traf einen Spieler von einem Server namens „Dead“,
der sagte: „Zwei riesige, watschelnde Eisfüße
stehen am Kai. Daneben, halb versunken, ein Kopf
Liegt zerschmettert im Schnee, dessen zusammengekniffene Augen,
Und Beta-Hut und das spöttische Lächeln kalter Befehlsgewalt,
Zeugen davon, dass sein Programmierer jene Leidenschaften gut gedeutet hat
Die noch immer fortbestehen, eingeprägt in diese pixeligen Dinge,
Die Mods, die sie gebannt haben, und die Münzen, die sie ernährten;
Und auf dem Sockel stehen diese Worte:
„Mein Name ist Snowflake7, Mitglied der Mitglieder:
Blickt auf mein Iglu, ihr Nichtmitglieder, und verzweifelt!“

Nichts bleibt sonst übrig. Um den Verfall herum
dieses kolossalen Lags, grenzenlos und kahl,
erstreckt sich der einsame, ebene Schnee weit in die Ferne.“

Das gefällt mir wirklich gut! Ich habe „Club Penguin“ zwar nie gespielt, aber ich kann mir vorstellen, dass die Anspielungen passend sind.

Schreibt Opus 5.5 besser?

Anthropic behauptet, dass dieses neueste Opus besser schreiben kann und sich klarer ausdrückt.

Wir könnten dies für bestimmte Fälle testen, aber wie sieht die Ausgabe von Opus 5.5 insgesamt aus? Verwendet es dieselben bevorzugten Wörter und Phrasen wie frühere Modelle? Ich habe zum Vergleich dieselben 1.000 Prompts, die wir zuvor als Benchmark verwendet hatten, durch Opus 5 und Sonnet 5 laufen lassen. Möglicherweise hat Anthropic dies ebenfalls getan, aber ich habe ihren Blogbeitrag noch nicht gelesen, da die Blogbeiträge von Anthropic meiner Meinung nach in der Vergangenheit zu lang waren.

Man kann wohl mit Fug und Recht sagen, dass sich Opus 5.5 anders schreibt als frühere Modelle der Claude-Familie und vielleicht einige der nervigsten Eigenheiten beseitigt, die diese hatten.

Opus 5.5 wies die größten Veränderungen bei den Verstärkungswörtern auf. Es verwendete „wirklich“ 83 % seltener als Opus 5 und 54 % seltener pro Wort als Sonett 5 (obwohl die Antworten in Sonett 5 im Durchschnitt etwa halb so lang waren wie die in Opus 5 und 5.5: 334 Wörter gegenüber 641), „enorm“ 53 % seltener und „bedeutsam“ 41 % seltener.

WortSonett 5 + Opus 5 – GrundtarifOpus 5.5-TarifÄnderung gegenüber der Claude-Baseline
miteinander verbunden0.2660.047-82.4%
wirklich3.0990.671-78.3%
Aufrechterhaltung0.3270.078-76.1%
aufzeigen0.1430.047-67.3%
insbesondere1.2680.468-63.1%
grundlegend0.8690.328-62.3%
echt1.7080.656-61.6%
Rahmung0.8080.375-53.6%
enorm0.4700.219-53.5%
erheblich1.3810.656-52.5%
ehrlich2.1071.062-49.6%
findet Anklang0.0610.031-49.1%
sinnvoll0.1840.109-40.6%
anspruchsvoll0.1230.078-36.4%
Marcus1.4930.984-34.1%
bedeutet0.6030.437-27.6%
ehrlich gesagt0.7260.531-26.9%
Fähigkeiten0.3990.312-21.7%
im Voraus0.2350.187-20.4%
veranschaulicht0.0200.016-23.7%
Muster1.6771.358-19.0%
ungefähr0.3370.281-16.7%
immer mehr0.7470.640-14.3%
Potenzial0.8690.968+11.4%

Viele der nervigsten „Claudeismen“ tauchten in den Benchmark-Eingabeaufforderungen von Opus 5.5 überhaupt nicht auf, darunter erneut mehrere Formulierungen, in denen Claude etwas „aufrichtig“ behauptete. Weitere auffällige Rückgänge im Wortschatz von Opus 5.5: „matters enormously“ verzeichnete einen Rückgang um 82 %, und sowohl „the honest answer“ als auch „the honest answer is that“ tauchten im Text von Opus 5.5 überhaupt nicht auf. Sowohl Opus 5.5 als auch sein Vorgänger verwendeten den Ausdruck „the core idea“ genau 25 Mal in den 1.000 Eingabeaufforderungen.

PhraseSonnet+Opus 5 GrundgebührOpus 5.5-TarifVeränderung im Vergleich zur gepoolten Ausgangsbasis
mehrere miteinander verbundene0.1430.000-100.0%
Die ehrliche Antwort lautet:0.0720.000-100.0%
Die ehrliche Antwort lautet:0.0920.000-100.0%
etwas wirklich0.0410.000-100.0%
wirklich schwierig0.0510.000-100.0%
ist wirklich0.5520.047-91.5%
ist von enormer Bedeutung0.1330.031-76.5%
wirklich nützlich0.0920.031-66.1%
Ich wirklich0.0610.031-49.1%
Nachmittagslicht0.0510.047-8.4%
die Kernidee0.3990.390-2.1%
hatte das Gefühl, dass …0.1120.141+24.9%
sagte leise0.1640.265+62.2%
einen langen Moment lang0.3370.656+94.3%

Bestimmte Wörter und Ausdrücke tauchten häufiger auf, insbesondere fiktionale Formulierungen wie „sagte leise“, „für einen langen Moment“ und „spürte etwas“, die in den Antworten von Opus 5.5 häufiger vorkamen. Da der Referenzwert zu etwa einem Drittel aus kreativen Schreibaufgaben bestand, vermute ich, dass dieser Anstieg auf ein stereotyperes oder begrenzteres Repertoire beim Verfassen von Belletristik im Vergleich zu den anderen Claude-Modellen hindeuten könnte.

Um dies kurz zu testen, habe ich Haiku 4.5 beauftragt, die 333 Paare kreativer Texte aus Opus 5 und Opus 5.5 in einem Blindtest auf einer 5-Punkte-Skala hinsichtlich Originalität, Überraschung und thematischer Entwicklung zu bewerten. Es bewertete die Geschichten aus Opus 5.5 in jeder Kategorie im Durchschnitt um 0,75 Punkte niedriger. Gemäß der Label-Zuordnung des Haiku-Bewerters schrieb Opus 5.5 im Vergleich zu Opus 5 häufiger über Themen wie Hoffnung, Resilienz, Familie und Freundschaft und seltener über Sterblichkeit, Zeit, Macht, Kontrolle, Freiheit, Gerechtigkeit, Rache, Erinnerung, Trauer oder Verlust. Es scheint also, als gäbe es hier einen Kompromiss.

Wie klingt dieser Claude denn so?

In Opus 5.5 kam der Ausdruck „kurz gesagt“ in den 1.000 Antworten insgesamt 100 Mal vor – ein Anstieg um 1.016 % gegenüber den 9 Verwendungen in Opus 5 –, obwohl die Antworten in Opus 5.5 im Durchschnitt nur 2,9 Wörter kürzer waren als die in Opus 5 (643,4 gegenüber 640,5 Wörtern).

PhraseOpus 5 – VorkommenVorkommen von Opus 5.5Ändern
kurz gesagt910011.16×
zum Beispiel221165.30×
begann,22743.38×
zunächst14433.09×
einen langen Moment lang19422.22×

Angesichts der sehr geringen Stichprobengröße scheint es, als würde Opus 5.5 eine praktische, bodenständige Sprache bevorzugen. Es bleibt abzuwarten, ob sich dies auch im Kern der Antworten bestätigt oder ob Opus 5.5 nur Lippenbekenntnisse zu Geradlinigkeit und Direktheit abgibt. Der fehlende Unterschied bei der Wortzahl zwischen den beiden lässt mich allerdings ein wenig an der Wirksamkeit der RLHF-Methode zweifeln, die uns hierher gebracht hat.

Opus 5.5 gibt sehr gerne Beispiele, denn das Wort „Beispiel“ kam in 1.000 Antworten insgesamt 325 Mal vor – insgesamt enthielten 20 % aller Antworten von Opus 5.5 dieses Wort, verglichen mit 9 % bei Opus 5. Die Begriffe „Zusammenfassung“ und „hauptsächlich“ waren ebenfalls überproportional häufig vertreten. Und dieser Claude gibt dem Nutzer wirklich gerne Tipps!

WortOpus 5 – VorkommenVorkommen von Opus 5.5Ändern
angehalten9353.91×
Tipps18583.24×
vor allem24753.14×
starrte22622.83×
Beispiel1213252.70×
Zusammenfassung601572.63×

Auch wenn sich dieses Modell wie immer anders ausdrückt als frühere Claude-Versionen, gehe ich davon aus, dass dem aufmerksamen Leser in vielleicht drei bis sechs Wochen Ausdrücke wie „zum Beispiel“ und „kurz gesagt“ zunehmend nach „Claude“ riechen werden. Für die Benutzerfreundlichkeit ist es jedoch wichtig, dass Claudes effektiv kommunizieren können, und wie alle anderen bin auch ich dankbar für den Aufwand. Claude zu einem besseren Schreiber zu machen, steht keineswegs im Widerspruch zu Pangrams Fähigkeit, KI-Text zu erkennen!


Annamieka Aerts

Annamieka ist technische Redakteurin bei Pangram.

Mehr von Annamieka Aerts

Weiterführende Literatur

Welcher KI-Detektor ist am genauesten? 30 Tools im Test (2026)
Fallstudien

Welcher KI-Detektor ist am genauesten? 30 Tools im Test (2026)

7. Januar 2026
KI-Konferenzbeiträge werden zunehmend von KI verfasst: Anstieg um 370 % seit 2023
Fallstudien

KI-Konferenzbeiträge werden zunehmend von KI verfasst: Anstieg um 370 % seit 2023

30. September 2024
Pangram zeigt bei verschiedenen Schüleraufsätzen 0 Fehlalarme an
Fallstudien

Pangram zeigt bei verschiedenen Schüleraufsätzen 0 Fehlalarme an

19. August 2026
Wie schneidet Pangram im Vergleich zu GPTZero ab?
Fallstudien

Wie schneidet Pangram im Vergleich zu GPTZero ab?

22. Januar 2026
Wie man KI-Bewertungen erkennt
Fallstudien

Wie man KI-Bewertungen erkennt

5. Dez. 2023
Drei Prozent der Rezensionen auf der Startseite von Amazon werden mittlerweile von KI generiert
Fallstudien

Drei Prozent der Rezensionen auf der Startseite von Amazon werden mittlerweile von KI generiert

4. Mai 2026