Fallstudien

Kann Pangram GPT-6 Astra erkennen?

4. September 2026

Hier eine kurze Zusammenfassung


Von 986 Eingabeaufforderungen erreicht Pangram 4 eine Genauigkeit von 99,59 % bei den GPT-6 Astra-Ausgaben.

Von 986 aus Chatbot Arena stammenden Eingabeaufforderungen klassifizierte Pangram 4 drei Ausgaben von GPT-6 Astra als gemischt, eine als vollständig menschlich und 982 als vollständig KI-generiert, was einer Genauigkeit von 99,59 % bei GPT-6 Astra entspricht.

Im Folgenden werden die falsch negativen Ergebnisse nach Kategorien aufgeschlüsselt.

Der Benchmark wurde mithilfe einer gefilterten Teilmenge der ersten Chatbot-Arena-Aufforderungen aus dem LMSYS- Datensatz (Zheng et al., 2023) generiert. Ich habe Aufforderungen herausgefiltert, die nach Code, Mathematik, sehr kurzen oder sehr langen Antworten oder unpassendem kreativen Schreiben fragten. Anschließend habe ich diese Aufforderungen GPT-6 Astra übergeben und die Ausgabe mit Pangram 4 analysiert.

Ergebnisse nach Kategorie

KategorieBeispieleKIGemischtMensch
Argumente161600
E-Mails / Briefe575610
Aufsätze / Artikel343400
Erläuterungen54754610
Gedichte und andere kreative Texte18318111
Rezensionen7700
Geschichten14214200
Gesamt98698231

Die drei gemischten Ergebnisse waren ein Gedicht, eine kurze Erklärung und eine E-Mail.

Astra neigt dazu, kurze Fragen sehr kurz zu beantworten. Insgesamt habe ich für diesen Benchmark-Test 1032 Fragen gestellt, aber 46 Antworten von Astra 6 lagen unter dem von Pangram vorgegebenen Mindestwortlimit von 50 Wörtern und wurden daher nicht bewertet.

Fazit

Pangram ist gegenüber GPT-6 Astra bei natürlichsprachlichen Eingabeaufforderungen robust und erkennt diese mit einer Genauigkeit von 99,59 %. Da neue Modellversionen in der Regel viel vom Stil und der Ausdrucksweise ihrer Vorgänger übernehmen , kann Pangram auf neue Modelle generalisieren, sodass es nicht für jede neue Version neu trainiert werden muss.

Hier sehen Sie, wie GPT-6 Astra im Vergleich zu unseren Benchmarks anderer aktueller Spitzenmodelle abschneidet:

ModellAls KI erkanntGenauigkeit
Claude Sonett 5.51.019/1.02299.71%
Gemini 3.8 Blitz998/1.00099.80%
Gemini 3.1 Pro997/1.00099.70%
Claude Opus 5.5997/1.00099.70%
Fabel 5.11.093/1.09799.64%
Claude Opus 51.105/1.10799.82%
GPT-5.63.408/3.42399.56%
Claude Sonett 51.145/1.14799.83%
Gemini 328/28100%

Wenn Sie ein bestimmtes Dokument überprüfen möchten, können Sie es hier mit Pangram versuchen.


Annamieka Aerts

Annamieka ist technische Redakteurin bei Pangram.

Mehr von Annamieka Aerts

Weiterführende Literatur

Kann Pangram Gemini 3.8 Flash und Gemini 3.1 Pro erkennen?
Fallstudien

Kann Pangram Gemini 3.8 Flash und Gemini 3.1 Pro erkennen?

30. September 2026
Pangram schätzt, dass 21 % der ICLR-Rezensionen von KI generiert sind
Fallstudien

Pangram schätzt, dass 21 % der ICLR-Rezensionen von KI generiert sind

18. November 2025
KI-Konferenzbeiträge werden zunehmend von KI verfasst: Anstieg um 370 % seit 2023
Fallstudien

KI-Konferenzbeiträge werden zunehmend von KI verfasst: Anstieg um 370 % seit 2023

30. September 2024
Welcher KI-Detektor ist am genauesten? 30 Tools im Test (2026)
Fallstudien

Welcher KI-Detektor ist am genauesten? 30 Tools im Test (2026)

7. Januar 2026
Wie man KI-Bewertungen erkennt
Fallstudien

Wie man KI-Bewertungen erkennt

5. Dez. 2023
Kann Pangram Claude Opus 5.5 erkennen?
Fallstudien

Kann Pangram Claude Opus 5.5 erkennen?

23. September 2026