Vaka Çalışmaları

Pangram, Claude Sonnet 5.5'i tespit edebilir mi?

28 Eylül 2026

İşte kısa bir özet


1.022 komut arasından Pangram 4, Claude Sonnet 5.5 çıktılarında %99,71 doğruluk oranına ulaşmıştır.

Chatbot Arena'dan alınan 1.022 istemden Pangram 4, Claude Sonnet 5.5 çıktılarından ikisini karışık, birini tamamen insan yapımı ve 1.019'unu tamamen yapay zeka tarafından üretilmiş olarak sınıflandırarak Claude Sonnet 5.5'te %99,71 doğruluk oranına ulaştı.

Aşağıda, kategoriye göre yanlış negatifleri ele alıyoruz.

Karşılaştırma için kullandığım veri seti, LMSYS veri setinden (Zheng vd., 2023) alınan ilk tur Chatbot Arena sorularının filtrelenmiş bir alt kümesinden oluşturulmuştur. Kod, matematik, çok kısa veya çok uzun cevaplar ya da uygunsuz yaratıcı yazılar isteyen soruları filtreledim. Ardından bunları Claude Sonnet 5.5'e verdim ve çıktıyı Pangram 4'ten geçirdim.

Kategorilere göre sonuçlar

KategoriÖrneklerYapay ZekaKarışıkİnsan
Gerekçeler161600
E-postalar / mektuplar616010
Denemeler / makaleler323200
Açıklamalar56356210
Şiirler ve diğer yaratıcı yazılar19819701
Yorumlar8800
Hikâyeler14414400
Toplam1,0221,01921

Başarısız olan girişimlerden biri, Jane Austen'ın Emma romanında geçen bir bilmeceyi açıklama isteğiydi; bu istek de Opus 5.5 tarafından yanıtlanmamıştı.

Bay Elton'ın Harriet ve Emma'ya verdiği oyunu açıklayın.

Tamamen insan kaynaklı tek yanlış negatif, bir şiirdeydi. Soruda "Bana Hafız'dan bir şiir söyleyin" deniyordu. Sonnet 5.5 , ünlü bir Fars şiirinin çevirisini verdi. Bildiğim kadarıyla, çeviri mevcut insan çevirilerinden herhangi biriyle birebir eşleşmiyor, ancak birçoğuna oldukça yakın. Diğer kıyaslamalardaki Penguinmandia'larda olduğu gibi, mevcut şiirlerin bu neredeyse birebir kopyaları benim için çok endişe verici değil.

Sonuç

Pangram, doğal dil komutlarında Claude Sonnet 5.5'e karşı dayanıklıdır ve %99,71 doğrulukla tespit eder. Pangram, yeni model sürümlerinin önceki sürümlerin stil ve üslubunun büyük bir kısmını miras alma eğiliminde olması nedeniyle yeni modellere genelleme yapabilir; bu nedenle Pangram'ın her yeni sürüm için yeniden eğitilmesine gerek yoktur.

İşte Claude Sonnet 5.5'in diğer yeni nesil öncü modellerle karşılaştırması:

ModelYapay zeka olarak algılandıDoğruluk
Gemini 3.8 Flash998/1.00099.80%
Gemini 3.1 Pro997/1.00099.70%
Claude Opus 5.5997/1.00099.70%
Masal 5.11.093/1.09799.64%
Claude Opus 51.105/1.10799.82%
GPT-5.63.408/3.42399.56%
Claude Sonnet 51.145/1.14799.83%
İkizler 328/28100%

Belirli bir belgeyi kontrol etmek istiyorsanız, buradan Pangram’ı deneyebilirsiniz.


Annamieka Aerts

Annamieka, Pangram’da teknik yazar olarak çalışmaktadır.

Annamieka Aerts'tan daha fazlası

İlgili makaleler

Çevrimiçi içerik tüketenlerin %67'si yapay zekadan kaynaklanan yanıltıcı bilgileri fark ediyor
Vaka Çalışmaları

Çevrimiçi içerik tüketenlerin %67'si yapay zekadan kaynaklanan yanıltıcı bilgileri fark ediyor

15 Mayıs 2026
Pangram, çeşitli öğrenci kompozisyonlarında 0 yanlış pozitif sonuç gösteriyor
Vaka Çalışmaları

Pangram, çeşitli öğrenci kompozisyonlarında 0 yanlış pozitif sonuç gösteriyor

19 Ağustos 2026
Pangram, ICLR makalelerinin %21’inin yapay zeka tarafından yazıldığını öngörüyor
Vaka Çalışmaları

Pangram, ICLR makalelerinin %21’inin yapay zeka tarafından yazıldığını öngörüyor

18 Kasım 2025
Amazon'daki ilk sayfadaki yorumların yüzde üçü artık yapay zeka tarafından oluşturuluyor
Vaka Çalışmaları

Amazon'daki ilk sayfadaki yorumların yüzde üçü artık yapay zeka tarafından oluşturuluyor

4 Mayıs 2026
Hangi AI Algılayıcı En Doğru Sonuçları Veriyor? Test Edilen 30 Araç (2026)
Vaka Çalışmaları

Hangi AI Algılayıcı En Doğru Sonuçları Veriyor? Test Edilen 30 Araç (2026)

7 Ocak 2026
Gazeteciler de, hepimiz gibi, yapay zeka tarafından üretilen basın bültenlerinden nefret ediyor
Vaka Çalışmaları

Gazeteciler de, hepimiz gibi, yapay zeka tarafından üretilen basın bültenlerinden nefret ediyor

23 Eylül 2026