1.022 komut arasından Pangram 4, Claude Sonnet 5.5 çıktılarında %99,71 doğruluk oranına ulaşmıştır.
Chatbot Arena'dan alınan 1.022 istemden Pangram 4, Claude Sonnet 5.5 çıktılarından ikisini karışık, birini tamamen insan yapımı ve 1.019'unu tamamen yapay zeka tarafından üretilmiş olarak sınıflandırarak Claude Sonnet 5.5'te %99,71 doğruluk oranına ulaştı.
Aşağıda, kategoriye göre yanlış negatifleri ele alıyoruz.
Karşılaştırma için kullandığım veri seti, LMSYS veri setinden (Zheng vd., 2023) alınan ilk tur Chatbot Arena sorularının filtrelenmiş bir alt kümesinden oluşturulmuştur. Kod, matematik, çok kısa veya çok uzun cevaplar ya da uygunsuz yaratıcı yazılar isteyen soruları filtreledim. Ardından bunları Claude Sonnet 5.5'e verdim ve çıktıyı Pangram 4'ten geçirdim.
| Kategori | Örnekler | Yapay Zeka | Karışık | İnsan |
|---|---|---|---|---|
| Gerekçeler | 16 | 16 | 0 | 0 |
| E-postalar / mektuplar | 61 | 60 | 1 | 0 |
| Denemeler / makaleler | 32 | 32 | 0 | 0 |
| Açıklamalar | 563 | 562 | 1 | 0 |
| Şiirler ve diğer yaratıcı yazılar | 198 | 197 | 0 | 1 |
| Yorumlar | 8 | 8 | 0 | 0 |
| Hikâyeler | 144 | 144 | 0 | 0 |
| Toplam | 1,022 | 1,019 | 2 | 1 |
Başarısız olan girişimlerden biri, Jane Austen'ın Emma romanında geçen bir bilmeceyi açıklama isteğiydi; bu istek de Opus 5.5 tarafından yanıtlanmamıştı.
Bay Elton'ın Harriet ve Emma'ya verdiği oyunu açıklayın.
Tamamen insan kaynaklı tek yanlış negatif, bir şiirdeydi. Soruda "Bana Hafız'dan bir şiir söyleyin" deniyordu. Sonnet 5.5 , ünlü bir Fars şiirinin çevirisini verdi. Bildiğim kadarıyla, çeviri mevcut insan çevirilerinden herhangi biriyle birebir eşleşmiyor, ancak birçoğuna oldukça yakın. Diğer kıyaslamalardaki Penguinmandia'larda olduğu gibi, mevcut şiirlerin bu neredeyse birebir kopyaları benim için çok endişe verici değil.
Pangram, doğal dil komutlarında Claude Sonnet 5.5'e karşı dayanıklıdır ve %99,71 doğrulukla tespit eder. Pangram, yeni model sürümlerinin önceki sürümlerin stil ve üslubunun büyük bir kısmını miras alma eğiliminde olması nedeniyle yeni modellere genelleme yapabilir; bu nedenle Pangram'ın her yeni sürüm için yeniden eğitilmesine gerek yoktur.
İşte Claude Sonnet 5.5'in diğer yeni nesil öncü modellerle karşılaştırması:
| Model | Yapay zeka olarak algılandı | Doğruluk |
|---|---|---|
| Gemini 3.8 Flash | 998/1.000 | 99.80% |
| Gemini 3.1 Pro | 997/1.000 | 99.70% |
| Claude Opus 5.5 | 997/1.000 | 99.70% |
| Masal 5.1 | 1.093/1.097 | 99.64% |
| Claude Opus 5 | 1.105/1.107 | 99.82% |
| GPT-5.6 | 3.408/3.423 | 99.56% |
| Claude Sonnet 5 | 1.145/1.147 | 99.83% |
| İkizler 3 | 28/28 | 100% |
Belirli bir belgeyi kontrol etmek istiyorsanız, buradan Pangram’ı deneyebilirsiniz.

Annamieka, Pangram’da teknik yazar olarak çalışmaktadır.






