986 komut arasından Pangram 4, GPT-6 Astra çıktılarında %99,59 doğruluk oranına ulaşmıştır.
Chatbot Arena'dan alınan 986 komuttan Pangram 4, GPT-6 Astra çıktılarından üçünü karışık, birini tamamen insan tarafından oluşturulmuş ve 982'sini tamamen yapay zeka tarafından oluşturulmuş olarak sınıflandırarak GPT-6 Astra'da %99,59 doğruluk oranına ulaştı.
Aşağıda, kategoriye göre yanlış negatifleri ele alıyoruz.
Karşılaştırma ölçütü, LMSYS veri setinden (Zheng vd., 2023) alınan ilk tur Chatbot Arena istemlerinin filtrelenmiş bir alt kümesi kullanılarak oluşturuldu. Kod, matematik, çok kısa veya çok uzun cevaplar ya da uygunsuz yaratıcı yazı isteyen istemleri filtreledim. Ardından bunları GPT-6 Astra'ya verdim ve çıktıyı Pangram 4'ten geçirdim.
| Kategori | Örnekler | Yapay Zeka | Karışık | İnsan |
|---|---|---|---|---|
| Gerekçeler | 16 | 16 | 0 | 0 |
| E-postalar / mektuplar | 57 | 56 | 1 | 0 |
| Denemeler / makaleler | 34 | 34 | 0 | 0 |
| Açıklamalar | 547 | 546 | 1 | 0 |
| Şiirler ve diğer yaratıcı yazılar | 183 | 181 | 1 | 1 |
| Yorumlar | 7 | 7 | 0 | 0 |
| Hikâyeler | 142 | 142 | 0 | 0 |
| Toplam | 986 | 982 | 3 | 1 |
Elde edilen üç karma sonuç bir şiir, kısa bir açıklama ve bir e-postaydı.
Astra, kısa sorulara genellikle çok kısa cevaplar veriyor. Bu kıyaslama seti için toplamda 1.032 soru gönderdim, ancak Astra 6'nın 46 cevabı Pangram'ın 50 kelimelik minimum sınırının altında kaldı ve puanlanmadı.
Pangram, doğal dil komutlarında GPT-6 Astra'ya karşı dayanıklıdır ve %99,59 doğrulukla tespit eder. Pangram, yeni model sürümlerinin önceki sürümlerin stil ve üslubunun büyük bir kısmını miras alma eğiliminde olması nedeniyle yeni modellere genelleme yapabilir; bu nedenle Pangram'ın her yeni sürüm için yeniden eğitilmesine gerek yoktur.
İşte GPT-6 Astra'nın diğer yeni nesil öncü modellerle karşılaştırması:
| Model | Yapay zeka olarak algılandı | Doğruluk |
|---|---|---|
| Claude Sonnet 5.5 | 1.019/1.022 | 99.71% |
| Gemini 3.8 Flash | 998/1.000 | 99.80% |
| Gemini 3.1 Pro | 997/1.000 | 99.70% |
| Claude Opus 5.5 | 997/1.000 | 99.70% |
| Masal 5.1 | 1.093/1.097 | 99.64% |
| Claude Opus 5 | 1.105/1.107 | 99.82% |
| GPT-5.6 | 3.408/3.423 | 99.56% |
| Claude Sonnet 5 | 1.145/1.147 | 99.83% |
| İkizler 3 | 28/28 | 100% |
Belirli bir belgeyi kontrol etmek istiyorsanız, buradan Pangram’ı deneyebilirsiniz.

Annamieka, Pangram’da teknik yazar olarak çalışmaktadır.






