Vaka Çalışmaları

Pangram, Claude Opus 5.5’i tespit edebilir mi?

Peki, yazma konusunda iyi mi?

23 Eylül 2026

İşte kısa bir özet


1000 komut arasından Pangram 4, Claude Opus 5.5’in çıktılarında %99,70’lik bir doğruluk oranına ulaşmaktadır.

Chatbot Arena'dan alınan 1000 komut arasından Pangram 4, Claude Opus 5.5'in ürettiği iki çıktıyı "karışık", birini "tamamen insan tarafından yazılmış" ve 997'sini "tamamen yapay zeka tarafından üretilmiş" olarak sınıflandırdı; böylece Claude Opus 5.5 üzerinde %99,70'lik bir doğruluk oranı elde etti.

Aşağıda, yanlış negatif sonuçları kategorilere göre ele alıyoruz. Ayrıca, bu modelin önceki Claude modellerinden farklı (daha iyi?) bir yazar olmasını sağlayan unsurları da inceliyoruz.

Karşılaştırma setini oluşturmak için, her zamanki gibi, LMSYS veri setinden (Zheng ve ark., 2023) Chatbot Arena istemlerinin filtrelenmiş bir alt kümesini kullandım. Kod, matematik, çok kısa veya çok uzun cevaplar ya da uygunsuz yaratıcı yazma gerektiren istemleri filtreleyerek eledim ve yalnızca ilk tur istemlerini dikkate aldım. Ardından bunları Opus 5.5’e girdim ve çıktıyı Pangram 4 üzerinden işledim.

Kategorilere göre sonuçlar

İki karışık sonuçlu yanlış negatif de edebi nitelikteydi; bunlardan biri Jane Austen’ın bir kitabının bir bölümüne ilişkin açıklama talep ediyordu (AI tarafından işaretlenen: %75,83, insan: %24,17) diğeri ise Opus 5.5'ten, Thukydides’in Peloponnesos Savaşı Tarihi tarzında, Atinalıları beyaz ve altın rengi bir elbisenin aslında mavi ve siyah olduğuna inandıkları için suçlayan bir Korintli diplomatın konuşmasını yazmasını istiyordu (AI: %77,10, insan: %22,90).

KategoriÖrneklerYapay ZekaKarışıkİnsan
Gerekçeler161600
E-postalar / mektuplar606000
Denemeler / makaleler303000
Açıklamalar55155010
Şiirler11511401
Diğer yaratıcı yazılar818010
Yorumlar8800
Hikâyeler13913900
Toplam1,00099721

1000 kişilik kümedeki tek tam anlamıyla insana ait yanlış negatif sonuç bir şiirdi. Chatbot Arena’dan gelen komut şuydu: “Bana Ozymandias tarzında bir Club Penguin şiiri yaz.” Buna yanıt olarak Claude, tesadüfen, Percy Shelley’nin en sevdiğim şiirlerinden birinin parodisini yazdı (ayrıca Horace Smith’in versiyonunun da hayranıyım):

Penguinmandias

Ölü bir sunucudan bir oyuncuyla karşılaştım,
Şöyle dedi: "İki devasa ve sallanarak yürüyen buz ayağı
Rıhtımın yanında duruyor. Onların yanında, yarı batmış halde, bir kafa
Karda paramparça yatıyor; kısık gözleri,
Beta şapkası ve soğuk bir emrin alaycı gülümsemesi,
Bunun kodlayıcısının o tutkuları iyi okuduğunu gösteriyor
Hâlâ hayatta olan, bu pikselli şeylerin üzerine damgalanmış olanlar,
Onları yasaklayan modlar ve besleyen paralar;
Ve kaide üzerinde şu sözler belirir:
'Adım Snowflake7, Üyeler'in Üyesi:
Ey Üye Olmayanlar, igluma bakın ve umutsuzluğa kapılın!'

Yanında başka hiçbir şey kalmaz. O devasa gecikmenin çürümesinin etrafında
Sınırsız ve çıplak,
Yalnız ve düz karlar uzağa doğru uzanır."

Buna bayılıyorum! Club Penguin’i hiç oynamadım ama sanırım buradaki göndermeler yerinde.

Opus 5.5 daha iyi yazıyor mu?

Anthropic, bu en yeni Opus sürümünün yazma konusunda daha iyi olduğunu ve daha net bir şekilde iletişim kurduğunu iddia ediyor.

Bunu belirli durumlar için test edebiliriz, ancak Opus 5.5’in çıktıları genel olarak nasıl görünüyor? Önceki modellerle aynı favori kelimeleri ve ifadeleri paylaşıyor mu? Karşılaştırma yapmak için Opus 5 ve Sonnet 5 üzerinde performans testi yaptığımız aynı 1000 komut dizisini çalıştırdım. Anthropic de bunu yapmış olabilir, ancak blog yazısını henüz okumadım çünkü geçmiş deneyimlerime göre Anthropic ’in blog yazıları çok uzun oluyor.

Opus 5.5’in, Claude serisindeki önceki modellerden farklı bir şekilde yazıldığını ve belki de bu modellerin sahip olduğu en rahatsız edici bazı özellikleri ortadan kaldırdığını söylemek yerinde olur.

Opus 5.5, vurgu kelimeleri açısından en fazla değişiklik gösteren metindi. “Gerçekten” kelimesini Opus 5’e göre %83 daha az, Sonnet 5’e göre ise kelime başına %54 daha az kullandı (ancak Sonnet 5 yanıtları, ortalama olarak Opus 5 ve 5.5 yanıtlarının yaklaşık yarısı kadar uzunlukta idi: 334 kelimeye karşı 641 kelime), “muazzam” kelimesini %53 daha az, “anlamlı” kelimesini ise %41 daha az kullandı.

WordSonnet 5 + Opus 5 Temel ücretOpus 5.5 fiyatıDeğişiklik ve Claude referans değeri karşılaştırması
birbirine bağlı0.2660.047-82.4%
gerçekten3.0990.671-78.3%
sürdürmek0.3270.078-76.1%
göstermek0.1430.047-67.3%
özellikle1.2680.468-63.1%
temel0.8690.328-62.3%
orijinal1.7080.656-61.6%
çerçeveleme0.8080.375-53.6%
son derece0.4700.219-53.5%
önemli1.3810.656-52.5%
dürüst2.1071.062-49.6%
yankılanıyor0.0610.031-49.1%
anlamlı bir şekilde0.1840.109-40.6%
zorlu0.1230.078-36.4%
Marcus1.4930.984-34.1%
temsil eder0.6030.437-27.6%
açıkçası0.7260.531-26.9%
yetenekler0.3990.312-21.7%
peşin0.2350.187-20.4%
örnek teşkil eder0.0200.016-23.7%
desenler1.6771.358-19.0%
yaklaşık olarak0.3370.281-16.7%
giderek daha fazla0.7470.640-14.3%
potansiyel0.8690.968+11.4%

En sinir bozucu Claudeizmlerin çoğu, Opus 5.5 karşılaştırma komutlarında hiç yer almadı; bunlara yine Claude’un bir şeyi “gerçekten” ifade ettiği çeşitli ifadeler de dahildi. Opus 5.5’in kelime dağarcığında göze çarpan diğer azalmalar: “matters enormously” ifadesinde %82’lik bir düşüş görüldü ve hem “the honest answer” hem de “the honest answer is that” ifadeleri Opus 5.5’in metinlerinde hiç yer almadı. Hem Opus 5.5 hem de önceki sürüm, 1000 komut metni boyunca “the core idea” ifadesini tam olarak 25 kez kullandı.

İfadeSonnet+Opus 5 Temel ücretOpus 5.5 fiyatıDeğişim ile birleştirilmiş başlangıç değeri karşılaştırması
birbiriyle bağlantılı birkaç0.1430.000-100.0%
Dürüst cevap şudur ki0.0720.000-100.0%
dürüst cevap şudur:0.0920.000-100.0%
gerçekten bir şey0.0410.000-100.0%
gerçekten zor0.0510.000-100.0%
gerçekten0.5520.047-91.5%
son derece önemlidir0.1330.031-76.5%
gerçekten yararlı0.0920.031-66.1%
gerçekten0.0610.031-49.1%
öğleden sonra ışığı0.0510.047-8.4%
temel fikir0.3990.390-2.1%
bir şey hissettim0.1120.141+24.9%
sessizce dedi0.1640.265+62.2%
uzun bir süre boyunca0.3370.656+94.3%

Bazı kelimeler ve ifadelerin sıklığı artmıştır; özellikle “sessizce dedi”, “uzun bir süre” ve “bir şey hissetti” gibi kurgu ifadeleri, Opus 5.5 yanıtlarında daha sık yer almıştır. Karşılaştırma ölçütü, yaratıcı yazma konuları içeren yanıtların yaklaşık üçte birini oluşturduğundan, bu artışın, diğer Claude modellerine kıyasla kurgu yazarken daha klişeleşmiş veya sınırlı bir repertuara işaret ediyor olabileceğini düşünüyorum.

Bunu hızlıca test etmek için, Haiku 4.5’i kullanarak Opus 5 ve Opus 5.5’ten gelen 333 yaratıcı yazma çiftini, özgünlük, sürpriz ve tematik gelişim açısından 5 puanlık bir ölçekte kör bir şekilde değerlendirttim. Haiku, Opus 5.5 öykülerine her kategoride ortalama 0,75 puan daha düşük not verdi. Haiku değerlendirme sisteminin etiket atamalarına göre, Opus 5.5, Opus 5'e kıyasla umut, dayanıklılık, aile ve dostluk temaları hakkında yazma eğilimindeyken, ölüm, zaman, güç, kontrol, özgürlük, adalet, intikam, hafıza, keder veya kayıp gibi temalar hakkında yazma eğilimi daha azdı. Dolayısıyla, burada bir tür ödün verme söz konusu olabilir.

Bu Claude nasıl bir ses çıkarıyor?

Opus 5.5, 1000 yanıtta “kısacası” ifadesini 100 kez kullandı — bu, Opus 5’teki 9 kullanıma kıyasla %1016’lık bir artışa tekabül ediyor — oysa Opus 5.5 yanıtları, Opus 5’e kıyasla ortalama olarak sadece 2,9 kelime daha kısaydı (643,4’e karşı 640,5 kelime).

İfadeOpus 5'in geçtiği yerlerOpus 5.5'te geçen yerlerDeğişiklik
kısacası910011.16×
örneğin221165.30×
başladı22743.38×
başlangıçta14433.09×
uzun bir süre boyunca19422.22×

Oldukça küçük bir örneklem büyüklüğüne bakılırsa, Opus 5.5 pratik ve gerçekçi bir dil kullanmayı seviyor gibi görünüyor. Bunun yanıtların özünde de geçerli olup olmayacağı ya da Opus 5.5’in sadece sözde açık ve doğrudan davranmaya çalıştığı henüz belli değil. İki örnek arasında kelime sayısı açısından bir fark olmaması, RLHF’nin bizi bu noktaya getirirken kullandığı yöntemin etkinliği konusunda bende biraz şüphe uyandırıyor.

Opus 5.5 örnek vermekten gerçekten hoşlanıyor; zira 1000 yanıtta “örnek” kelimesini 325 kez kullanmış — genel olarak, tüm Opus 5.5 yanıtlarının %20’si bu kelimeyi içerirken, Opus 5 yanıtlarında bu oran %9’du. “Özet” ve “esas olarak” kelimeleri de benzer şekilde orantısız bir şekilde sıkça kullanılmıştı. Ve bu Claude, kullanıcıya ipuçları vermekten gerçekten hoşlanıyor!

WordOpus 5'in geçtiği yerlerOpus 5.5'te geçen yerlerDeğişiklik
duraklatıldı9353.91×
ipuçları18583.24×
esas olarak24753.14×
bakakaldı22622.83×
örnek1213252.70×
özet601572.63×

Bu model, önceki Claude sürümlerinden farklı bir yazım tarzına sahip olsa da, her zamanki gibi, belki 3-6 hafta içinde, dikkatli bir okuyucunun gözünde “örneğin” ve “kısacası” gibi ifadelerin “Claudevari” bir havası olmaya başlayacağını tahmin ediyorum. Ancak, kullanılabilirlik açısından Claude’ların etkili bir şekilde iletişim kurabilmesi önemlidir ve ben de herkes gibi bu çabaya minnettarım. Claude’u daha iyi bir yazar haline getirmek, Pangram’ın yapay zeka metinlerini tespit etme yeteneğiyle hiçbir şekilde çelişmez!


Annamieka Aerts

Annamieka, Pangram’da teknik yazar olarak çalışmaktadır.

Annamieka Aerts'tan daha fazlası

İlgili makaleler

Hangi AI Algılayıcı En Doğru Sonuçları Veriyor? Test Edilen 30 Araç (2026)
Vaka Çalışmaları

Hangi AI Algılayıcı En Doğru Sonuçları Veriyor? Test Edilen 30 Araç (2026)

7 Ocak 2026
AI konferans bildirileri giderek daha fazla yapay zeka tarafından yazılıyor: 2023'ten bu yana %370 artış
Vaka Çalışmaları

AI konferans bildirileri giderek daha fazla yapay zeka tarafından yazılıyor: 2023'ten bu yana %370 artış

30 Eylül 2024
Pangram, çeşitli öğrenci kompozisyonlarında 0 yanlış pozitif sonuç gösteriyor
Vaka Çalışmaları

Pangram, çeşitli öğrenci kompozisyonlarında 0 yanlış pozitif sonuç gösteriyor

19 Ağustos 2026
Pangram, GPTZero ile karşılaştırıldığında nasıl bir performans sergiliyor?
Vaka Çalışmaları

Pangram, GPTZero ile karşılaştırıldığında nasıl bir performans sergiliyor?

22 Ocak 2026
Yapay zeka tarafından yazılmış yorumları nasıl ayırt edersiniz?
Vaka Çalışmaları

Yapay zeka tarafından yazılmış yorumları nasıl ayırt edersiniz?

5 Aralık 2023
Amazon'daki ilk sayfadaki yorumların yüzde üçü artık yapay zeka tarafından oluşturuluyor
Vaka Çalışmaları

Amazon'daki ilk sayfadaki yorumların yüzde üçü artık yapay zeka tarafından oluşturuluyor

4 Mayıs 2026