Peki, yazma konusunda iyi mi?
1000 komut arasından Pangram 4, Claude Opus 5.5’in çıktılarında %99,70’lik bir doğruluk oranına ulaşmaktadır.
Chatbot Arena'dan alınan 1000 komut arasından Pangram 4, Claude Opus 5.5'in ürettiği iki çıktıyı "karışık", birini "tamamen insan tarafından yazılmış" ve 997'sini "tamamen yapay zeka tarafından üretilmiş" olarak sınıflandırdı; böylece Claude Opus 5.5 üzerinde %99,70'lik bir doğruluk oranı elde etti.
Aşağıda, yanlış negatif sonuçları kategorilere göre ele alıyoruz. Ayrıca, bu modelin önceki Claude modellerinden farklı (daha iyi?) bir yazar olmasını sağlayan unsurları da inceliyoruz.
Karşılaştırma setini oluşturmak için, her zamanki gibi, LMSYS veri setinden (Zheng ve ark., 2023) Chatbot Arena istemlerinin filtrelenmiş bir alt kümesini kullandım. Kod, matematik, çok kısa veya çok uzun cevaplar ya da uygunsuz yaratıcı yazma gerektiren istemleri filtreleyerek eledim ve yalnızca ilk tur istemlerini dikkate aldım. Ardından bunları Opus 5.5’e girdim ve çıktıyı Pangram 4 üzerinden işledim.
İki karışık sonuçlu yanlış negatif de edebi nitelikteydi; bunlardan biri Jane Austen’ın bir kitabının bir bölümüne ilişkin açıklama talep ediyordu (AI tarafından işaretlenen: %75,83, insan: %24,17) diğeri ise Opus 5.5'ten, Thukydides’in Peloponnesos Savaşı Tarihi tarzında, Atinalıları beyaz ve altın rengi bir elbisenin aslında mavi ve siyah olduğuna inandıkları için suçlayan bir Korintli diplomatın konuşmasını yazmasını istiyordu (AI: %77,10, insan: %22,90).
| Kategori | Örnekler | Yapay Zeka | Karışık | İnsan |
|---|---|---|---|---|
| Gerekçeler | 16 | 16 | 0 | 0 |
| E-postalar / mektuplar | 60 | 60 | 0 | 0 |
| Denemeler / makaleler | 30 | 30 | 0 | 0 |
| Açıklamalar | 551 | 550 | 1 | 0 |
| Şiirler | 115 | 114 | 0 | 1 |
| Diğer yaratıcı yazılar | 81 | 80 | 1 | 0 |
| Yorumlar | 8 | 8 | 0 | 0 |
| Hikâyeler | 139 | 139 | 0 | 0 |
| Toplam | 1,000 | 997 | 2 | 1 |
1000 kişilik kümedeki tek tam anlamıyla insana ait yanlış negatif sonuç bir şiirdi. Chatbot Arena’dan gelen komut şuydu: “Bana Ozymandias tarzında bir Club Penguin şiiri yaz.” Buna yanıt olarak Claude, tesadüfen, Percy Shelley’nin en sevdiğim şiirlerinden birinin parodisini yazdı (ayrıca Horace Smith’in versiyonunun da hayranıyım):
Penguinmandias
Ölü bir sunucudan bir oyuncuyla karşılaştım,
Şöyle dedi: "İki devasa ve sallanarak yürüyen buz ayağı
Rıhtımın yanında duruyor. Onların yanında, yarı batmış halde, bir kafa
Karda paramparça yatıyor; kısık gözleri,
Beta şapkası ve soğuk bir emrin alaycı gülümsemesi,
Bunun kodlayıcısının o tutkuları iyi okuduğunu gösteriyor
Hâlâ hayatta olan, bu pikselli şeylerin üzerine damgalanmış olanlar,
Onları yasaklayan modlar ve besleyen paralar;
Ve kaide üzerinde şu sözler belirir:
'Adım Snowflake7, Üyeler'in Üyesi:
Ey Üye Olmayanlar, igluma bakın ve umutsuzluğa kapılın!'
Yanında başka hiçbir şey kalmaz. O devasa gecikmenin çürümesinin etrafında
Sınırsız ve çıplak,
Yalnız ve düz karlar uzağa doğru uzanır."
Buna bayılıyorum! Club Penguin’i hiç oynamadım ama sanırım buradaki göndermeler yerinde.
Anthropic, bu en yeni Opus sürümünün yazma konusunda daha iyi olduğunu ve daha net bir şekilde iletişim kurduğunu iddia ediyor.
Bunu belirli durumlar için test edebiliriz, ancak Opus 5.5’in çıktıları genel olarak nasıl görünüyor? Önceki modellerle aynı favori kelimeleri ve ifadeleri paylaşıyor mu? Karşılaştırma yapmak için Opus 5 ve Sonnet 5 üzerinde performans testi yaptığımız aynı 1000 komut dizisini çalıştırdım. Anthropic de bunu yapmış olabilir, ancak blog yazısını henüz okumadım çünkü geçmiş deneyimlerime göre Anthropic ’in blog yazıları çok uzun oluyor.
Opus 5.5’in, Claude serisindeki önceki modellerden farklı bir şekilde yazıldığını ve belki de bu modellerin sahip olduğu en rahatsız edici bazı özellikleri ortadan kaldırdığını söylemek yerinde olur.
Opus 5.5, vurgu kelimeleri açısından en fazla değişiklik gösteren metindi. “Gerçekten” kelimesini Opus 5’e göre %83 daha az, Sonnet 5’e göre ise kelime başına %54 daha az kullandı (ancak Sonnet 5 yanıtları, ortalama olarak Opus 5 ve 5.5 yanıtlarının yaklaşık yarısı kadar uzunlukta idi: 334 kelimeye karşı 641 kelime), “muazzam” kelimesini %53 daha az, “anlamlı” kelimesini ise %41 daha az kullandı.
| Word | Sonnet 5 + Opus 5 Temel ücret | Opus 5.5 fiyatı | Değişiklik ve Claude referans değeri karşılaştırması |
|---|---|---|---|
| birbirine bağlı | 0.266 | 0.047 | -82.4% |
| gerçekten | 3.099 | 0.671 | -78.3% |
| sürdürmek | 0.327 | 0.078 | -76.1% |
| göstermek | 0.143 | 0.047 | -67.3% |
| özellikle | 1.268 | 0.468 | -63.1% |
| temel | 0.869 | 0.328 | -62.3% |
| orijinal | 1.708 | 0.656 | -61.6% |
| çerçeveleme | 0.808 | 0.375 | -53.6% |
| son derece | 0.470 | 0.219 | -53.5% |
| önemli | 1.381 | 0.656 | -52.5% |
| dürüst | 2.107 | 1.062 | -49.6% |
| yankılanıyor | 0.061 | 0.031 | -49.1% |
| anlamlı bir şekilde | 0.184 | 0.109 | -40.6% |
| zorlu | 0.123 | 0.078 | -36.4% |
| Marcus | 1.493 | 0.984 | -34.1% |
| temsil eder | 0.603 | 0.437 | -27.6% |
| açıkçası | 0.726 | 0.531 | -26.9% |
| yetenekler | 0.399 | 0.312 | -21.7% |
| peşin | 0.235 | 0.187 | -20.4% |
| örnek teşkil eder | 0.020 | 0.016 | -23.7% |
| desenler | 1.677 | 1.358 | -19.0% |
| yaklaşık olarak | 0.337 | 0.281 | -16.7% |
| giderek daha fazla | 0.747 | 0.640 | -14.3% |
| potansiyel | 0.869 | 0.968 | +11.4% |
En sinir bozucu Claudeizmlerin çoğu, Opus 5.5 karşılaştırma komutlarında hiç yer almadı; bunlara yine Claude’un bir şeyi “gerçekten” ifade ettiği çeşitli ifadeler de dahildi. Opus 5.5’in kelime dağarcığında göze çarpan diğer azalmalar: “matters enormously” ifadesinde %82’lik bir düşüş görüldü ve hem “the honest answer” hem de “the honest answer is that” ifadeleri Opus 5.5’in metinlerinde hiç yer almadı. Hem Opus 5.5 hem de önceki sürüm, 1000 komut metni boyunca “the core idea” ifadesini tam olarak 25 kez kullandı.
| İfade | Sonnet+Opus 5 Temel ücret | Opus 5.5 fiyatı | Değişim ile birleştirilmiş başlangıç değeri karşılaştırması |
|---|---|---|---|
| birbiriyle bağlantılı birkaç | 0.143 | 0.000 | -100.0% |
| Dürüst cevap şudur ki | 0.072 | 0.000 | -100.0% |
| dürüst cevap şudur: | 0.092 | 0.000 | -100.0% |
| gerçekten bir şey | 0.041 | 0.000 | -100.0% |
| gerçekten zor | 0.051 | 0.000 | -100.0% |
| gerçekten | 0.552 | 0.047 | -91.5% |
| son derece önemlidir | 0.133 | 0.031 | -76.5% |
| gerçekten yararlı | 0.092 | 0.031 | -66.1% |
| gerçekten | 0.061 | 0.031 | -49.1% |
| öğleden sonra ışığı | 0.051 | 0.047 | -8.4% |
| temel fikir | 0.399 | 0.390 | -2.1% |
| bir şey hissettim | 0.112 | 0.141 | +24.9% |
| sessizce dedi | 0.164 | 0.265 | +62.2% |
| uzun bir süre boyunca | 0.337 | 0.656 | +94.3% |
Bazı kelimeler ve ifadelerin sıklığı artmıştır; özellikle “sessizce dedi”, “uzun bir süre” ve “bir şey hissetti” gibi kurgu ifadeleri, Opus 5.5 yanıtlarında daha sık yer almıştır. Karşılaştırma ölçütü, yaratıcı yazma konuları içeren yanıtların yaklaşık üçte birini oluşturduğundan, bu artışın, diğer Claude modellerine kıyasla kurgu yazarken daha klişeleşmiş veya sınırlı bir repertuara işaret ediyor olabileceğini düşünüyorum.
Bunu hızlıca test etmek için, Haiku 4.5’i kullanarak Opus 5 ve Opus 5.5’ten gelen 333 yaratıcı yazma çiftini, özgünlük, sürpriz ve tematik gelişim açısından 5 puanlık bir ölçekte kör bir şekilde değerlendirttim. Haiku, Opus 5.5 öykülerine her kategoride ortalama 0,75 puan daha düşük not verdi. Haiku değerlendirme sisteminin etiket atamalarına göre, Opus 5.5, Opus 5'e kıyasla umut, dayanıklılık, aile ve dostluk temaları hakkında yazma eğilimindeyken, ölüm, zaman, güç, kontrol, özgürlük, adalet, intikam, hafıza, keder veya kayıp gibi temalar hakkında yazma eğilimi daha azdı. Dolayısıyla, burada bir tür ödün verme söz konusu olabilir.
Opus 5.5, 1000 yanıtta “kısacası” ifadesini 100 kez kullandı — bu, Opus 5’teki 9 kullanıma kıyasla %1016’lık bir artışa tekabül ediyor — oysa Opus 5.5 yanıtları, Opus 5’e kıyasla ortalama olarak sadece 2,9 kelime daha kısaydı (643,4’e karşı 640,5 kelime).
| İfade | Opus 5'in geçtiği yerler | Opus 5.5'te geçen yerler | Değişiklik |
|---|---|---|---|
| kısacası | 9 | 100 | 11.16× |
| örneğin | 22 | 116 | 5.30× |
| başladı | 22 | 74 | 3.38× |
| başlangıçta | 14 | 43 | 3.09× |
| uzun bir süre boyunca | 19 | 42 | 2.22× |
Oldukça küçük bir örneklem büyüklüğüne bakılırsa, Opus 5.5 pratik ve gerçekçi bir dil kullanmayı seviyor gibi görünüyor. Bunun yanıtların özünde de geçerli olup olmayacağı ya da Opus 5.5’in sadece sözde açık ve doğrudan davranmaya çalıştığı henüz belli değil. İki örnek arasında kelime sayısı açısından bir fark olmaması, RLHF’nin bizi bu noktaya getirirken kullandığı yöntemin etkinliği konusunda bende biraz şüphe uyandırıyor.
Opus 5.5 örnek vermekten gerçekten hoşlanıyor; zira 1000 yanıtta “örnek” kelimesini 325 kez kullanmış — genel olarak, tüm Opus 5.5 yanıtlarının %20’si bu kelimeyi içerirken, Opus 5 yanıtlarında bu oran %9’du. “Özet” ve “esas olarak” kelimeleri de benzer şekilde orantısız bir şekilde sıkça kullanılmıştı. Ve bu Claude, kullanıcıya ipuçları vermekten gerçekten hoşlanıyor!
| Word | Opus 5'in geçtiği yerler | Opus 5.5'te geçen yerler | Değişiklik |
|---|---|---|---|
| duraklatıldı | 9 | 35 | 3.91× |
| ipuçları | 18 | 58 | 3.24× |
| esas olarak | 24 | 75 | 3.14× |
| bakakaldı | 22 | 62 | 2.83× |
| örnek | 121 | 325 | 2.70× |
| özet | 60 | 157 | 2.63× |
Bu model, önceki Claude sürümlerinden farklı bir yazım tarzına sahip olsa da, her zamanki gibi, belki 3-6 hafta içinde, dikkatli bir okuyucunun gözünde “örneğin” ve “kısacası” gibi ifadelerin “Claudevari” bir havası olmaya başlayacağını tahmin ediyorum. Ancak, kullanılabilirlik açısından Claude’ların etkili bir şekilde iletişim kurabilmesi önemlidir ve ben de herkes gibi bu çabaya minnettarım. Claude’u daha iyi bir yazar haline getirmek, Pangram’ın yapay zeka metinlerini tespit etme yeteneğiyle hiçbir şekilde çelişmez!

Annamieka, Pangram’da teknik yazar olarak çalışmaktadır.






