دراسات حالة

هل يستطيع «بانغرام» اكتشاف «كلود أوبوس 5.5»؟

وهل يجيد الكتابة؟

23 سبتمبر 2026

إليك ملخص موجز


من بين 1000 موجه، حقق «بانغرام 4» دقة بلغت 99.70% في مخرجات «كلود أوبوس 5.5».

من بين 1000 موجه تم الحصول عليها من موقع Chatbot Arena، صنّف برنامج Pangram 4 نتيجتين من نظام Claude Opus 5.5 على أنهما «مختلطتان»، ونتيجة واحدة على أنها «من إنتاج بشري بالكامل»، و997 نتيجة على أنها «من إنتاج الذكاء الاصطناعي بالكامل»، محققًا بذلك دقة بلغت 99.70% في تقييم نظام Claude Opus 5.5.

فيما يلي نناقش النتائج السلبية الخاطئة حسب الفئة. كما نبحث في العوامل التي تجعل هذا النموذج كاتبًا مختلفًا (أو أفضل؟) عن نماذج «كلود» السابقة.

لإنشاء مجموعة المعايير المرجعية، كما هو الحال دائمًا، استخدمت مجموعة فرعية مُصفاة من مطالبات «Chatbot Arena» المأخوذة من مجموعة البيانات LMSYS (Zheng et al., 2023). قمت باستبعاد المطالبات التي تطلب كتابة أكواد برمجية، أو حلولًا رياضية، أو إجابات قصيرة جدًّا أو طويلة جدًّا، أو كتابة إبداعية غير ملائمة، واكتفيت بالنظر في المطالبات الخاصة بالجولة الأولى فقط. ثم قمت بتزويد «Opus 5.5» بهذه المطالبات وقمت بتشغيل النتائج عبر «Pangram 4».

النتائج حسب الفئة

وكانت الحالتان اللتان أسفرتا عن نتائج سلبية خاطئة من النوع المختلط أدبيتين؛ إحداهما طلبت شرحًا لفصل من كتاب لـ «جين أوستن» (تم وضع علامة عليها من قبل الذكاء الاصطناعي: 75.83٪، بشري: 24.17٪)، والآخر كان طلبًا لبرنامج Opus 5.5 بكتابة خطاب لدبلوماسي كورنثي يتهم الأثينيين بالاعتقاد بأن فستانًا أبيض وذهبي هو في الواقع أزرق وأسود، على غرار أسلوب ثيوسيديدس في تاريخه لحرب البيلوبونيز (الذكاء الاصطناعي: 77.10٪، بشري: 22.90٪).

الفئةأمثلةالذكاء الاصطناعيمختلطالبشر
الحجج161600
رسائل البريد الإلكتروني / الرسائل606000
مقالات / مقالات صحفية303000
تفسيرات55155010
قصائد11511401
أعمال أخرى في مجال الكتابة الإبداعية818010
التعليقات8800
قصص13913900
المجموع1,00099721

كانت القصيدة هي الحالة الوحيدة التي اعتُبرت «سلبية كاذبة» تمامًا من بين مجموعة من 1000 حالة. وكان الطلب المقدم من «Chatbot Arena» هو: «اكتب لي قصيدة عن «كلوب بينغوين» على غرار قصيدة «أوزيماندياس»». وردًا على ذلك، كتب «كلود» قصيدة ساخرة، والتي صادف أنها إحدى قصائدي المفضلة لبيرسي شيلي (وأنا أيضًا من المعجبين بنسخة هوراس سميث):

بينغوينماندياس

التقيت بلاعبًا من خادم مغلق،
قال: «قدمان جليديتان ضخمتان تتمايلان
تقفان بجانب الرصيف. وبجوارهما، نصف غارق، رأس
مستلقٍ محطمًا في الثلج، وعيناه المغمضتان،
وقبعته التجريبية، وابتسامته الساخرة التي تنم عن سيطرة باردة،
تخبرنا أن مبرمجه قرأ تلك المشاعر جيدًا
التي لا تزال حية، مطبوعة على هذه الأشياء المكونة من وحدات البكسل،
التعديلات التي حظرتها، والعملات التي غذتها؛
وعلى القاعدة تظهر هذه الكلمات:
«اسمي Snowflake7، عضو في Members:
انظروا إلى كوخي الجليدي، أيها غير الأعضاء، وايأسوا!»

لم يبقَ شيء بجانبه. حول أنقاض
ذلك التأخير الهائل، اللامحدود والجرداء،
تمتد الثلوج المنعزلة والمستوية بعيدًا.»

أنا معجب جدًّا بهذا! لم ألعب «كلوب بينغوين» قط، لكنني أعتقد أن الإشارات الواردة فيه ملائمة.

هل يُعد Opus 5.5 أفضل من حيث الكتابة؟

تدعي شركة «أنثروبيك» أن هذا الإصدار الأحدث من «أوبوس» أكثر كفاءة في الكتابة، وأنه يتواصل بشكل أوضح.

يمكننا اختبار ذلك في حالات معينة، لكن كيف تبدو نتائج «أوبوس 5.5» بشكل إجمالي؟ هل تشترك في نفس الكلمات والعبارات المفضلة لدى النماذج السابقة؟ قمت بتشغيل نفس الـ 1000 موجه التي استخدمناها في اختبار الأداء عبر «أوبوس 5» و«سونيت 5» للمقارنة. ربما تكون شركة «أنثروبيك» قد قامت بذلك أيضًا، لكنني لم أقرأ منشور مدونتهم بعد، لأن منشورات مدونة «أنثروبيك» عادةً ما تكون طويلة جدًّا في رأيي.

أعتقد أنه من الإنصاف القول إن Opus 5.5 يكتب بطريقة تختلف عن الطرز السابقة في عائلة «كلود»، وربما يتخلص من بعض العادات المزعجة التي كانت تتميز بها تلك الطرز.

كان «أوبوس 5.5» هو الأكثر تغيرًا فيما يتعلق باستخدام المكررات. فقد استخدمت كلمة «genuinely» بنسبة أقل بنسبة 83% مقارنةً بـ Opus 5، وبنسبة أقل بنسبة 54% لكل كلمة مقارنةً بـ Sonnet 5 (على الرغم من أن إجابات Sonnet 5 كانت في المتوسط نصف طول إجابات Opus 5 و5.5: 334 كلمة مقابل 641)، وكلمة «enormously» بنسبة أقل بنسبة 53%، وكلمة «meaningfully» بنسبة أقل بنسبة 41%.

Wordالسوناتة رقم 5 + العمل رقم 5 — السعر الأساسيسعر Opus 5.5التغيير مقارنة بخط الأساس الخاص بـ«كلود»
مترابطة0.2660.047-82.4%
بصدق3.0990.671-78.3%
الحفاظ على0.3270.078-76.1%
إثبات0.1430.047-67.3%
بشكل خاص1.2680.468-63.1%
أساسي0.8690.328-62.3%
أصلي1.7080.656-61.6%
التأطير0.8080.375-53.6%
بشكل هائل0.4700.219-53.5%
هام1.3810.656-52.5%
صادق2.1071.062-49.6%
تتردد أصداؤها0.0610.031-49.1%
بشكل هادف0.1840.109-40.6%
صعب0.1230.078-36.4%
ماركوس1.4930.984-34.1%
يمثل0.6030.437-27.6%
بصراحة0.7260.531-26.9%
القدرات0.3990.312-21.7%
مقدمًا0.2350.187-20.4%
يُعد مثالاً على0.0200.016-23.7%
الأنماط1.6771.358-19.0%
تقريبًا0.3370.281-16.7%
بشكل متزايد0.7470.640-14.3%
المحتملة0.8690.968+11.4%

لم تظهر العديد من «عبارات كلود» الأكثر إزعاجًا على الإطلاق في مطالبات اختبار الأداء Opus 5.5، بما في ذلك مرة أخرى عدة صيغ يستخدم فيها كلود عبارة «بصدق». ومن بين الانخفاضات الملحوظة الأخرى في مفردات «أوبوس 5.5»: شهدت عبارة «مهم للغاية» انخفاضًا بنسبة 82٪، ولم تظهر عبارات «الإجابة الصادقة» و«الإجابة الصادقة هي أن» على الإطلاق في نص «أوبوس 5.5». واستخدم كل من «أوبوس 5.5» وسابقه عبارة «الفكرة الأساسية» 25 مرة بالضبط خلال 1000 موجه.

عبارةSonnet+Opus 5 — السعر الأساسيسعر Opus 5.5التغيير مقارنةً بخط الأساس المجمع
عدة عناصر مترابطة0.1430.000-100.0%
الإجابة الصادقة هي أن0.0720.000-100.0%
الإجابة الصادقة هي0.0920.000-100.0%
شيء حقيقي حقًا0.0410.000-100.0%
صعب حقًا0.0510.000-100.0%
هو حقًا0.5520.047-91.5%
أمر بالغ الأهمية0.1330.031-76.5%
مفيد حقًّا0.0920.031-66.1%
أنا حقاً0.0610.031-49.1%
ضوء ما بعد الظهر0.0510.047-8.4%
الفكرة الأساسية0.3990.390-2.1%
شعرت بشيء ما0.1120.141+24.9%
قال بهدوء0.1640.265+62.2%
لفترة طويلة0.3370.656+94.3%

وقد زادت بعض الكلمات والعبارات، ولا سيما العبارات الخيالية مثل «قال بهدوء» و«لفترة طويلة» و«شعر بشيء ما»، حيث ظهرت بشكل أكثر تكرارًا في ردود «أوبوس 5.5». ونظرًا لأن المعيار المرجعي كان يتألف تقريبًا من ثلث موضوعات الكتابة الإبداعية، فإنني أعتقد أن هذه الزيادة قد تشير إلى وجود مخزون لغوي أكثر نمطية أو محدودية عند كتابة القصص الخيالية مقارنةً بنماذج «كلود» الأخرى.

ولإجراء اختبار سريع لذلك، قمتُ بتكليف برنامج «هايكو 4.5» بتقييم 333 زوجًا من روايات الكتابة الإبداعية الخاصة بـ«أوبوس 5» و«أوبوس 5.5» بشكل مجهول الهوية، على مقياس من 5 نقاط، وفقًا لمعايير الأصالة، والعنصر المفاجئ، وتطور الموضوع. وقد صنف البرنامج قصص «أوبوس 5.5» بمتوسط أقل بمقدار 0.75 نقطة في كل فئة. ووفقًا لتصنيف برنامج Haiku، كان Opus 5.5 أكثر ميلًا للكتابة عن موضوعات الأمل، والمرونة، والأسرة، والصداقة مقارنةً بـ Opus 5، وأقل ميلًا للكتابة عن الفناء، والزمن، والسلطة، والسيطرة، والحرية، والعدالة، والانتقام، والذاكرة، والحزن، أو الفقدان. لذا، يبدو أن هناك نوعًا من المقايضة في العمل.

كيف يبدو صوت هذا «كلود»؟

استخدمت النسخة 5.5 من Opus عبارة «باختصار» 100 مرة في إجمالي 1000 رد — بزيادة قدرها 1016% مقارنةً بـ 9 مرات في النسخة 5 من Opus — على الرغم من أن الردود في النسخة 5.5 كانت أقصر بمعدل 2.9 كلمة فقط من تلك في النسخة 5 (643.4 مقابل 640.5 كلمة).

عبارة5 مرات وردت كلمة «Opus»مرات ظهور «Opus 5.5»تغيير
باختصار910011.16×
على سبيل المثال221165.30×
بدأ في22743.38×
في البداية14433.09×
لفترة طويلة19422.22×

انطلاقاً من حجم العينة الصغير جداً، يبدو أن Opus 5.5 يفضل اللغة العملية والواقعية. ويبقى أن نرى ما إذا كان هذا سيتجلى في جوهر الردود، أم أن Opus 5.5 يكتفي بالكلام المجرد عن الصراحة والمباشرة. إن عدم وجود فرق في عدد الكلمات بين الاثنين يجعلني أشك قليلاً في فعالية الأسلوب الذي استخدمه RLHF للوصول بنا إلى هذه النتيجة.

يُفضل «أوبوس 5.5» تقديم الأمثلة بشكل كبير، حيث استخدم كلمة «مثال» 325 مرة في 1000 رد — وبشكل عام، احتوت 20% من جميع ردود «أوبوس 5.5» على هذه الكلمة، مقارنة بـ 9% من ردود «أوبوس 5». كما ظهرت كلمتا «ملخص» و«بشكل أساسي» بنسبة عالية أيضًا. ويُفضل «كلود» هذا تقديم النصائح للمستخدم!

Word5 مرات وردت كلمة «Opus»مرات ظهور «Opus 5.5»تغيير
متوقف مؤقتًا9353.91×
نصائح18583.24×
بشكل أساسي24753.14×
حدق22622.83×
مثال1213252.70×
ملخص601572.63×

ورغم أن أسلوب الكتابة في هذا النموذج يختلف عن نماذج «كلود» السابقة، إلا أنني أتصور — كما هو الحال دائمًا — أنه في غضون 3 إلى 6 أسابيع تقريبًا، ستبدأ عبارات مثل «على سبيل المثال» و«باختصار» في أن تبدو «كلودية» في نظر القارئ اليقظ. لكن من المهم من أجل سهولة الاستخدام أن تتمكن نماذج «كلود» من التواصل بفعالية، وأنا — كأي شخص آخر — ممتن لهذا الجهد. إن تحسين مهارات «كلود» في الكتابة لا يتعارض على الإطلاق مع قدرة «بانغرام» على اكتشاف النصوص التي كتبها الذكاء الاصطناعي!


أناميكا آرتس

أناميكا هي كاتبة تقنية في شركة «بانغرام».

المزيد من أناميكا آرتس

مقالات ذات صلة

ما هو أكثر أدوات الكشف عن الذكاء الاصطناعي دقةً؟ اختبار 30 أداة (2026)
دراسات حالة

ما هو أكثر أدوات الكشف عن الذكاء الاصطناعي دقةً؟ اختبار 30 أداة (2026)

7 يناير 2026
تتزايد نسبة الأوراق البحثية في مؤتمرات الذكاء الاصطناعي التي تُكتب بواسطة الذكاء الاصطناعي: بزيادة قدرها 370% منذ عام 2023
دراسات حالة

تتزايد نسبة الأوراق البحثية في مؤتمرات الذكاء الاصطناعي التي تُكتب بواسطة الذكاء الاصطناعي: بزيادة قدرها 370% منذ عام 2023

30 سبتمبر 2024
أظهرت أداة «بانغرام» عدم وجود أي نتائج إيجابية خاطئة في مجموعة متنوعة من مقالات الطلاب
دراسات حالة

أظهرت أداة «بانغرام» عدم وجود أي نتائج إيجابية خاطئة في مجموعة متنوعة من مقالات الطلاب

19 أغسطس 2026
كيف يقارن موقع Pangram بموقع GPTZero؟
دراسات حالة

كيف يقارن موقع Pangram بموقع GPTZero؟

22 يناير 2026
كيفية التعرف على التعليقات المزيفة باستخدام الذكاء الاصطناعي
دراسات حالة

كيفية التعرف على التعليقات المزيفة باستخدام الذكاء الاصطناعي

5 ديسمبر 2023
أصبحت 3% من التعليقات التي تظهر على الصفحة الرئيسية لموقع أمازون من إنتاج الذكاء الاصطناعي
دراسات حالة

أصبحت 3% من التعليقات التي تظهر على الصفحة الرئيسية لموقع أمازون من إنتاج الذكاء الاصطناعي

4 مايو 2026