دراسات حالة

هل يستطيع برنامج بانغرام اكتشاف سونيتة كلود 5.5؟

28 سبتمبر 2026

إليك ملخص موجز


من بين 1022 سؤالًا، حقق Pangram 4 دقة بنسبة 99.71٪ على مخرجات Claude Sonnet 5.5.

من بين 1022 مطالبة تم الحصول عليها من Chatbot Arena، صنف Pangram 4 اثنين من مخرجات Claude Sonnet 5.5 على أنها مختلطة، وواحد على أنه بشري بالكامل، و1019 على أنها مولدة بالكامل بواسطة الذكاء الاصطناعي، محققًا دقة بنسبة 99.71٪ على Claude Sonnet 5.5.

فيما يلي نناقش النتائج السلبية الخاطئة حسب الفئة.

تم توليد مجموعة البيانات التي استخدمتها للمقارنة المعيارية من مجموعة فرعية مُفلترة من أسئلة المحادثة الأولى في Chatbot Arena من مجموعة بيانات LMSYS (Zheng et al., 2023). وقد استبعدتُ الأسئلة التي تطلب كتابة أكواد، أو مسائل رياضية، أو إجابات قصيرة جدًا أو طويلة جدًا، أو كتابة إبداعية غير مناسبة. ثم أدخلتُ هذه الأسئلة إلى برنامج Claude Sonnet 5.5، وحللتُ الناتج باستخدام برنامج Pangram 4 .

النتائج حسب الفئة

الفئةأمثلةالذكاء الاصطناعيمختلطالبشر
الحجج161600
رسائل البريد الإلكتروني / الرسائل616010
مقالات / مقالات صحفية323200
تفسيرات56356210
القصائد وغيرها من الكتابات الإبداعية19819701
التعليقات8800
قصص14414400
المجموع1,0221,01921

إحدى المحاولات الفاشلة كانت طلبًا لشرح لغز يظهر في رواية إيما لجين أوستن، والذي فات أيضًا Opus 5.5 :

اشرح التمثيلية التي قام بها السيد إلتون لهارييت وإيما.

الخطأ السلبي البشري الوحيد كان في قصيدة. كان السؤال: "أخبرني بقصيدة لحافظ". قدّم سونيت 5.5 ترجمة لقصيدة فارسية شهيرة . الترجمة، على حد علمي، ليست مطابقة تمامًا لأي ترجمة بشرية موجودة، لكنها تتبع الكثير منها بشكل دقيق. وكما هو الحال مع Penguinmandias في معايير أخرى، فإن هذه النسخ شبه الكاملة من القصائد الموجودة لا تُثير قلقي كثيرًا.

الخلاصة

يتميز بانغرام بمقاومته العالية لنموذج كلود سونيت 5.5 عند التعامل مع نصوص اللغة الطبيعية، حيث يكتشفه بدقة تصل إلى 99.71%. ويستطيع بانغرام التعميم على النماذج الجديدة لأن الإصدارات الجديدة تميل إلى استلهام الكثير من أسلوب وصوت النماذج السابقة ، لذا لا يحتاج بانغرام إلى إعادة تدريب مع كل إصدار جديد.

إليكم مقارنة بين Claude Sonnet 5.5 ومعاييرنا الخاصة بنماذج أخرى حديثة رائدة:

نموذجتم اكتشافه كذكاء اصطناعيالدقة
جيميني 3.8 فلاش998/100099.80%
جيميني 3.1 برو997/100099.70%
كلود أوبوس 5.5997/100099.70%
الأسطورة 5.11093/109799.64%
كلود، المقطوعة رقم 51105/110799.82%
GPT-5.63408/342399.56%
كلود سونيت 51145/114799.83%
جيميني 328/28100%

إذا كنت ترغب في التحقق من مستند معين، يمكنك تجربة موقع «بانغرام» هنا.


أناميكا آرتس

أناميكا هي كاتبة تقنية في شركة «بانغرام».

المزيد من أناميكا آرتس

مقالات ذات صلة

67% من مستخدمي المحتوى عبر الإنترنت يكتشفون معلومات مضللة من الذكاء الاصطناعي
دراسات حالة

67% من مستخدمي المحتوى عبر الإنترنت يكتشفون معلومات مضللة من الذكاء الاصطناعي

15 مايو 2026
أظهرت أداة «بانغرام» عدم وجود أي نتائج إيجابية خاطئة في مجموعة متنوعة من مقالات الطلاب
دراسات حالة

أظهرت أداة «بانغرام» عدم وجود أي نتائج إيجابية خاطئة في مجموعة متنوعة من مقالات الطلاب

19 أغسطس 2026
تتوقع Pangram أن 21% من المراجعات في مؤتمر ICLR تم إنشاؤها بواسطة الذكاء الاصطناعي
دراسات حالة

تتوقع Pangram أن 21% من المراجعات في مؤتمر ICLR تم إنشاؤها بواسطة الذكاء الاصطناعي

18 نوفمبر 2025
أصبحت 3% من التعليقات التي تظهر على الصفحة الرئيسية لموقع أمازون من إنتاج الذكاء الاصطناعي
دراسات حالة

أصبحت 3% من التعليقات التي تظهر على الصفحة الرئيسية لموقع أمازون من إنتاج الذكاء الاصطناعي

4 مايو 2026
ما هو أكثر أدوات الكشف عن الذكاء الاصطناعي دقةً؟ اختبار 30 أداة (2026)
دراسات حالة

ما هو أكثر أدوات الكشف عن الذكاء الاصطناعي دقةً؟ اختبار 30 أداة (2026)

7 يناير 2026
الصحفيون يكرهون البيانات الصحفية التي يُنتجها الذكاء الاصطناعي تمامًا مثلنا جميعًا
دراسات حالة

الصحفيون يكرهون البيانات الصحفية التي يُنتجها الذكاء الاصطناعي تمامًا مثلنا جميعًا

23 سبتمبر 2026