تؤكد التقييمات المستقلة التي تجريها جهات خارجية باستمرار أرقام الدقة الداخلية التي توصلت إليها «بانغرام» — وفيما يلي ملخص للأدلة الخارجية.
نعتقد أنه من المهم أن تتمكن المؤسسات من الاعتماد على الدقة العالية التي تتميز بها Pangram، ولذلك نشجع إجراء عمليات تحقق من قبل أطراف ثالثة لمقاييس الجودة الخاصة بنا (النتائج الإيجابية الخاطئة والنتائج السلبية الخاطئة). وفيما يلي، سنسلط الضوء على تقييمات Pangram التي أجراها باحثون من جامعة شيكاغو (UChicago) وجامعة ماريلاند (UMD) ومراجعون من القطاع التجاري.
النقطة الأساسية: تخضع الاختبارات الداخلية التي تجريها Pangram للتدقيق من قبل جهات خارجية.
في ورقة بحثية خضعت لمراجعة الأقران ونُشرت في يونيو 2026، قامت مجموعة من الباحثين في جامعة فريجي في بروكسل باختبار أربع أدوات للكشف عن المحتوى المُنتج بالذكاء الاصطناعي – وهي Pangram وGPTZero وTurnitin وCopyleaks – على 160 ورقة أكاديمية يزيد عدد كلمات كل منها عن 4000 كلمة. كانت مجموعة البيانات مكتوبة باللغة الإنجليزية، ومقسمة بالتساوي بين نصوص كتبها طلاب اللغة الإنجليزية كلغة ثانية (ESL) بنفسيهم، ونصوص أنشأها الذكاء الاصطناعي، ونصوص هجينة (مزيج من النصوص البشرية ونصوص الذكاء الاصطناعي)، ونصوص الذكاء الاصطناعي المُعدلة لتبدو كأنها مكتوبة بواسطة البشر.
ووجد الباحثون أن «بانغرام» كانت الأداة الوحيدة القادرة على الكشف عن المحتوى الذي أنتجته الذكاء الاصطناعي بشكل موثوق: «من بين أدوات الكشف عن المحتوى الذي أنتجته الذكاء الاصطناعي الأربع التي تمت دراستها هنا، لم تحقق في الوقت الحالي سوى [بانغرام] نتائج مرضية».
كان «بانغرام» الأداة الوحيدة التي تمكنت بشكل موثوق من الكشف عن كل من الأوراق البحثية المكتوبة بالكامل بواسطة الذكاء الاصطناعي وتلك التي تم «إضفاء طابع بشري» عليها (بنسبة 97.5% و95% على التوالي). أما بالنسبة لمجموعة الأوراق التي تم إنشاؤها بالكامل بواسطة الذكاء الاصطناعي، فلم تكتشف الأدوات الثلاث الأخرى أي منها عمليًّا، حيث سجلت جميعها نسبة 0%. ولم تتمكن أي أداة كشف أخرى غير «بانغرام» من التعامل بشكل موثوق مع النصوص التي تم «إضفاء طابع بشري» عليها، على الرغم من أن «تورنتيتين» تمكنت من الكشف عن حوالي نصفها، و«كوبيليكس» عن ربعها.
| أداة | معدل الكشف (بالاعتماد الكامل على الذكاء الاصطناعي) | معدل الكشف (الهجين) | معدل الكشف (المُحسَّن) | معدل النتائج الإيجابية الخاطئة |
|---|---|---|---|---|
| جملة شاملة | 97.5% | 95% | 95% | 0% |
| Turnitin | 0% | 60% | 52.5% | 0% |
| Copyleaks | 0% | 32.5% | 25% | 0% |
| GPTZero | 0% | 0% | 2.5% | انحراف إيجابي طفيف (الأداة الوحيدة التي لا تقع عند الصفر في النص البشري) |
وقد أظهرت أبحاث سابقة أن أدوات الكشف الأخرى أعطت نتائج إيجابية خاطئة بالنسبة للكتاب الذين يستخدمون اللغة الإنجليزية كلغة ثانية، لكن هذه الدراسة المستقلة تشير إلى أن «بانغرام» لا تتسم بتحيز كبير ضد النصوص المكتوبة باللغة الإنجليزية كلغة ثانية.
في معهد بيكر فريدمان للاقتصاد التابع لجامعة شيكاغو، قارن الباحثون بين أربعة أدوات للكشف عن النصوص المولدة بالذكاء الاصطناعي: Pangram و GPTZero و Originality AI و RoBERTa (أداة مفتوحة المصدر للكشف عن النصوص المولدة بالذكاء الاصطناعي). استخدمت الدراسة كل أداة من هذه الأدوات لتحليل 1,992 نصًا من تأليف البشر كُتبت قبل عام 2020 و 1,992 نصًا مولدًا بالذكاء الاصطناعي، وذلك عبر أنواع أدبية مختلفة وعدد كلمات متنوع. وقد درسوا نوعين من الأخطاء في الكشف عن الذكاء الاصطناعي: معدلات الإيجابية الكاذبة ومعدلات السلبية الكاذبة. وتم مقارنة هذه المعدلات لعدة عتبات. كما صنفت أجهزة الكشف النصوص التي تم إنشاؤها بواسطة الذكاء الاصطناعي من نماذج اللغة الكبيرة (LLMs) الشهيرة مثل ChatGPT وClaude وGemini. وأنشأ الباحثون عدة حدود قصوى لسياسة معدلات الإيجابية الكاذبة (FPR) بين أجهزة الكشف لملاحظة التغيرات في معدلات السلبية الكاذبة (FNR).
من الدراسة المعنونة «الكتابة المزيفة والكشف الآلي » التي أعدها براين جاباريان وأليكس إيماس في أغسطس 2025:
يتفوق برنامج Pangram على برامج الكشف الأخرى في جميع مستويات الحساسية.
يُعد «بانجرام» الكاشف الوحيد الذي يفي بمعايير سياسة صارمة (معدل الإشارة الخاطئة FPR ≤ 0.005) دون المساس بقدرته على الكشف الدقيق عن النصوص المُنتجة بواسطة الذكاء الاصطناعي.
لا تزال Pangram هي الرائدة من حيث التكلفة المنخفضة في جميع الأنواع، حيث يبلغ متوسط التكلفة 0.0228 دولارًا أمريكيًا لكل مقطع تم الكشف عنه بشكل صحيح بواسطة الذكاء الاصطناعي، مقارنة بـ 0.0416 دولارًا أمريكيًا لـ OriginalityAI و 0.0575 دولارًا أمريكيًا لـ GPTZero، مما يجعل Pangram أداة الكشف الأكثر فعالية من حيث التكلفة لكل من المقاطع الكاملة والمقاطع المختصرة.
أظهرت الدراسة ما يلي:
يحقق نظام Pangram معدلات "إيجابية كاذبة" و"سلبية كاذبة" تقترب من الصفر في المقاطع النصية المتوسطة الطول إلى الطويلة.
وقد حظيت دقة نظام "بانغرام" بإشادة واسعة النطاق عبر أنواع مختلفة من النصوص، مثل: المدونات، والمراجعات، والسير الذاتية، والأخبار، والروايات. وفي النصوص القصيرة، ترتفع معدلات "النتائج الإيجابية الخاطئة" و"النتائج السلبية الخاطئة" بشكل طفيف، "لكنها تظل أقل بكثير من الحدود المعقولة المحددة في السياسة".
متوسط معدل الإيجابيات الكاذبة (تصنيف النص البشري على أنه نص مُنتج بالذكاء الاصطناعي) ومعدل السلبيات الكاذبة (عدم اكتشاف النص المُنتج بالذكاء الاصطناعي) لكل كاشف، عبر الأنواع الستة ونماذج اللغة الكبيرة الأربعة. كلما انخفضت القيم، كان ذلك أفضل في كلا الحالتين.
| أداة | معدل النتائج الإيجابية الخاطئة | معدل النتائج السلبية الكاذبة | هل برنامج «Humanizer» متوافق مع StealthGPT؟ |
|---|---|---|---|
| جملة شاملة | 0.001 | 0.01 | نعم (نسبة الكشف تقترب من 100٪) |
| Originality.ai | 0.002 | 0.035 | جزئيًا (تصل نسبة FNR إلى 0.21 في النصوص القصيرة) |
| GPTZero | 0.007 | 0.06 | لا (FNR 0.50+) |
| RoBERTa (مفتوح المصدر) | 0.50 | غير موثوق (يصنف معظم النصوص على أنها من إنتاج الذكاء الاصطناعي) | غير متوفر (غير مناسب) |
لم يعد برنامج «بانجرام» يقدم تنبؤات للنصوص التي تقل عن 50 كلمة، ولكن كما ورد في الدراسة،
Pangram’s performance largely holds up on very short passages (< 50 words) and is robust to “humanizer” tools (e.g., StealthGPT), the performance of other detectors becomes case-dependent.
في التجربة الأولى من هذه الدراسة التي أجرتها جامعة ماريلاند، تم الاستعانة بمُصنِّفين يتمتعون بمستويات متنوعة من المعرفة في مجال النماذج اللغوية الكبيرة (LLM) للتنبؤ بما إذا كان النص قد تم إنشاؤه بواسطة الذكاء الاصطناعي أم لا. وبعد ملاحظة أن أحد المُعلّقين كان شبه مثالي في تحديد النصوص التي تم إنشاؤها بواسطة الذكاء الاصطناعي، تم الاستعانة بأربعة مُعلّقين خبراء إضافيين من ذوي الخلفيات المماثلة في استخدام نماذج اللغة الكبيرة لتصنيف نفس العينة المكونة من 60 نصًا. تمت مقارنة نتائج تصويت الخبراء مع أدوات الكشف التجارية مثل Pangram وPangram Humanizer وGPTZero، بالإضافة إلى أدوات مفتوحة المصدر مثل Fast-DetectGPT. خلال هذه العملية، تمت مقارنة Pangram بأدوات الكشف الأخرى.
نسبة المقالات المتعلقة بالذكاء الاصطناعي التي تم اكتشافها (TPR) ومعدل الإيجابيات الكاذبة في جميع الشروط، بالإضافة إلى أصعب شرط — النص o1-pro المُعدّل ليشبه أسلوب البشر. ولم يواكب الخبراء البشريين سوى نموذج «بانغرام».
| جهاز الكشف | معدل الكشف الإجمالي (TPR) | معدل النتائج الإيجابية الخاطئة | الكشف في النصوص المُصاغة بأسلوب بشري |
|---|---|---|---|
| خبراء من البشر (التصويت بالأغلبية) | 99.3% | 0% | 100% |
| مُنسِّقو «بانغرام» | 99.3% | 2.7% | 96.7% |
| بانغرام (أساسي) | 98.0% | 2% | 90.0% |
| GPTZero | 85.3% | 0.7% | 46.7% |
| Fast-DetectGPT | 80.0% | 7.2% | 23.3% |
| منظار ثنائي العينين (وضع الدقة) | 66.7% | 1.3% | 6.7% |
| RADAR | 15.3% | 2% | 0% |
يمكن لبرنامج «بانجرام» الكشف بدقة عن النصوص التي تم «إضفاء الطابع البشري» عليها بواسطة الذكاء الاصطناعي. وقد أكد ذلك علماء الكمبيوتر في جامعة ماريلاند، الذين لاحظوا أن «بانجرام» سجل أعلى معدل إجمالي في الكشف عن النصوص التي خضعت لعملية «إضفاء الطابع البشري» والنصوص المعاد صياغتها، متفوقًا على برامج الكشف الأخرى المعتمدة على الذكاء الاصطناعي بدقة بلغت 99.3%.
تعرف على المزيد حول كيفية مقارنة Pangram ببرامج "humanizers"
ذكرت أماندا كاسويل في موقع «تومز جايد» في مقال لها أنه بعد تجربة العشرات من أدوات الكشف عن المحتوى المولد بالذكاء الاصطناعي، «تفوقت Pangram على غيرها من الأدوات التي جربتها». كما تبين أن Pangram تعمل بجد على تقليل حالات الإيجابيات الخاطئة، التي هي منخفضة بالفعل.
يصف ديفيد جويرتز من ZDNET برنامج Pangram بأنه «وافد جديد على اختباراتنا، لكنه انطلق على الفور إلى مصاف الفائزين».
ونظراً لتزايد استخدام الذكاء الاصطناعي في الأوراق البحثية، هناك مخاوف من أن يكون ذلك مؤشراً على سوء السلوك. استخدم آدم داي في مقاله على منصة Medium أداة الكشف عن الذكاء الاصطناعي من Pangram للحصول على نتائج موثوقة حول انتشار محتوى الذكاء الاصطناعي، بينما خلص أيضًا إلى أن هناك حالات استخدام مشروعة للذكاء الاصطناعي التوليدي في الأبحاث. يوصي داي باستخدام Pangram لإجراء الأبحاث، قائلاً: "إذا أراد شخص ما إجراء دراسة استقصائية حول استخدام الذكاء الاصطناعي التوليدي في الأدبيات المنشورة، أعتقد أن هناك فرصة رائعة للقيام بذلك باستخدام أدوات Pangram."
نحن في Pangram نؤمن بأن الشفافية أمر أساسي لبناء الثقة. ونحن نتطلع إلى التعاون معكم لتوفير الشفافية في مجال الذكاء الاصطناعي لمؤسستكم.

ديستيني هي محللة أبحاث متدربة في شركة بانغرام. وهي أيضًا طالبة في كلية نيويورك للتكنولوجيا، حيث تدرس الرياضيات التطبيقية والكيمياء. وقد ساهم عمل ديستيني في بانغرام بشكل كبير في التحقيق في الأخطاء التي ترتكبها أنظمة الذكاء الاصطناعي على الإنترنت. وخارج نطاق العمل والدراسة، تهوى ديستيني الكتابة الإبداعية وأدب الرعب الخيالي.






