تقييم دقة كاشف الصور المدعوم بالذكاء الاصطناعي لتسريبات النسخ
منهجية خطوة بخطوة
نؤمن بأهمية الشفافية الكاملة بشأن دقة كاشف الصور المدعوم بالذكاء الاصطناعي، بما في ذلك معدلات النتائج الإيجابية والسلبية الخاطئة، بالإضافة إلى المجالات التي تحتاج إلى تحسين، لضمان الاستخدام المسؤول والتبني الأمثل. يهدف هذا التحليل الشامل إلى توفير شفافية كاملة حول منهجية اختبار نموذج كاشف الصور المدعوم بالذكاء الاصطناعي الإصدار 1.1.
صُمم نموذجنا للكشف عن الأجزاء المُعدّلة بواسطة الذكاء الاصطناعي في الصور، وذلك من خلال إنشاء طبقة فوقية للمناطق المكتشفة. وقد أثبتت الاختبارات أن كاشف الصور المدعوم بالذكاء الاصطناعي يحقق دقة عالية في التمييز بين الصور البشرية الحقيقية والصور المُولّدة أو المُعدّلة بواسطة الذكاء الاصطناعي، مع الحفاظ على معدل منخفض للغاية للنتائج الإيجابية الخاطئة.
تاريخ الاختبار: 1 فبراير 2026
تاريخ النشر: 15 فبراير 2026
النموذج الذي تم اختباره: الإصدار 1.1
المنهجية
باستخدام نظام فريقين، صممنا عملية التقييم لدينا لضمان أعلى مستويات الجودة والمعايير والموثوقية. لدينا قسمان مستقلان لتقييم النموذج: فريق علوم البيانات وفريق ضمان الجودة. يعمل كل فريق بشكل مستقل باستخدام بيانات وأدوات التقييم الخاصة به، ولا يطلع على عملية تقييم الفريق الآخر. يضمن هذا الفصل أن تكون نتائج التقييم غير متحيزة وموضوعية ودقيقة. من المهم أيضًا ملاحظة أن جميع بيانات الاختبار منفصلة تمامًا عن بيانات التدريب؛ فنحن نختبر نماذجنا فقط على صور جديدة لم يسبق لها التفاعل مع كاشف الصور المدعوم بالذكاء الاصطناعي. ولضمان بقاء اختباراتنا ذات صلة وتحدّي، نقوم بتحديث مجموعات بيانات التقييم باستمرار لتشمل الصور التي تم إنشاؤها بواسطة أحدث نماذج الذكاء الاصطناعي العام.
بناء مجموعات الاختبار
مع كل إصدار جديد، يقوم فريقا ضمان الجودة وعلوم البيانات في Copyleaks بشكل مستقل بجمع وإنشاء مجموعة متنوعة من مجموعات بيانات الاختبار. تتكون كل مجموعة بيانات من عدد محدود من الصور مع تصنيف متوقع يشير إلى مصدرها. تُقسم مجموعات البيانات إلى فئتين:
- صور بشرية بالكامل: صور أصلية تم التقاطها بواسطة كاميرا ولم يتم تعديلها بواسطة الذكاء الاصطناعي التوليدي. تم جمع هذه الصور من مجموعات بيانات تم التحقق منها أو تم إنشاؤها يدويًا.
- الذكاء الاصطناعي الكامل: صور تم إنشاؤها بالكامل بواسطة أحدث نماذج الذكاء الاصطناعي.
تم إنشاء الصور المولدة بواسطة الذكاء الاصطناعي باستخدام مجموعة متنوعة من نماذج الذكاء الاصطناعي التوليدية. أُجريت الاختبارات على واجهة برمجة تطبيقات Copyleaks، وقمنا بتجميع النتائج لحساب أداء النموذج.
تم إجراء التقييم حصريًا على الصور التي تستوفي هذه المتطلبات الفنية: الحد الأدنى للأبعاد 512 × 512 بكسل، وحجم الملف أقل من 32 ميجابايت، والدقة أقل من 16 ميجابكسل، كما هو محدد في الوثائق.
معايير التقييم
يقدم المنتج تنبؤًا على شكل طبقة فوقية للأجزاء التي تم إنشاؤها بواسطة الذكاء الاصطناعي. ثم يتم تقييم الأداء العام بناءً على مدى دقة النموذج في تصنيف الصور، وفقًا لفئتها الحقيقية.
مقاييس الأداء حسب نوع الصورة
ولتوفير مقياس واضح ودقيق للدقة، نستخدم مقاييس مختلفة على مستوى البكسل اعتمادًا على نوع الصورة التي يتم اختبارها:
- بالنسبة للصور البشرية: المقياس الرئيسي هو معدل النتائج الإيجابية الخاطئة على مستوى البكسل . لكي تُعتبر الصورة ناجحة في الكشف (سلبية حقيقية)، يجب ألا تتجاوز نسبة البكسلات المصنفة خطأً على أنها "ذكاء اصطناعي" 5% . يضمن هذا الحد الصارم تجنب النموذج اتهام الصور الحقيقية زوراً.
- بالنسبة لصور الذكاء الاصطناعي: المقياس الأساسي هو معدل الإيجابية الحقيقية على مستوى البكسل. لكي تُعتبر الصورة ناجحة في الكشف (إيجابية حقيقية)، يجب أن تتجاوز نسبة البكسلات المصنفة بشكل صحيح على أنها "ذكاء اصطناعي" 95% . هذا يضمن قدرة النموذج على التعرف على المحتوى المُنشأ بالكامل بشكل شامل.
مقاييس التقارير المجمعة
The overall accuracy figures presented in the Results tables, such as TNR (Human Accuracy) and TPR (AI), are aggregated from these pixel-level success criteria. For example, the TNR is the percentage of all tested human images that successfully met the <5% false positive pixel threshold.
نتائج
اختبار فريق علوم البيانات
أجرى فريق علوم البيانات الاختبار المستقل التالي على مجموعة بيانات كبيرة ومتنوعة تحتوي على صور ذات دقة متفاوتة، وأجهزة التقاط، ومولدات صور، وأنواع محتوى.
| اسم مجموعة البيانات | صور بشرية (عددها 31374) | صور الذكاء الاصطناعي (عددها 33947) |
|---|---|---|
| دقة | 98.6% | 97.6% |
اختبار فريق ضمان الجودة
أجرى فريق ضمان الجودة اختبارًا مستقلًا باستخدام صور تم إنشاؤها خصيصًا للتقييم بعد تدريب النموذج. تتضمن مجموعة بيانات الاختبار صورًا بدقة متفاوتة، تم التقاطها بواسطة أجهزة مختلفة، وتم إنشاؤها بواسطة مولدات صور متنوعة، وتتميز بأنواع محتوى مختلفة.
| اسم مجموعة البيانات | صور بشرية (عددها 10000) | صور الذكاء الاصطناعي (عددها 10000) |
|---|---|---|
| دقة | 99.3% | 98% |
تحليل الأخطاء
خلال عملية التقييم، نحدد ونحلل التقييمات غير الصحيحة لتمكين فريق علوم البيانات من تصحيح الأسباب الجذرية. تُسجل جميع الأخطاء وتُصنف بشكل منهجي بناءً على طبيعتها وخصائصها في "عملية تحليل الأسباب الجذرية". تهدف هذه العملية إلى فهم الأسباب الكامنة وراء الأخطاء وتحديد الأنماط المتكررة، مما يضمن التحسين المستمر وقابلية نموذجنا للتكيف. تُستخدم هذه الرؤى لتحسين الإصدارات المستقبلية من النموذج.
القيود
على الرغم من أن نموذجنا يحقق نتائج متطورة، إلا أنه لا يوجد نظام كشف مثالي، ويمكن لنموذجنا أن يرتكب أخطاء، مثل تصنيف مجموعة بكسل معينة بشكل خاطئ.
تم تدريب كاشف الصور المدعوم بالذكاء الاصطناعي خصيصًا لتحديد التعديلات التي تُجرى باستخدام أحدث أدوات الذكاء الاصطناعي التوليدية . ولا يكتشف النظام حاليًا التعديلات الشائعة الأخرى على الصور، بما في ذلك:
- التعديلات اليدوية: التغييرات التي يجريها شخص باستخدام برامج تحرير الصور التقليدية مثل برنامج فوتوشوب.
- الصور المجمعة: صور تم إنشاؤها عن طريق دمج أجزاء من صور أصلية مختلفة.
- الفلاتر والتعديلات البسيطة: تطبيق التأثيرات الفوتوغرافية (مثل "العتيق"، الأبيض والأسود) أو التعديلات الأساسية (مثل التوضيح، والتشويش، والقص).