خاصية الكشف عن الفيديو بالذكاء الاصطناعي متاحة الآن

احصل على عرض توضيحي
مورد

تقييم دقة كاشف تسريبات النسخ المدعوم بالذكاء الاصطناعي

منهجية خطوة بخطوة

نؤمن بأهمية الشفافية الكاملة بشأن دقة كاشف الذكاء الاصطناعي، ومعدلات النتائج الإيجابية والسلبية الخاطئة، ومجالات التحسين، وغيرها، لضمان الاستخدام والتبني المسؤولين. يهدف هذا التحليل الشامل إلى ضمان الشفافية الكاملة حول منهجية اختبار نموذج V10 لكاشف الذكاء الاصطناعي.

تاريخ الاختبار: 16 أكتوبر 2025

تاريخ النشر: 12 نوفمبر 2025

النموذج الذي تم اختباره: V10

المنهجية

أجرى فريقا علوم البيانات وضمان الجودة في Copyleaks اختبارات مستقلة لضمان نتائج دقيقة وغير متحيزة. اختلفت بيانات الاختبار عن بيانات التدريب، ولم تتضمن أي محتوى سبق تقديمه إلى كاشف الذكاء الاصطناعي للكشف عنه.

تضمنت بيانات الاختبار نصوصًا مكتوبة يدويًا مأخوذة من مجموعات بيانات موثقة، ونصوصًا مولدة بواسطة الذكاء الاصطناعي من نماذج ذكاء اصطناعي متنوعة. أُجري الاختبار باستخدام واجهة برمجة تطبيقات Copyleaks.

المقاييس

تشمل المقاييس الدقة الإجمالية، بناءً على معدل تحديد النصوص الصحيح والخاطئ، ومساحة المنطقة تحت منحنى ROC (منحنى خصائص التشغيل للمستقبل)، الذي يفحص معدلات الإيجابية الحقيقية (TPR) ومعدلات الإيجابية الكاذبة (FPR). وتشمل المقاييس الإضافية درجة F1، ومعدل السلبية الحقيقية (TNR)، ومصفوفات الارتباك.

نتائج

تؤكد الاختبارات أن كاشف الذكاء الاصطناعي يُظهر دقة عالية في التمييز بين النصوص المكتوبة بواسطة الإنسان والنصوص التي أنشأها الذكاء الاصطناعي مع الحفاظ على معدل منخفض للنتائج الإيجابية الخاطئة.

عملية التقييم

باستخدام نظام ثنائي الأقسام، صممنا عملية التقييم لدينا لضمان أعلى مستويات الجودة والمعايير والموثوقية. لدينا قسمان مستقلان لتقييم النموذج: قسم علوم البيانات وقسم ضمان الجودة. يعمل كل قسم بشكل مستقل باستخدام بيانات وأدوات التقييم الخاصة به، ولا يطلع على عملية التقييم الخاصة بالقسم الآخر. يضمن هذا الفصل أن تكون نتائج التقييم غير متحيزة وموضوعية ودقيقة، مع مراعاة جميع جوانب أداء النموذج. ومن الجدير بالذكر أيضًا أن بيانات الاختبار منفصلة عن بيانات التدريب، ولا نختبر نماذجنا إلا على بيانات جديدة لم يسبق لها استخدامها.

المنهجية

قام فريقا ضمان الجودة وعلوم البيانات في Copyleaks بجمع مجموعات بيانات اختبارية متنوعة بشكل مستقل. تتكون كل مجموعة بيانات اختبارية من عدد محدود من النصوص. ويتم تحديد التصنيف المتوقع - وهو مؤشر يشير إلى ما إذا كان نص معين قد كُتب بواسطة إنسان أو بواسطة الذكاء الاصطناعي - لكل مجموعة بيانات بناءً على مصدر البيانات. جُمعت النصوص البشرية من نصوص نُشرت قبل ظهور أنظمة الذكاء الاصطناعي التوليدية الحديثة أو لاحقًا من مصادر موثوقة أخرى تم التحقق منها مرة أخرى من قبل الفريق. أما النصوص المولدة بواسطة الذكاء الاصطناعي فقد تم إنشاؤها باستخدام مجموعة متنوعة من نماذج وتقنيات الذكاء الاصطناعي التوليدية.

أُجريت الاختبارات على واجهة برمجة تطبيقات Copyleaks. تحققنا مما إذا كانت مخرجات واجهة برمجة التطبيقات صحيحة لكل نص بناءً على التصنيف المستهدف، ثم جمعنا النتائج لحساب مصفوفة الارتباك.

النتائج: فريق علوم البيانات

أجرى فريق علوم البيانات الاختبار المستقل التالي:

  • كانت لغة النصوص هي الإنجليزية، وتم اختبار 300,000 نص مكتوب بشريًا و200,000 نص تم إنشاؤه بواسطة الذكاء الاصطناعي من مختلف برامج الماجستير في القانون بشكل إجمالي.
  • تختلف أطوال النصوص، لكن مجموعات البيانات لا تحتوي إلا على نصوص يزيد طولها عن 350 حرفًا - وهو الحد الأدنى الذي يقبله منتجنا.

معايير التقييم

المقاييس المستخدمة في مهمة تصنيف النصوص هذه هي:

1. مصفوفة الارتباك: جدول يوضح TP (الإيجابيات الحقيقية)، FP (الإيجابيات الكاذبة)، TN (السلبيات الحقيقية) و FN (السلبيات الكاذبة).

2. الدقة: نسبة النتائج الصحيحة (الإيجابيات الصحيحة والسلبيات الصحيحة) من بين إجمالي عدد النصوص التي تم فحصها.

3. معدل السلبية الحقيقية (TNR): نسبة الحالات السلبية الفعلية التي تمثل جميع التنبؤات السلبية .

في سياق الكشف باستخدام الذكاء الاصطناعي، فإن TNR هو دقة النموذج في التعامل مع النصوص البشرية.

4. (TPR) المعروف أيضًا باسم الاستدعاء: نسبة النتائج الإيجابية الحقيقية في جميع التنبؤات الفعلية.

في سياق الكشف باستخدام الذكاء الاصطناعي، فإن TPR هو دقة النموذج في التعامل مع النصوص التي تم إنشاؤها بواسطة الذكاء الاصطناعي.

5. درجة F-beta: المتوسط التوافقي المرجح بين الدقة والاستدعاء، مع تفضيل الدقة أكثر (لأننا نريد تفضيل معدل إيجابي خاطئ أقل).

مجموعات بيانات الذكاء الاصطناعي والبيانات البشرية المدمجة

اسم مجموعة البياناتعدد النصوصعدد النصوص البشريةعدد النصوص التي تم الحصول عليها بواسطة الذكاء الاصطناعيTPRبرنامج التعقيم والإخصاء وإعادة التعقيمF-beta(0.5)
مجموعات بيانات داخلية شديدة الصعوبة، بما في ذلك الهجمات المعادية والأدوات الخاصة500,000300,000200,0000.9880.9990.997

النتائج: فريق ضمان الجودة

أجرى فريق ضمان الجودة الاختبار المستقل التالي:

  • كانت لغة النصوص هي الإنجليزية، وتم اختبار 229843 نصًا مكتوبًا بواسطة البشر و18712 نصًا تم إنشاؤها بواسطة الذكاء الاصطناعي من مختلف برامج الماجستير في القانون بشكل إجمالي.
  • تختلف أطوال النصوص، لكن مجموعات البيانات لا تحتوي إلا على نصوص يزيد طولها عن 350 حرفًا - وهو الحد الأدنى الذي يقبله منتجنا.

مجموعات البيانات البشرية فقط

اسم مجموعة البياناتعدد النصوصتم التعرف عليه بشكل صحيح على أنه إنسانتم التعرف عليه بشكل خاطئ على أنه ذكاء اصطناعيدقة
نصوص عامة9,9799,97901
مقالات، أخبار، مدونات، منشورات على مواقع التواصل الاجتماعي9,9919,98290.9991
مجموعة بيانات صفحات الويب على الإنترنت99,92199,91830.9999
مقالات الطلاب10,0009,99820.9998
أوراق بحثية99,95299,906460.9995
المجموع:229,843229,783600.9997

مجموعات البيانات الخاصة بالذكاء الاصطناعي فقط

اسم مجموعة البياناتعدد النصوصتم التعرف عليه بشكل خاطئ على أنه إنسانتم التعرف عليه بشكل صحيح على أنه ذكاء اصطناعيدقة
نماذج عائلة OpenAI - نماذج أخرى12,88012912,7510.9899
GPT-51,207111,1960.9909
نماذج عائلة الجوزاء1,97871,9710.9964
نماذج عائلة كلود1,07211,0710.9991
نماذج عائلة جروك1,57501,5751
المجموع:18,71214818,5640.992

*قد تتغير إصدارات النماذج بمرور الوقت. تم إنشاء النصوص باستخدام الإصدارات الحالية المتاحة من النماذج من شركات الذكاء الاصطناعي التوليدي المذكورة أعلاه.

مستويات الحساسية

منذ الإصدار 7.1، أصبح لدينا ثلاثة مستويات حساسية لنموذج الكشف بالذكاء الاصطناعي. إليكم نتائج اختبار مستويات الحساسية للنموذج في الإصدار 10.

بطاقة تعريفحساسيةتعريفالنتائج الإيجابية الخاطئةالنتائج السلبية الكاذبة
1أمان إضافيصُممت هذه الطريقة لتقليل النتائج الإيجابية الخاطئة باستخدام مرشحات إضافية تعتمد على تقنية الكشف بالذكاء الاصطناعي.

جيد لاكتشاف النصوص التي تم إنشاؤها بواسطة الذكاء الاصطناعي دون أي تعديل بشري يُذكر.
0.009%1.36%
2متوازن (افتراضي -
هذه هي النسخة
ذلك موضح في
النتائج المذكورة أعلاه)
مثالي لاكتشاف محتوى الذكاء الاصطناعي مع تقليل النتائج الإيجابية الخاطئة.

جيد في اكتشاف النصوص التي تم إنشاؤها بواسطة الذكاء الاصطناعي والتي تحتوي على قدر معتدل من التعديل البشري.
0.026%0.79%
3حساسية فائقةتم تصميم نموذجنا الأكثر حساسية لتحديد نص الذكاء الاصطناعي الذي تم وضعه من خلال "مُحَوِّل النص إلى نص بشري" أو مُعَدِّل للنصوص.0.05%0.53%

دقة النتائج الإيجابية الصحيحة (نصوص الذكاء الاصطناعي) والنتائج السلبية الصحيحة (نصوص بشرية) حسب مستوى الحساسية

الإيجابيات الحقيقيةالسلبيات الحقيقية
98.64%
99.99%
الحد الأدنى من النتائج الإيجابية الخاطئة (الحساسية 1)
99.21%
99.97%
متوازن (الحساسية 2)
99.47%
99.95%
شديد الحساسية (الحساسية 3)
حساسية

تحليل الأخطاء النصية بواسطة الإنسان والذكاء الاصطناعي

خلال عملية التقييم، حددنا وحللنا التقييمات غير الصحيحة التي أصدرها النموذج، وأعددنا تقريرًا مفصلًا يمكّن فريق علوم البيانات من تصحيح الأسباب الجذرية. ويتم ذلك دون الكشف عن هذه التقييمات الخاطئة لفريق علوم البيانات. تُسجّل جميع الأخطاء وتُصنّف بشكل منهجي بناءً على طبيعتها وخصائصها في "عملية تحليل الأسباب الجذرية"، التي تهدف إلى فهم الأسباب الكامنة وتحديد الأنماط المتكررة. هذه العملية مستمرة دائمًا، مما يضمن التحسين المستمر لنموذجنا وقابليته للتكيف مع مرور الوقت.

من الأمثلة على هذا النوع من الاختبارات تحليلنا لبيانات الإنترنت للفترة من 2013 إلى 2024 باستخدام نموذجنا V4. أخذنا عينة من مليون نص من كل عام، بدءًا من عام 2013، مستخدمين أي نتائج إيجابية خاطئة تم رصدها بين عامي 2013 و2020، قبل إطلاق أنظمة الذكاء الاصطناعي، وذلك للمساعدة في تحسين النموذج بشكل أكبر.

02013
22014
32015
12016
02017
22018
12019
22020
342021
482022
5792023
15,1012024
سنة

على غرار ما يفعله الباحثون حول العالم ويستمرون في اختبار منصات الكشف بالذكاء الاصطناعي المختلفة لتقييم قدراتها وحدودها، فإننا نشجع مستخدمينا بشدة على إجراء اختبارات عملية. ومع إصدار نماذج جديدة، سنواصل مشاركة منهجيات الاختبار ودقة النتائج وغيرها من الاعتبارات المهمة التي يجب مراعاتها.