تقييم دقة كاشف تسريبات النسخ المدعوم بالذكاء الاصطناعي
منهجية خطوة بخطوة
نؤمن بأهمية الشفافية الكاملة بشأن دقة كاشف الذكاء الاصطناعي، ومعدلات النتائج الإيجابية والسلبية الخاطئة، ومجالات التحسين، وغيرها، لضمان الاستخدام والتبني المسؤولين. يهدف هذا التحليل الشامل إلى ضمان الشفافية الكاملة حول منهجية اختبار نموذج V10 لكاشف الذكاء الاصطناعي.
تاريخ الاختبار: 16 أكتوبر 2025
تاريخ النشر: 12 نوفمبر 2025
النموذج الذي تم اختباره: V10
عملية التقييم
باستخدام نظام ثنائي الأقسام، صممنا عملية التقييم لدينا لضمان أعلى مستويات الجودة والمعايير والموثوقية. لدينا قسمان مستقلان لتقييم النموذج: قسم علوم البيانات وقسم ضمان الجودة. يعمل كل قسم بشكل مستقل باستخدام بيانات وأدوات التقييم الخاصة به، ولا يطلع على عملية التقييم الخاصة بالقسم الآخر. يضمن هذا الفصل أن تكون نتائج التقييم غير متحيزة وموضوعية ودقيقة، مع مراعاة جميع جوانب أداء النموذج. ومن الجدير بالذكر أيضًا أن بيانات الاختبار منفصلة عن بيانات التدريب، ولا نختبر نماذجنا إلا على بيانات جديدة لم يسبق لها استخدامها.
المنهجية
قام فريقا ضمان الجودة وعلوم البيانات في Copyleaks بجمع مجموعات بيانات اختبارية متنوعة بشكل مستقل. تتكون كل مجموعة بيانات اختبارية من عدد محدود من النصوص. ويتم تحديد التصنيف المتوقع - وهو مؤشر يشير إلى ما إذا كان نص معين قد كُتب بواسطة إنسان أو بواسطة الذكاء الاصطناعي - لكل مجموعة بيانات بناءً على مصدر البيانات. جُمعت النصوص البشرية من نصوص نُشرت قبل ظهور أنظمة الذكاء الاصطناعي التوليدية الحديثة أو لاحقًا من مصادر موثوقة أخرى تم التحقق منها مرة أخرى من قبل الفريق. أما النصوص المولدة بواسطة الذكاء الاصطناعي فقد تم إنشاؤها باستخدام مجموعة متنوعة من نماذج وتقنيات الذكاء الاصطناعي التوليدية.
أُجريت الاختبارات على واجهة برمجة تطبيقات Copyleaks. تحققنا مما إذا كانت مخرجات واجهة برمجة التطبيقات صحيحة لكل نص بناءً على التصنيف المستهدف، ثم جمعنا النتائج لحساب مصفوفة الارتباك.
النتائج: فريق علوم البيانات
أجرى فريق علوم البيانات الاختبار المستقل التالي:
- كانت لغة النصوص هي الإنجليزية، وتم اختبار 300,000 نص مكتوب بشريًا و200,000 نص تم إنشاؤه بواسطة الذكاء الاصطناعي من مختلف برامج الماجستير في القانون بشكل إجمالي.
- تختلف أطوال النصوص، لكن مجموعات البيانات لا تحتوي إلا على نصوص يزيد طولها عن 350 حرفًا - وهو الحد الأدنى الذي يقبله منتجنا.
معايير التقييم
المقاييس المستخدمة في مهمة تصنيف النصوص هذه هي:
1. مصفوفة الارتباك: جدول يوضح TP (الإيجابيات الحقيقية)، FP (الإيجابيات الكاذبة)، TN (السلبيات الحقيقية) و FN (السلبيات الكاذبة).
2. الدقة: نسبة النتائج الصحيحة (الإيجابيات الصحيحة والسلبيات الصحيحة) من بين إجمالي عدد النصوص التي تم فحصها.

3. معدل السلبية الحقيقية (TNR): نسبة الحالات السلبية الفعلية التي تمثل جميع التنبؤات السلبية .

في سياق الكشف باستخدام الذكاء الاصطناعي، فإن TNR هو دقة النموذج في التعامل مع النصوص البشرية.
4. (TPR) المعروف أيضًا باسم الاستدعاء: نسبة النتائج الإيجابية الحقيقية في جميع التنبؤات الفعلية.

في سياق الكشف باستخدام الذكاء الاصطناعي، فإن TPR هو دقة النموذج في التعامل مع النصوص التي تم إنشاؤها بواسطة الذكاء الاصطناعي.
5. درجة F-beta: المتوسط التوافقي المرجح بين الدقة والاستدعاء، مع تفضيل الدقة أكثر (لأننا نريد تفضيل معدل إيجابي خاطئ أقل).

مجموعات بيانات الذكاء الاصطناعي والبيانات البشرية المدمجة
| اسم مجموعة البيانات | عدد النصوص | عدد النصوص البشرية | عدد النصوص التي تم الحصول عليها بواسطة الذكاء الاصطناعي | TPR | برنامج التعقيم والإخصاء وإعادة التعقيم | F-beta(0.5) |
|---|---|---|---|---|---|---|
| مجموعات بيانات داخلية شديدة الصعوبة، بما في ذلك الهجمات المعادية والأدوات الخاصة | 500,000 | 300,000 | 200,000 | 0.988 | 0.999 | 0.997 |
النتائج: فريق ضمان الجودة
أجرى فريق ضمان الجودة الاختبار المستقل التالي:
- كانت لغة النصوص هي الإنجليزية، وتم اختبار 229843 نصًا مكتوبًا بواسطة البشر و18712 نصًا تم إنشاؤها بواسطة الذكاء الاصطناعي من مختلف برامج الماجستير في القانون بشكل إجمالي.
- تختلف أطوال النصوص، لكن مجموعات البيانات لا تحتوي إلا على نصوص يزيد طولها عن 350 حرفًا - وهو الحد الأدنى الذي يقبله منتجنا.
مجموعات البيانات البشرية فقط
| اسم مجموعة البيانات | عدد النصوص | تم التعرف عليه بشكل صحيح على أنه إنسان | تم التعرف عليه بشكل خاطئ على أنه ذكاء اصطناعي | دقة |
|---|---|---|---|---|
| نصوص عامة | 9,979 | 9,979 | 0 | 1 |
| مقالات، أخبار، مدونات، منشورات على مواقع التواصل الاجتماعي | 9,991 | 9,982 | 9 | 0.9991 |
| مجموعة بيانات صفحات الويب على الإنترنت | 99,921 | 99,918 | 3 | 0.9999 |
| مقالات الطلاب | 10,000 | 9,998 | 2 | 0.9998 |
| أوراق بحثية | 99,952 | 99,906 | 46 | 0.9995 |
| المجموع: | 229,843 | 229,783 | 60 | 0.9997 |
مجموعات البيانات الخاصة بالذكاء الاصطناعي فقط
| اسم مجموعة البيانات | عدد النصوص | تم التعرف عليه بشكل خاطئ على أنه إنسان | تم التعرف عليه بشكل صحيح على أنه ذكاء اصطناعي | دقة |
|---|---|---|---|---|
| نماذج عائلة OpenAI - نماذج أخرى | 12,880 | 129 | 12,751 | 0.9899 |
| GPT-5 | 1,207 | 11 | 1,196 | 0.9909 |
| نماذج عائلة الجوزاء | 1,978 | 7 | 1,971 | 0.9964 |
| نماذج عائلة كلود | 1,072 | 1 | 1,071 | 0.9991 |
| نماذج عائلة جروك | 1,575 | 0 | 1,575 | 1 |
| المجموع: | 18,712 | 148 | 18,564 | 0.992 |
*قد تتغير إصدارات النماذج بمرور الوقت. تم إنشاء النصوص باستخدام الإصدارات الحالية المتاحة من النماذج من شركات الذكاء الاصطناعي التوليدي المذكورة أعلاه.
مستويات الحساسية
منذ الإصدار 7.1، أصبح لدينا ثلاثة مستويات حساسية لنموذج الكشف بالذكاء الاصطناعي. إليكم نتائج اختبار مستويات الحساسية للنموذج في الإصدار 10.
| بطاقة تعريف | حساسية | تعريف | النتائج الإيجابية الخاطئة | النتائج السلبية الكاذبة |
|---|---|---|---|---|
| 1 | أمان إضافي | صُممت هذه الطريقة لتقليل النتائج الإيجابية الخاطئة باستخدام مرشحات إضافية تعتمد على تقنية الكشف بالذكاء الاصطناعي. جيد لاكتشاف النصوص التي تم إنشاؤها بواسطة الذكاء الاصطناعي دون أي تعديل بشري يُذكر. | 0.009% | 1.36% |
| 2 | متوازن (افتراضي - هذه هي النسخة ذلك موضح في النتائج المذكورة أعلاه) | مثالي لاكتشاف محتوى الذكاء الاصطناعي مع تقليل النتائج الإيجابية الخاطئة. جيد في اكتشاف النصوص التي تم إنشاؤها بواسطة الذكاء الاصطناعي والتي تحتوي على قدر معتدل من التعديل البشري. | 0.026% | 0.79% |
| 3 | حساسية فائقة | تم تصميم نموذجنا الأكثر حساسية لتحديد نص الذكاء الاصطناعي الذي تم وضعه من خلال "مُحَوِّل النص إلى نص بشري" أو مُعَدِّل للنصوص. | 0.05% | 0.53% |
دقة النتائج الإيجابية الصحيحة (نصوص الذكاء الاصطناعي) والنتائج السلبية الصحيحة (نصوص بشرية) حسب مستوى الحساسية
تحليل الأخطاء النصية بواسطة الإنسان والذكاء الاصطناعي
خلال عملية التقييم، حددنا وحللنا التقييمات غير الصحيحة التي أصدرها النموذج، وأعددنا تقريرًا مفصلًا يمكّن فريق علوم البيانات من تصحيح الأسباب الجذرية. ويتم ذلك دون الكشف عن هذه التقييمات الخاطئة لفريق علوم البيانات. تُسجّل جميع الأخطاء وتُصنّف بشكل منهجي بناءً على طبيعتها وخصائصها في "عملية تحليل الأسباب الجذرية"، التي تهدف إلى فهم الأسباب الكامنة وتحديد الأنماط المتكررة. هذه العملية مستمرة دائمًا، مما يضمن التحسين المستمر لنموذجنا وقابليته للتكيف مع مرور الوقت.
من الأمثلة على هذا النوع من الاختبارات تحليلنا لبيانات الإنترنت للفترة من 2013 إلى 2024 باستخدام نموذجنا V4. أخذنا عينة من مليون نص من كل عام، بدءًا من عام 2013، مستخدمين أي نتائج إيجابية خاطئة تم رصدها بين عامي 2013 و2020، قبل إطلاق أنظمة الذكاء الاصطناعي، وذلك للمساعدة في تحسين النموذج بشكل أكبر.
على غرار ما يفعله الباحثون حول العالم ويستمرون في اختبار منصات الكشف بالذكاء الاصطناعي المختلفة لتقييم قدراتها وحدودها، فإننا نشجع مستخدمينا بشدة على إجراء اختبارات عملية. ومع إصدار نماذج جديدة، سنواصل مشاركة منهجيات الاختبار ودقة النتائج وغيرها من الاعتبارات المهمة التي يجب مراعاتها.