Yapay Zeka Destekli Video Algılama özelliği artık yayında.

Demo alın

Copyleaks Metin Denetiminin Doğruluğunun Değerlendirilmesi

Ayrıntılı Bir Metodoloji

Metin Denetleme Modelimizin doğruluğu, yanlış pozitif ve yanlış negatif oranları, iyileştirme alanları ve daha fazlası hakkında tam şeffaflık sağlamanın, sorumlu kullanım ve benimsemeyi sağlamak için son derece önemli olduğuna inanıyoruz. Bu kapsamlı analiz, Metin Denetleme Modelimizin test metodolojisi konusunda tam şeffaflık sağlamayı amaçlamaktadır.

Test tarihi: 29 Haziran 2025

Yayın tarihi: 16 Eylül 2025

Test edilen model: V1

Yönetici Özeti

Copyleaks Metin Moderasyon Modeli v1, eğitim veri setinden tamamen ayrı tutulan toplam 120.000 İngilizce metin ( %50 ihlal içeren, %50 ihlal içermeyen) üzerinde kör, çift ekipli bir değerlendirmeye tabi tutuldu.

Değerlendirme, modelin zararlı içerikleri çok yüksek doğruluk oranıyla tespit edebildiğini ve masum metinleri neredeyse hiç işaretlemediğini gösteriyor.

Aynı veri seti, önde gelen üç ticari içerik denetleme API'si (OpenAI, Azure ve Google) tarafından varsayılan eşik değerlerinde işlendiğinde, Copyleaks daha az yanlış pozitif ve yanlış negatif sonuç üretti ve temel ölçütlerde %4-30 oranında bir avantaj sağladı.

Temel veriler (Kalite güvence test seti, N = 20.000)

  • Doğruluk: %99,23
  • Doğruluk oranı: %99,97 (10.000 ihlal içermeyen metinde 3 yanlış pozitif)
  • Geri Çağırma Oranı (TPR): %98,48
  • F-Beta(0.5) skoru: %99,67

Metodoloji

Modelin performansına ilişkin tarafsız bir tablo elde etmek amacıyla, iki ekip tarafından körleme yöntemiyle bir değerlendirme yapıldı. Veri Bilimi ve Kalite Güvence ekipleri, farklı makineler, farklı komut dosyaları ve hiçbir ortak veri olmaksızın tamamen izole bir şekilde çalıştılar.

1. Test setlerinin oluşturulması

Veri Bilimi test seti

  • 100.000 İngilizce metin (50.000'i kural ihlali içermeyen / 50.000'i kural ihlali içeren)

  • Metinler, kamuya açık sosyal medya paylaşımları, haber makaleleri, kamuya açık literatür ve Copyleaks tarafından oluşturulan uç örnekler olmak üzere dört güvenilir kaynaktan rastgele ve yerine koyma yapılmadan örneklenmiştir. Tüm materyaller ya kamuya açık alandadır ya da açık lisanslar altında kullanılmaktadır.

  • İki harici LLM ile çapraz kontrol yapıldı; yalnızca oybirliğiyle onaylanan maddeler saklandı.

  • Copyleaks'in tüm politika kategorilerini kapsayan içerik.

  • Etiket kesinliği filtresi: Yalnızca denetim durumu %100 kesin olan metinler saklandı; sınırda olan metinler atıldı. Bu, birebir karşılaştırmalarda adaleti en üst düzeye çıkarır ve gerçekliğin öznelliğini ortadan kaldırır.

QA test seti

  • Kalite kontrol departmanı tarafından bağımsız olarak hazırlanmış 20.000 İngilizce metin (10.000'i kural ihlali içermeyen / 10.000'i kural ihlali içeren).

  • Minimum uzunluk 10 karakterdir; aksi takdirde DS setiyle aynı örnekleme, etiketleme, lisans kaynağı, %100 kesin kural ve kategori protokolü geçerlidir.

Veri Bilimi seti, eğitim için kullanılan orijinal veri kümelerinden kesinlikle ayrı tutulmuştur. Soru-Cevap seti, model eğitiminden sonra kasıtlı olarak oluşturulmuş pasajlardan oluşmaktadır; bu metinler eğitim sırasında hiç görülmemiş ve eğitim veri kümelerinden alınmamıştır.

2. Araç zinciri ve uygulama detayları

  • Copyleaks API v1, 24 Haziran 2025 tarihinde sorgulandı.

  • Rakip uç noktaları (24 Haziran 2025 tarihinde aynı ön işleme tabi tutularak sorgulanmıştır)
    • OpenAI Moderasyon v2, varsayılan eşik
    • Azure AI İçerik Güvenliği sürümü 2025-06-15
    • Google Perspective API rev. 2025-06-12, toksisite eşiği = 0,50

  • Ön işleme: emoji korunması, kök harf ayrımı veya küçük harfe dönüştürme yok.

  • Her çalıştırma için ham JSON yanıtını kaydettik, ikili bir karar çıkardık, bir karışıklık matrisi (TP, FP, TN, FN) oluşturduk ve ardından Doğruluk, Hassasiyet, Geri Çağırma, TNR ve F-Beta(0.5) değerlerini hesapladık.

Moderasyon Kategorilerinin Tanımı

Moderasyon kategorileri için aşağıdaki tanımlar kullanılmıştır:

  1. Yetişkinlere yönelik : Cinsel uyarılmayı amaçlayan, cinsel eylemlerin veya davranışların açık ve net tasvirleri, göndermeleri veya betimlemeleri.

  2. Zehirli : Belirli bir kişiyi hedef almayan, genel anlamda hakaret eden, küçük düşüren veya onur kırıcı olan zararlı dil. Bu, duygusal zarar vermeyi amaçlayan her türlü dili içerir.

  3. Şiddet içeren : Fiziksel zarara veya yaralanmaya teşvik eden veya bunu yücelten dil.

  4. Küfür : Ağır veya hakaret içeren küfürlerin kullanılması.

  5. Kendine Zarar Verme : Kendine zarar verme davranışını teşvik eden veya normalleştiren referanslar.

  6. Taciz : Belirli bir kişiyi veya grubu hedef alan, kişisel özelliklerine veya inançlarına odaklanan, hakaret içeren veya aşağılayan hedefli kötü muamele.

  7. Nefret Söylemi : Bir grup veya bireyi doğuştan gelen özelliklerine dayanarak şeytanlaştıran veya zarar vermeye teşvik eden, genellikle şiddete veya sistematik ayrımcılığa çağrı yapan dil.

  8. Uyuşturucu Kullanımı : Yasadışı maddeler veya yasal ilaçların kötüye kullanımı da dahil olmak üzere, uyuşturucuların zararlı bir bağlamda kullanımı, kötüye kullanımı veya dağıtımına ilişkin referanslar, açıklamalar veya onaylar.

  9. Ateşli Silahlar : Özellikle şiddeti veya güvensiz uygulamaları teşvik edebilecek veya bunlara yol açabilecek tartışmaların yer aldığı, silahların ve diğer silahların kullanımı, bulundurulması veya dağıtımıyla ilgili içerik.

  10. Siber güvenlik : Bilgisayar güvenliğiyle ilgili içerik; siber saldırılar, veri ihlalleri ve dijital sistemlere yetkisiz erişim sağlamaya yönelik önlemler hakkındaki tartışmaları içerir.

  11. Diğer : Yukarıdaki kategorilerde yer almayan, uygunsuz, zararlı veya saldırgan olarak değerlendirilen diğer tüm içerikler.

Ölçüt Tanımları

Bu metin denetleme görevinde kullanılan ölçütler şunlardır:

1. Karmaşıklık Matrisi : Modelin performansını özetleyen ve aşağıdaki bilgileri gösteren bir tablo:

    1. Gerçek Pozitifler (TP) : Denetime ihtiyaç duyduğu doğru şekilde belirlenen ihlal içeren metinler.
    2. Yanlış Pozitifler (FP) : Kural ihlali içermeyen ancak yanlışlıkla moderasyona ihtiyaç duyduğu belirlenen metinler.
    3. Gerçek Negatifler (TN) : Kural ihlali içermeyen ve denetime ihtiyaç duymadığı doğru şekilde belirlenen metinler.
    4. Yanlış Negatifler (YN) : Kuralları ihlal eden metinlerin, denetime ihtiyaç duymadığı şeklinde yanlış bir şekilde belirlenmesi.

2. Doğruluk : Değerlendirilen toplam metin sayısı içindeki doğru sınıflandırılmış örneklerin (hem doğru pozitifler hem de doğru negatifler) oranı.

Doğruluk = TP + TN / Toplam metin sayısı

3. Gerçek Negatif Oranı (TNR) : Gerçekte negatif olan durumların doğru şekilde negatif olarak tanımlanan oranını ifade eder. Metin Denetimi bağlamında, TNR modelin ihlal içermeyen metinler üzerindeki performansını ölçer.

TNR = TN / TN + FP

4. Gerçek Pozitif Oranı (TPR) / Geri Çağırma : Gerçek pozitif örneklerin doğru şekilde pozitif olarak tanımlanan oranı. Metin Denetimi bağlamında, TPR modelin ihlal içeren metinler üzerindeki performansını ölçer.

TPR = TP / TP + FN

5. Hassasiyet : Tüm olumlu tahminler içinden doğru tahmin edilen olumlu gözlemlerin oranı. Metin Denetimi bağlamında, Hassasiyet, modelin içeriği işaretlediğinde güvenilirliğini ölçer; model tarafından ihlal olarak tanımlanan metinlerin kaçının gerçekten denetlendiğini bize söyler.

Hassasiyet = TP / TP + FP

6. F-beta Skoru : Hassasiyet ve geri çağırmanın ağırlıklı harmonik ortalamasıdır; beta parametresi hassasiyeti destekleyecek şekilde ayarlanmıştır. Bu önceliklendirme, daha düşük Yanlış Pozitif Oranı elde etmeye yardımcı olur.

Sonuçlar

Veri Bilimi ekibi

Veri Bilimi Ekibi Sonuçları

Karışıklık Matrisi

Kalite güvence ekibi

Kalite Güvence Ekibi Sonuçları

Kalite Güvence Test Metrikleri Özeti:

  • Genel doğruluk oranı : 0,9923

  • Hassasiyet : 0.9997

  • Geri çağırma : 0.9848

  • F-beta (β = 0,5) : 0,9967

Birebir karşılaştırmalı değerlendirme

Karşı Karşıya
Model Karşılaştırması

Sınırlamalar

  • Dil kapsamı: Bu model ve değerlendirmesi yalnızca İngilizceyi kapsamaktadır.

  • Bağlam kapsamı: Moderasyon, her seferinde tek bir "metin parçası" üzerinde gerçekleştirilir; metin parçası, belirli sayıda belirteç içeren, kendi içinde bağımsız bir metin bölümüdür. Sistem, metin parçaları, bölümler veya konuşma sıraları arasında hafıza tutmaz; bu nedenle "daha önce açıkladığımız gibi" gibi referanslar veya önceki bağlama bağlı zamirler gözden kaçabilir.

  • Değerlendirme kapsamı: Bu ürün yalnızca metni değerlendirir; görüntü, ses veya video girdileri dahil edilmemiştir.