Yapay Zeka Destekli Video Algılama özelliği artık yayında.

Demo alın
Kaynak

Copyleaks Yapay Zeka Dedektörünün Doğruluğunun Değerlendirilmesi

Adım Adım Bir Metodoloji

Sorumlu kullanım ve benimsemeyi sağlamak için, AI Dedektörünün doğruluğu, yanlış pozitif ve yanlış negatif oranları, iyileştirme alanları ve daha fazlası hakkında tam şeffaflık sağlamanın her zamankinden daha önemli olduğuna inanıyoruz. Bu kapsamlı analiz, AI Dedektörümüzün V10 model test metodolojisi konusunda tam şeffaflık sağlamayı amaçlamaktadır.

Test tarihi: 16 Ekim 2025

Yayın tarihi: 12 Kasım 2025

Test edilen model: V10

Metodoloji

Copyleaks Veri Bilimi ve Kalite Güvence ekipleri, tarafsız ve doğru sonuçlar elde etmek için bağımsız olarak testler gerçekleştirdi. Test verileri, eğitim verilerinden farklıydı ve daha önce yapay zeka tespiti için Yapay Zeka Dedektörüne gönderilmiş herhangi bir içerik içermiyordu.

Test verileri, doğrulanmış veri kümelerinden elde edilen insan tarafından yazılmış metinlerden ve çeşitli yapay zeka modellerinden üretilen yapay zeka metinlerinden oluşuyordu. Test, Copyleaks API'si kullanılarak gerçekleştirildi.

Metrikler

Ölçümler arasında, doğru ve yanlış metin tanımlama oranına dayalı genel doğruluk ve gerçek pozitif oranlarını (TPR) ve yanlış pozitif oranlarını (FPR) inceleyen ROC-AUC (Alıcı İşletim Karakteristiği – Eğri Altındaki Alan) yer almaktadır. Ek ölçümler arasında F1 puanı, gerçek negatif oranı (TNR) ve karışıklık matrisleri bulunmaktadır.

Sonuçlar

Yapılan testler, yapay zeka dedektörünün insan tarafından yazılan ve yapay zeka tarafından üretilen metinleri ayırt etmede yüksek bir tespit doğruluğu sergilediğini ve düşük bir yanlış pozitif oranını koruduğunu doğrulamaktadır.

Değerlendirme Süreci

Çift departmanlı bir sistem kullanarak, en üst düzey kalite, standartlar ve güvenilirliği sağlamak için değerlendirme sürecimizi tasarladık. Modeli değerlendiren iki bağımsız departmanımız var: veri bilimi ve kalite güvence ekipleri. Her departman kendi değerlendirme verileri ve araçlarıyla bağımsız olarak çalışır ve diğerinin değerlendirme sürecine erişimi yoktur. Bu ayrım, değerlendirme sonuçlarının tarafsız, objektif ve doğru olmasını sağlarken, modelimizin performansının tüm olası boyutlarını yakalamayı da garanti eder. Ayrıca, test verilerinin eğitim verilerinden ayrı tutulduğunu ve modellerimizi yalnızca daha önce görmedikleri yeni veriler üzerinde test ettiğimizi belirtmek önemlidir.

Metodoloji

Copyleaks'in Kalite Güvence ve Veri Bilimi ekipleri, birbirinden bağımsız olarak çeşitli test veri kümeleri topladı. Her test veri kümesi, sınırlı sayıda metinden oluşmaktadır. Her veri kümesinin beklenen etiketi (belirli bir metnin insan tarafından mı yoksa yapay zeka tarafından mı yazıldığını gösteren bir işaret), verinin kaynağına göre belirlenir. İnsan tarafından yazılan metinler, modern üretken yapay zeka sistemlerinin yükselişinden önce veya daha sonra ekip tarafından tekrar doğrulanan diğer güvenilir kaynaklardan yayınlanan metinlerden toplanmıştır. Yapay zeka tarafından oluşturulan metinler ise çeşitli üretken yapay zeka modelleri ve teknikleri kullanılarak oluşturulmuştur.

Testler Copyleaks API'sine karşı gerçekleştirildi. API'nin çıktısının her metin için hedef etikete göre doğru olup olmadığını kontrol ettik ve ardından karışıklık matrisini hesaplamak için puanları topladık.

Sonuçlar: Veri Bilimi Ekibi

Veri Bilimi ekibi aşağıdaki bağımsız testi gerçekleştirdi:

  • Metinlerin dili İngilizceydi ve toplamda 300.000 insan tarafından yazılmış metin ile çeşitli dil öğrenme ortamlarından (LLM) 200.000 yapay zeka tarafından üretilmiş metin test edildi.
  • Metin uzunlukları değişiklik gösterse de, veri kümeleri yalnızca ürünümüzün kabul ettiği minimum uzunluk olan 350 karakterden daha uzun metinler içermektedir.

Değerlendirme Ölçütleri

Bu metin sınıflandırma görevinde kullanılan ölçütler şunlardır:

1. Karışıklık Matrisi: TP (gerçek pozitifler), FP (yanlış pozitifler), TN (gerçek negatifler) ve FN (yanlış negatifler) değerlerini gösteren bir tablo.

2. Doğruluk: Kontrol edilen toplam metin sayısı içinde doğru sonuçların (hem doğru pozitifler hem de doğru negatifler) oranı.

3. Gerçek Negatif Oranı (TNR): Gerçek negatif durumların, tüm negatif tahminler olma oranını ifade eder.

Yapay zekâ tabanlı tespit bağlamında, TNR, modelin insan metinleri üzerindeki doğruluğunu ifade eder.

4. (TPR) veya Geri Çağırma: Tüm gerçek tahminler içindeki doğru pozitif sonuçların oranı.

Yapay zekâ tespiti bağlamında, TPR, modelin yapay zekâ tarafından üretilen metinler üzerindeki doğruluğunu ifade eder.

5. F-beta Skoru: Hassasiyet ve geri çağırma arasındaki ağırlıklı harmonik ortalama olup, yanlış pozitif oranını düşürmek istediğimiz için hassasiyeti daha çok ön plana çıkarır.

Yapay Zeka ve İnsan Veri Kümelerinin Birleştirilmesi

Veri Kümesinin AdıMetin sayısıİnsan metinlerinin sayısıYapay zeka metinlerinin sayısıTPRTNRF-beta(0.5)
Düşman saldırıları ve özel araçlar da dahil olmak üzere, dahili son derece zorlu veri kümeleri.500,000300,000200,0000.9880.9990.997

Sonuçlar: Kalite Kontrol Ekibi

Kalite güvence ekibi aşağıdaki bağımsız testi gerçekleştirdi:

  • Metinlerin dili İngilizceydi ve toplamda çeşitli dil öğrenme ortamlarından 229.843 insan tarafından yazılmış metin ve 18.712 yapay zeka tarafından üretilmiş metin test edildi.
  • Metin uzunlukları değişiklik gösterse de, veri kümeleri yalnızca ürünümüzün kabul ettiği minimum uzunluk olan 350 karakterden daha uzun metinler içermektedir.

Sadece İnsanlardan Oluşan Veri Kümeleri

Veri Kümesinin AdıMetin sayısıİnsan olarak doğru şekilde tanımlandı.Yanlışlıkla yapay zeka olarak tanımlandıKesinlik
Genel metinler9,9799,97901
Makaleler, haberler, bloglar, sosyal medya paylaşımları9,9919,98290.9991
İnternet Web Sayfaları Veri Kümesi99,92199,91830.9999
Öğrenci denemeleri10,0009,99820.9998
Bilimsel makaleler99,95299,906460.9995
Toplam:229,843229,783600.9997

Yalnızca Yapay Zeka Veri Kümeleri

Veri Kümesinin AdıMetin sayısıİnsan olarak yanlış tanımlandıYapay zeka olarak doğru şekilde tanımlandı.Kesinlik
OpenAI ailesi modelleri - diğer modeller12,88012912,7510.9899
GPT-51,207111,1960.9909
Gemini ailesi modelleri1,97871,9710.9964
Claude ailesi modelleri1,07211,0710.9991
Grok ailesi modelleri1,57501,5751
Toplam:18,71214818,5640.992

*Model sürümleri zaman içinde değişebilir. Metinler, yukarıda belirtilen üretken yapay zeka şirketlerinin mevcut model sürümleri kullanılarak oluşturulmuştur.

Hassasiyet Seviyeleri

7.1 sürümünden beri yapay zeka algılama modeli için 3 hassasiyet seviyesi bulunmaktadır. İşte 10. sürüm modelinin hassasiyet seviyelerine ait test sonuçları.

İDHassasiyetTanımYanlış PozitiflerYanlış Negatifler
1Ekstra GüvenliEk yapay zeka tabanlı tespit filtreleri kullanarak yanlış pozitifleri en aza indirgemek üzere tasarlanmıştır.

Yapay zeka tarafından oluşturulan metinleri minimum insan müdahalesiyle tespit etmek için idealdir.
0.009%1.36%
2Dengeli (varsayılan -
Bu, sürüm.
bu, şurada gösterilmiştir
(Yukarıdaki sonuçlar)
Yanlış pozitifleri en aza indirirken yapay zeka içeriklerini tespit etmek için idealdir.

Orta düzeyde insan müdahalesi içeren yapay zeka tarafından oluşturulmuş metinleri tespit etmek için uygundur.
0.026%0.79%
3Ekstra HassasEn hassas modelimiz, "insanlaştırıcı" veya metin döndürücüden geçirilmiş yapay zeka metinlerini işaretlemek üzere tasarlanmıştır.0.05%0.53%

Doğru Pozitifler (Yapay Zeka Metinleri) ve Doğru Negatifler (İnsan Metinleri) Hassasiyet Seviyesine Göre Doğruluk Oranı

gerçek pozitiflergerçek negatifler
98.64%
99.99%
Minimum Yanlış Pozitif Sayısı (duyarlılık 1)
99.21%
99.97%
Dengeli (hassasiyet 2)
99.47%
99.95%
Ekstra hassas (hassasiyet 3)
Hassasiyet

İnsan ve Yapay Zeka Metin Hata Analizi

During the evaluation process, we identified and analyzed incorrect assessments made by the model and created a detailed report that will enable the data science team to correct the underlying causes. This is done without exposing the incorrect assessments to the data science team. All errors are systematically logged and categorized based on their character and nature in a “root cause analysis process”, which aims to understand the underlying causes and identify repeated patterns. This process is always ongoing, ensuring ongoing improvement and adaptability of our model over time.

One example of such a test is our analysis of internet data from 2013 – 2024 using our V4 model. We sampled 1M texts from each year, starting in 2013, using any false positives detected from 2013-2020, before the release of AI systems, to help improve the model further.

02013
22014
32015
12016
02017
22018
12019
22020
342021
482022
5792023
15,1012024
Yıl

Similar to how researchers worldwide have and continue to test different AI detector platforms to gauge their capabilities and limitations, we fully encourage our users to conduct real-world testing. Ultimately, as new models are released, we will continue to share the testing methodologies, accuracy, and other important considerations to be aware of.