Copyleaks Yapay Zeka Dedektörünün Doğruluğunun Değerlendirilmesi
Adım Adım Bir Metodoloji
Sorumlu kullanım ve benimsemeyi sağlamak için, AI Dedektörünün doğruluğu, yanlış pozitif ve yanlış negatif oranları, iyileştirme alanları ve daha fazlası hakkında tam şeffaflık sağlamanın her zamankinden daha önemli olduğuna inanıyoruz. Bu kapsamlı analiz, AI Dedektörümüzün V10 model test metodolojisi konusunda tam şeffaflık sağlamayı amaçlamaktadır.
Test tarihi: 16 Ekim 2025
Yayın tarihi: 12 Kasım 2025
Test edilen model: V10
Değerlendirme Süreci
Çift departmanlı bir sistem kullanarak, en üst düzey kalite, standartlar ve güvenilirliği sağlamak için değerlendirme sürecimizi tasarladık. Modeli değerlendiren iki bağımsız departmanımız var: veri bilimi ve kalite güvence ekipleri. Her departman kendi değerlendirme verileri ve araçlarıyla bağımsız olarak çalışır ve diğerinin değerlendirme sürecine erişimi yoktur. Bu ayrım, değerlendirme sonuçlarının tarafsız, objektif ve doğru olmasını sağlarken, modelimizin performansının tüm olası boyutlarını yakalamayı da garanti eder. Ayrıca, test verilerinin eğitim verilerinden ayrı tutulduğunu ve modellerimizi yalnızca daha önce görmedikleri yeni veriler üzerinde test ettiğimizi belirtmek önemlidir.
Metodoloji
Copyleaks'in Kalite Güvence ve Veri Bilimi ekipleri, birbirinden bağımsız olarak çeşitli test veri kümeleri topladı. Her test veri kümesi, sınırlı sayıda metinden oluşmaktadır. Her veri kümesinin beklenen etiketi (belirli bir metnin insan tarafından mı yoksa yapay zeka tarafından mı yazıldığını gösteren bir işaret), verinin kaynağına göre belirlenir. İnsan tarafından yazılan metinler, modern üretken yapay zeka sistemlerinin yükselişinden önce veya daha sonra ekip tarafından tekrar doğrulanan diğer güvenilir kaynaklardan yayınlanan metinlerden toplanmıştır. Yapay zeka tarafından oluşturulan metinler ise çeşitli üretken yapay zeka modelleri ve teknikleri kullanılarak oluşturulmuştur.
Testler Copyleaks API'sine karşı gerçekleştirildi. API'nin çıktısının her metin için hedef etikete göre doğru olup olmadığını kontrol ettik ve ardından karışıklık matrisini hesaplamak için puanları topladık.
Sonuçlar: Veri Bilimi Ekibi
Veri Bilimi ekibi aşağıdaki bağımsız testi gerçekleştirdi:
- Metinlerin dili İngilizceydi ve toplamda 300.000 insan tarafından yazılmış metin ile çeşitli dil öğrenme ortamlarından (LLM) 200.000 yapay zeka tarafından üretilmiş metin test edildi.
- Metin uzunlukları değişiklik gösterse de, veri kümeleri yalnızca ürünümüzün kabul ettiği minimum uzunluk olan 350 karakterden daha uzun metinler içermektedir.
Değerlendirme Ölçütleri
Bu metin sınıflandırma görevinde kullanılan ölçütler şunlardır:
1. Karışıklık Matrisi: TP (gerçek pozitifler), FP (yanlış pozitifler), TN (gerçek negatifler) ve FN (yanlış negatifler) değerlerini gösteren bir tablo.
2. Doğruluk: Kontrol edilen toplam metin sayısı içinde doğru sonuçların (hem doğru pozitifler hem de doğru negatifler) oranı.

3. Gerçek Negatif Oranı (TNR): Gerçek negatif durumların, tüm negatif tahminler olma oranını ifade eder.

Yapay zekâ tabanlı tespit bağlamında, TNR, modelin insan metinleri üzerindeki doğruluğunu ifade eder.
4. (TPR) veya Geri Çağırma: Tüm gerçek tahminler içindeki doğru pozitif sonuçların oranı.

Yapay zekâ tespiti bağlamında, TPR, modelin yapay zekâ tarafından üretilen metinler üzerindeki doğruluğunu ifade eder.
5. F-beta Skoru: Hassasiyet ve geri çağırma arasındaki ağırlıklı harmonik ortalama olup, yanlış pozitif oranını düşürmek istediğimiz için hassasiyeti daha çok ön plana çıkarır.

Yapay Zeka ve İnsan Veri Kümelerinin Birleştirilmesi
| Veri Kümesinin Adı | Metin sayısı | İnsan metinlerinin sayısı | Yapay zeka metinlerinin sayısı | TPR | TNR | F-beta(0.5) |
|---|---|---|---|---|---|---|
| Düşman saldırıları ve özel araçlar da dahil olmak üzere, dahili son derece zorlu veri kümeleri. | 500,000 | 300,000 | 200,000 | 0.988 | 0.999 | 0.997 |
Sonuçlar: Kalite Kontrol Ekibi
Kalite güvence ekibi aşağıdaki bağımsız testi gerçekleştirdi:
- Metinlerin dili İngilizceydi ve toplamda çeşitli dil öğrenme ortamlarından 229.843 insan tarafından yazılmış metin ve 18.712 yapay zeka tarafından üretilmiş metin test edildi.
- Metin uzunlukları değişiklik gösterse de, veri kümeleri yalnızca ürünümüzün kabul ettiği minimum uzunluk olan 350 karakterden daha uzun metinler içermektedir.
Sadece İnsanlardan Oluşan Veri Kümeleri
| Veri Kümesinin Adı | Metin sayısı | İnsan olarak doğru şekilde tanımlandı. | Yanlışlıkla yapay zeka olarak tanımlandı | Kesinlik |
|---|---|---|---|---|
| Genel metinler | 9,979 | 9,979 | 0 | 1 |
| Makaleler, haberler, bloglar, sosyal medya paylaşımları | 9,991 | 9,982 | 9 | 0.9991 |
| İnternet Web Sayfaları Veri Kümesi | 99,921 | 99,918 | 3 | 0.9999 |
| Öğrenci denemeleri | 10,000 | 9,998 | 2 | 0.9998 |
| Bilimsel makaleler | 99,952 | 99,906 | 46 | 0.9995 |
| Toplam: | 229,843 | 229,783 | 60 | 0.9997 |
Yalnızca Yapay Zeka Veri Kümeleri
| Veri Kümesinin Adı | Metin sayısı | İnsan olarak yanlış tanımlandı | Yapay zeka olarak doğru şekilde tanımlandı. | Kesinlik |
|---|---|---|---|---|
| OpenAI ailesi modelleri - diğer modeller | 12,880 | 129 | 12,751 | 0.9899 |
| GPT-5 | 1,207 | 11 | 1,196 | 0.9909 |
| Gemini ailesi modelleri | 1,978 | 7 | 1,971 | 0.9964 |
| Claude ailesi modelleri | 1,072 | 1 | 1,071 | 0.9991 |
| Grok ailesi modelleri | 1,575 | 0 | 1,575 | 1 |
| Toplam: | 18,712 | 148 | 18,564 | 0.992 |
*Model sürümleri zaman içinde değişebilir. Metinler, yukarıda belirtilen üretken yapay zeka şirketlerinin mevcut model sürümleri kullanılarak oluşturulmuştur.
Hassasiyet Seviyeleri
7.1 sürümünden beri yapay zeka algılama modeli için 3 hassasiyet seviyesi bulunmaktadır. İşte 10. sürüm modelinin hassasiyet seviyelerine ait test sonuçları.
| İD | Hassasiyet | Tanım | Yanlış Pozitifler | Yanlış Negatifler |
|---|---|---|---|---|
| 1 | Ekstra Güvenli | Ek yapay zeka tabanlı tespit filtreleri kullanarak yanlış pozitifleri en aza indirgemek üzere tasarlanmıştır. Yapay zeka tarafından oluşturulan metinleri minimum insan müdahalesiyle tespit etmek için idealdir. | 0.009% | 1.36% |
| 2 | Dengeli (varsayılan - Bu, sürüm. bu, şurada gösterilmiştir (Yukarıdaki sonuçlar) | Yanlış pozitifleri en aza indirirken yapay zeka içeriklerini tespit etmek için idealdir. Orta düzeyde insan müdahalesi içeren yapay zeka tarafından oluşturulmuş metinleri tespit etmek için uygundur. | 0.026% | 0.79% |
| 3 | Ekstra Hassas | En hassas modelimiz, "insanlaştırıcı" veya metin döndürücüden geçirilmiş yapay zeka metinlerini işaretlemek üzere tasarlanmıştır. | 0.05% | 0.53% |
Doğru Pozitifler (Yapay Zeka Metinleri) ve Doğru Negatifler (İnsan Metinleri) Hassasiyet Seviyesine Göre Doğruluk Oranı
İnsan ve Yapay Zeka Metin Hata Analizi
During the evaluation process, we identified and analyzed incorrect assessments made by the model and created a detailed report that will enable the data science team to correct the underlying causes. This is done without exposing the incorrect assessments to the data science team. All errors are systematically logged and categorized based on their character and nature in a “root cause analysis process”, which aims to understand the underlying causes and identify repeated patterns. This process is always ongoing, ensuring ongoing improvement and adaptability of our model over time.
One example of such a test is our analysis of internet data from 2013 – 2024 using our V4 model. We sampled 1M texts from each year, starting in 2013, using any false positives detected from 2013-2020, before the release of AI systems, to help improve the model further.
Similar to how researchers worldwide have and continue to test different AI detector platforms to gauge their capabilities and limitations, we fully encourage our users to conduct real-world testing. Ultimately, as new models are released, we will continue to share the testing methodologies, accuracy, and other important considerations to be aware of.