Copyleaks Yapay Zeka Görüntü Dedektörünün Doğruluğunun Değerlendirilmesi
Adım Adım Bir Metodoloji
Sorumlu kullanım ve benimsemeyi sağlamak için, yanlış pozitif ve yanlış negatif oranları da dahil olmak üzere yapay zeka görüntü dedektörünün doğruluğu ve iyileştirme alanları konusunda tam şeffaflık sağlamanın her zamankinden daha önemli olduğuna inanıyoruz. Bu kapsamlı analiz, yapay zeka görüntü dedektörü V1.1 model test metodolojimiz hakkında tam şeffaflık sağlamayı amaçlamaktadır.
Modelimiz, tespit edilen alanların üst üste bindirilmesiyle görüntünün yapay zeka tarafından manipüle edilmiş kısımlarını tespit etmek üzere tasarlanmıştır. Testler, Yapay Zeka Görüntü Dedektörünün, gerçek insan fotoğrafları ile yapay zeka tarafından oluşturulmuş veya manipüle edilmiş görüntüler arasında ayrım yapmada yüksek tespit doğruluğuna ulaştığını ve aynı zamanda son derece düşük bir yanlış pozitif oranını koruduğunu doğrulamaktadır.
Test tarihi: 1 Şubat 2026
Yayın tarihi: 15 Şubat 2026
Test edilen model: V1.1
Metodoloji
Çift ekipli bir sistem kullanarak, en üst düzey kalite, standartlar ve güvenilirliği sağlamak için değerlendirme sürecimizi tasarladık. Modeli değerlendiren iki bağımsız departmanımız var: Veri Bilimi ve Kalite Güvence ekipleri. Her ekip kendi değerlendirme verileri ve araçlarıyla bağımsız olarak çalışır ve diğer ekibin değerlendirme sürecine erişimi yoktur. Bu ayrım, değerlendirme sonuçlarının tarafsız, objektif ve doğru olmasını sağlar. Ayrıca, tüm test verilerinin eğitim verilerinden kesinlikle ayrı olduğunu belirtmek önemlidir; modellerimizi yalnızca yapay zeka görüntü dedektörümüzle hiç etkileşime girmemiş yeni görüntüler üzerinde test ediyoruz. Testlerimizin güncel ve zorlayıcı kalmasını sağlamak için, değerlendirme veri kümelerimizi sürekli olarak güncelleyerek en son GenAI modelleri tarafından oluşturulan görüntüleri de dahil ediyoruz.
Test Setlerinin Oluşturulması
Her model sürümü için, Copyleaks Kalite Güvence ve Veri Bilimi ekipleri bağımsız olarak çeşitli test veri kümeleri toplar ve oluşturur. Her veri kümesi, kaynağını gösteren beklenen bir etikete sahip sınırlı sayıda görüntüden oluşur. Veri kümeleri iki kategoriye ayrılır: Copyleaks Kalite Güvence ve Veri Bilimi ekipleri bağımsız olarak çeşitli test veri kümeleri toplar ve oluşturur. Her veri kümesi, kaynağını gösteren beklenen bir etikete sahip sınırlı sayıda görüntüden oluşur. Veri kümeleri iki kategoriye ayrılır:
- Tamamen İnsan Yapımı: Yapay zekâ tarafından değiştirilmemiş, kamera ile çekilmiş otantik görüntüler. Bunlar doğrulanmış veri kümelerinden toplanmış veya manuel olarak oluşturulmuştur.
- Tamamen Yapay Zeka Destekli: Görüntüler tamamen en güncel yapay zeka modelleri tarafından oluşturulmuştur.
Çok çeşitli üretken yapay zeka modelleri kullanılarak yapay zeka tarafından oluşturulan görüntüler üretildi. Testler Copyleaks API'sine karşı yürütüldü ve modelin performansını hesaplamak için puanlar toplandı.
Değerlendirme, dokümantasyonda tanımlandığı gibi, yalnızca şu teknik gereksinimleri karşılayan görüntüler üzerinde yapılmıştır: minimum 512×512 piksel boyut, 32 MB'ın altında dosya boyutu ve 16 megapikselin altında çözünürlük.
Değerlendirme Ölçütleri
Ürün, yapay zeka tarafından oluşturulan segmentlerin üst üste bindirilmesi şeklinde bir tahmin yapar. Genel performans daha sonra, modelin görüntüleri gerçek kategoriye göre ne kadar doğru sınıflandırdığına bağlı olarak değerlendirilir.
Görüntü Türüne Göre Performans Metrikleri
To provide a clear and robust measure of accuracy, we use different pixel-level metrics depending on the type of image being tested:
- For Human Images: The key metric is the pixel-level False Positive Rate (FPR). For an image to be considered a successful detection (True Negative), the percentage of pixels incorrectly flagged as “AI” must be less than 5%. This stringent threshold ensures the model avoids falsely accusing authentic images.
- For AI Images: The primary metric is the pixel-level True Positive Rate (TPR). For an image to be considered a successful detection (True Positive), the percentage of pixels correctly identified as “AI” must be greater than 95%. This ensures the model comprehensively recognizes fully generated content.
Toplu Raporlama Metrikleri
The overall accuracy figures presented in the Results tables, such as TNR (Human Accuracy) and TPR (AI), are aggregated from these pixel-level success criteria. For example, the TNR is the percentage of all tested human images that successfully met the <5% false positive pixel threshold.
Sonuçlar
Veri Bilimi Ekibi Testi
Veri Bilimi ekibi, farklı çözünürlüklerde, çekim cihazlarında, görüntü oluşturucularda ve içerik türlerinde görüntüler içeren geniş ve çeşitli bir veri kümesi üzerinde aşağıdaki bağımsız testi gerçekleştirdi.
| Veri kümesinin adı | İnsan Görüntüleri (n=31.374) | Yapay Zeka Görüntüleri (n=33.947) |
|---|---|---|
| Kesinlik | 98.6% | 97.6% |
Kalite Güvence Ekibi Testi
Kalite güvence ekibi, model eğitildikten sonra özellikle değerlendirme amacıyla oluşturulan görselleri kullanarak bağımsız bir test gerçekleştirdi. Test veri seti, farklı çözünürlüklerde, farklı cihazlar tarafından çekilmiş, çeşitli görüntü oluşturucular tarafından üretilmiş ve farklı içerik türlerine sahip görsellerden oluşmaktadır.
| Veri kümesinin adı | İnsan Görüntüleri (n=10.000) | Yapay Zeka Görüntüleri (n=10.000) |
|---|---|---|
| Kesinlik | 99.3% | 98% |
Hata Analizi
Değerlendirme sürecinde, veri bilimi ekibinin altta yatan nedenleri düzeltmesini sağlamak için hatalı değerlendirmeleri belirleyip analiz ediyoruz. Tüm hatalar sistematik olarak kaydedilir ve "kök neden analizi süreci"nde niteliklerine ve doğalarına göre kategorize edilir. Bu süreç, hataların altta yatan nedenlerini anlamayı ve tekrarlanan kalıpları belirlemeyi amaçlayarak modelimizin sürekli iyileştirilmesini ve uyarlanabilirliğini sağlar. Bu bilgiler, modelin gelecekteki sürümlerini iyileştirmek için kullanılır.
Sınırlamalar
While our model achieves state-of-the-art results, no detection system is perfect, and our model can make mistakes, such as misclassifying a specific pixel set.
The AI Image Detector is specifically trained to identify manipulations from the latest generative AI tools. The system does not currently detect other common image alterations, including:
- Manual Edits: Changes made by a person using traditional photo editing software like Photoshop.
- Collages: Images created by combining parts of different authentic photos.
- Simple Filters & Adjustments: Applying photographic effects (e.g., “vintage,” black & white) or basic adjustments (e.g., sharpening, blurring, cropping).