KI-Videoerkennung ist jetzt live

Demo anfordern

Bewertung der Genauigkeit des Copyleaks-KI-Bilddetektors

Eine schrittweise Vorgehensweise

Wir sind überzeugt, dass es wichtiger denn je ist, die Genauigkeit des KI-Bilddetektors vollständig transparent darzustellen, einschließlich der Raten falsch positiver und falsch negativer Ergebnisse sowie der Bereiche mit Verbesserungspotenzial, um eine verantwortungsvolle Nutzung und breite Akzeptanz zu gewährleisten. Diese umfassende Analyse zielt darauf ab, vollständige Transparenz hinsichtlich unserer Testmethodik für das KI-Bilddetektor-Modell V1.1 zu schaffen.

Unser Modell ist darauf ausgelegt, KI-manipulierte Bildbereiche durch die Überlagerung der erkannten Bereiche zu identifizieren. Tests bestätigen, dass der KI-Bilddetektor eine hohe Erkennungsgenauigkeit bei der Unterscheidung zwischen authentischen Fotos von Menschen und KI-generierten oder KI-manipulierten Bildern erreicht und gleichzeitig eine extrem niedrige Falsch-Positiv-Rate aufweist.

Testtermin: 1. Februar 2026

Veröffentlichungsdatum: 15. Februar 2026

Getestetes Modell: V1.1

Methodik

Durch die Anwendung eines Zwei-Team-Systems haben wir unseren Evaluierungsprozess so gestaltet, dass höchste Qualität, Standards und Zuverlässigkeit gewährleistet sind. Zwei unabhängige Abteilungen – das Data-Science-Team und das QA-Team – evaluieren das Modell. Jedes Team arbeitet unabhängig mit eigenen Evaluierungsdaten und -tools und hat keinen Zugriff auf den Evaluierungsprozess des anderen Teams. Diese Trennung garantiert unvoreingenommene, objektive und präzise Evaluierungsergebnisse. Wichtig ist auch, dass alle Testdaten strikt von den Trainingsdaten getrennt sind; wir testen unsere Modelle ausschließlich mit neuen Bildern, die noch nie mit unserem KI-Bilddetektor interagiert haben. Um sicherzustellen, dass unsere Tests relevant und anspruchsvoll bleiben, aktualisieren wir unsere Evaluierungsdatensätze kontinuierlich und integrieren Bilder, die von den neuesten GenAI-Modellen generiert wurden.

Konstruktion der Testsets

Für jede neue Modellveröffentlichung erstellen die QA- und Data-Science-Teams von Copyleaks unabhängig voneinander verschiedene Testdatensätze. Jeder Datensatz besteht aus einer begrenzten Anzahl von Bildern mit einer erwarteten Kennzeichnung, die deren Herkunft angibt. Die Datensätze sind in zwei Kategorien unterteilt:

  • Vollständig menschlich: Authentische Bilder, die mit einer Kamera aufgenommen und nicht durch generative KI verändert wurden. Diese stammen aus verifizierten Datensätzen oder wurden manuell erstellt.

  • Vollständig KI: Bilder, die vollständig von modernsten KI-Modellen generiert werden.

Mithilfe einer Vielzahl generativer KI-Modelle wurden KI-generierte Bilder erstellt. Die Tests wurden mit der Copyleaks-API durchgeführt, und die Ergebnisse wurden aggregiert, um die Leistung des Modells zu berechnen.

Die Auswertung erfolgte ausschließlich anhand von Bildern, die folgende technische Anforderungen erfüllen: eine Mindestgröße von 512×512 Pixeln, eine Dateigröße unter 32 MB und eine Auflösung unter 16 Megapixeln, wie in der Dokumentation definiert.

Bewertungsmetriken

Das Produkt erstellt eine Vorhersage in Form einer Überlagerung der KI-generierten Segmente. Die Gesamtleistung wird anschließend anhand der Genauigkeit bewertet, mit der das Modell die Bilder gemäß ihrer tatsächlichen Kategorie klassifiziert.

Leistungskennzahlen nach Bildtyp

To provide a clear and robust measure of accuracy, we use different pixel-level metrics depending on the type of image being tested:

  • For Human Images: The key metric is the pixel-level False Positive Rate (FPR). For an image to be considered a successful detection (True Negative), the percentage of pixels incorrectly flagged as “AI” must be less than 5%. This stringent threshold ensures the model avoids falsely accusing authentic images.

  • For AI Images: The primary metric is the pixel-level True Positive Rate (TPR). For an image to be considered a successful detection (True Positive), the percentage of pixels correctly identified as “AI” must be greater than 95%. This ensures the model comprehensively recognizes fully generated content.

Aggregierte Berichtsmetriken

The overall accuracy figures presented in the Results tables, such as TNR (Human Accuracy) and TPR (AI), are aggregated from these pixel-level success criteria. For example, the TNR is the percentage of all tested human images that successfully met the <5% false positive pixel threshold.

Ergebnisse

Data Science Team Test

Das Data-Science-Team führte den folgenden unabhängigen Test an einem großen, vielfältigen Datensatz durch, der Bilder mit unterschiedlichen Auflösungen, Aufnahmegeräten, Bildgeneratoren und Inhaltstypen enthielt.

Name des DatensatzesBilder von Menschen (n=31.374)KI-Bilder (n=33.947)
Genauigkeit98.6%97.6%

QA-Team-Test

Das QA-Team führte einen unabhängigen Test mit Bildern durch, die speziell für die Evaluierung nach dem Training des Modells erstellt wurden. Der Testdatensatz umfasst Bilder unterschiedlicher Auflösungen, die mit verschiedenen Geräten aufgenommen, von verschiedenen Bildgeneratoren erzeugt wurden und verschiedene Inhaltstypen aufweisen.

Name des DatensatzesBilder von Menschen (n=10.000)KI-Bilder (n=10.000)
Genauigkeit99.3%98%

Fehleranalyse

Im Rahmen des Evaluierungsprozesses identifizieren und analysieren wir fehlerhafte Bewertungen, damit das Data-Science-Team die zugrunde liegenden Ursachen beheben kann. Alle Fehler werden systematisch erfasst und anhand ihrer Art und ihres Typs in einer Ursachenanalyse kategorisiert. Ziel dieses Prozesses ist es, die Fehlerursachen zu verstehen und wiederkehrende Muster zu erkennen, um die kontinuierliche Verbesserung und Anpassungsfähigkeit unseres Modells zu gewährleisten. Diese Erkenntnisse werden genutzt, um zukünftige Versionen des Modells zu optimieren.

Einschränkungen

Unser Modell erzielt zwar Ergebnisse auf dem neuesten Stand der Technik, aber kein Erkennungssystem ist perfekt, und auch unser Modell kann Fehler machen, wie zum Beispiel eine Fehlklassifizierung einer bestimmten Pixelgruppe.

Der KI-Bilddetektor ist speziell darauf trainiert, Manipulationen durch die neuesten generativen KI-Tools zu erkennen . Das System erkennt derzeit keine anderen gängigen Bildveränderungen, darunter:

  • Manuelle Bearbeitungen: Änderungen, die von einer Person mithilfe herkömmlicher Bildbearbeitungssoftware wie Photoshop vorgenommen werden.

  • Collagen: Bilder, die durch die Kombination von Teilen verschiedener authentischer Fotos entstehen.

  • Einfache Filter & Anpassungen: Anwenden von fotografischen Effekten (z. B. „Vintage“, Schwarzweiß) oder grundlegenden Anpassungen (z. B. Schärfen, Weichzeichnen, Beschneiden).