KI-Videoerkennung ist jetzt live

Demo anfordern
Ressource

Bewertung der Genauigkeit des Copyleaks -KI-Detektors

Eine schrittweise Vorgehensweise

Wir sind überzeugt, dass es wichtiger denn je ist, die Genauigkeit des KI-Detektors, die Raten falsch positiver und falsch negativer Ergebnisse, Verbesserungspotenziale und weitere Aspekte vollständig transparent darzustellen, um eine verantwortungsvolle Nutzung und breite Akzeptanz zu gewährleisten. Diese umfassende Analyse soll die Testmethodik unseres KI-Detektors V10 vollständig transparent machen.

Testtermin: 16. Oktober 2025

Veröffentlichungsdatum: 12. November 2025

Getestetes Modell: V10

Methodik

Die Data-Science- und QA-Teams von Copyleaks führten unabhängig voneinander Tests durch, um unvoreingenommene und präzise Ergebnisse zu gewährleisten. Die Testdaten unterschieden sich von den Trainingsdaten und enthielten keine Inhalte, die zuvor dem KI-Detektor zur KI-Erkennung übermittelt worden waren.

Die Testdaten bestanden aus von Menschen verfassten Texten aus verifizierten Datensätzen und KI-generierten Texten verschiedener KI-Modelle. Der Test wurde mit der Copyleaks-API durchgeführt.

Kennzahlen

Zu den Kennzahlen gehören die Gesamtgenauigkeit, basierend auf der Rate korrekter und inkorrekter Textidentifizierung, sowie die ROC-AUC (Receiver Operating Characteristic – Fläche unter der Kurve), die die Trefferquote (TPR) und die Falsch-Positiv-Rate (FPR) untersucht. Weitere Kennzahlen sind der F1-Score, die Trefferquote (TNR) und Konfusionsmatrizen.

Ergebnisse

Tests bestätigen, dass der KI-Detektor eine hohe Erkennungsgenauigkeit bei der Unterscheidung zwischen von Menschen geschriebenem und KI-generiertem Text aufweist und gleichzeitig eine niedrige Falsch-Positiv-Rate beibehält.

Evaluierungsprozess

Durch die Nutzung eines zweigeteilten Systems haben wir unseren Evaluierungsprozess so gestaltet, dass höchste Qualität, Standards und Zuverlässigkeit gewährleistet sind. Zwei unabhängige Abteilungen – das Data-Science-Team und das QA-Team – evaluieren das Modell. Jede Abteilung arbeitet unabhängig mit ihren eigenen Evaluierungsdaten und -tools und hat keinen Zugriff auf den Evaluierungsprozess der anderen. Diese Trennung stellt sicher, dass die Evaluierungsergebnisse unvoreingenommen, objektiv und präzise sind und alle relevanten Dimensionen der Modellleistung erfassen. Darüber hinaus ist es wichtig zu erwähnen, dass die Testdaten von den Trainingsdaten getrennt sind und wir unsere Modelle ausschließlich mit neuen, bisher unbekannten Daten testen.

Methodik

Die QA- und Data-Science-Teams von Copyleaks haben unabhängig voneinander verschiedene Testdatensätze erstellt. Jeder Datensatz umfasst eine begrenzte Anzahl von Texten. Die erwartete Kennzeichnung – ein Indikator dafür, ob ein Text von einem Menschen oder von einer KI verfasst wurde – basiert auf der Datenquelle. Die von Menschen verfassten Texte stammen aus Publikationen vor dem Aufkommen moderner generativer KI-Systeme oder wurden später von anderen vertrauenswürdigen Quellen veröffentlicht und anschließend vom Team verifiziert. Die KI-generierten Texte wurden mithilfe verschiedener generativer KI-Modelle und -Techniken erstellt.

Die Tests wurden mit der Copyleaks-API durchgeführt. Wir überprüften, ob die Ausgabe der API für jeden Text anhand der Zielbezeichnung korrekt war, und aggregierten anschließend die Ergebnisse, um die Konfusionsmatrix zu berechnen.

Ergebnisse: Data-Science-Team

Das Data-Science-Team führte folgenden unabhängigen Test durch:

  • Die Texte waren in englischer Sprache verfasst. Insgesamt wurden 300.000 von Menschen geschriebene Texte und 200.000 KI-generierte Texte aus verschiedenen Sprachlernprogrammen getestet.
  • Die Textlängen variieren, aber die Datensätze enthalten nur Texte mit einer Länge von mehr als 350 Zeichen – dem Minimum, das unser Produkt akzeptiert.

Bewertungsmetriken

Die in dieser Textklassifizierungsaufgabe verwendeten Metriken sind:

1. Konfusionsmatrix: Eine Tabelle, die die TP (richtig positive Ergebnisse), FP (falsch positive Ergebnisse), TN (richtig negative Ergebnisse) und FN (falsch negative Ergebnisse) anzeigt.

2. Genauigkeit: Der Anteil der korrekten Ergebnisse (sowohl korrekt positive als auch korrekt negative) an der Gesamtzahl der überprüften Texte .

3. Trefferquote (TNR): Der Anteil der tatsächlich negativen Fälle, die alle negativen Vorhersagen sind .

Im Kontext der KI-gestützten Texterkennung bezeichnet TNR die Genauigkeit des Modells bei der Erkennung von Texten durch menschliche Nutzer.

4. (TPR), auch bekannt als Recall: Der Anteil der korrekt positiven Ergebnisse an allen tatsächlichen Vorhersagen.

Im Kontext der KI-gestützten Texterkennung bezeichnet TPR die Genauigkeit des Modells bei KI-generierten Texten.

5. F-Beta-Score: Das gewichtete harmonische Mittel aus Präzision und Trefferquote, wobei die Präzision stärker gewichtet wird (da wir eine niedrigere Falsch-Positiv-Rate anstreben).

Kombinierte KI- und menschliche Datensätze

Name des DatensatzesAnzahl der TexteAnzahl der menschlichen TexteAnzahl der KI-TexteTPRTNRF-beta(0,5)
Interne, besonders schwierige Datensätze, einschließlich Angriffe von Gegnern und Spezialwerkzeuge500,000300,000200,0000.9880.9990.997

Ergebnisse: QA-Team

Das QA-Team führte folgenden unabhängigen Test durch:

  • Die Sprache der Texte war Englisch, und insgesamt wurden 229.843 von Menschen verfasste Texte und 18.712 KI-generierte Texte aus verschiedenen LLMs getestet.
  • Die Textlängen variieren, aber die Datensätze enthalten nur Texte mit einer Länge von mehr als 350 Zeichen – dem Minimum, das unser Produkt akzeptiert.

Datensätze, die ausschließlich mit Menschen erstellt wurden

Name des DatensatzesAnzahl der TexteKorrekt als Mensch identifiziert.Fälschlicherweise als KI identifiziert.Genauigkeit
Allgemeine Texte9,9799,97901
Artikel, Nachrichten, Blogs, Social-Media-Beiträge9,9919,98290.9991
Datensatz Internetseiten99,92199,91830.9999
Schüleraufsätze10,0009,99820.9998
Wissenschaftliche Arbeiten99,95299,906460.9995
Gesamt:229,843229,783600.9997

Datensätze, die ausschließlich KI nutzen

Name des DatensatzesAnzahl der TexteFälschlicherweise als Mensch identifiziert.Korrekt als KI identifiziert.Genauigkeit
OpenAI-Familienmodelle – andere Modelle12,88012912,7510.9899
GPT-51,207111,1960.9909
Gemini-Familienmodelle1,97871,9710.9964
Claude-Familienmodelle1,07211,0710.9991
Grok-Familienmodelle1,57501,5751
Gesamt:18,71214818,5640.992

*Die Modellversionen können sich im Laufe der Zeit ändern. Die Texte wurden mit den jeweils verfügbaren Versionen der Modelle der oben genannten KI-Unternehmen generiert.

Empfindlichkeitsstufen

Seit Version 7.1 stehen drei Empfindlichkeitsstufen für das KI-Erkennungsmodell zur Verfügung. Hier sind die Testergebnisse für die Empfindlichkeitsstufen des Modells v10.

AUSWEISEmpfindlichkeitDefinitionFalsch-positive ErgebnisseFalsch-negative Ergebnisse
1Extra sicherEntwickelt, um Fehlalarme durch den Einsatz zusätzlicher KI-basierter Erkennungsfilter zu minimieren.

Gut geeignet zur Erkennung von KI-generiertem Text mit minimaler menschlicher Nachbearbeitung.
0.009%1.36%
2Ausgewogen (Standardeinstellung -
Dies ist die Version
das wird gezeigt in
(die oben genannten Ergebnisse)
Ideal zur Erkennung von KI-Inhalten bei gleichzeitiger Minimierung von Fehlalarmen.

Gut geeignet zur Erkennung von KI-generiertem Text mit einem moderaten Maß an menschlicher Modifikation.
0.026%0.79%
3Extra empfindlichUnser empfindlichstes Modell wurde entwickelt, um KI-Texte zu kennzeichnen, die durch einen „Humanizer“ oder Textspinner geleitet wurden.0.05%0.53%

Genauigkeit der korrekten positiven (KI-Texte) und korrekten negativen (menschliche Texte) Ergebnisse nach Sensitivitätsstufe

echte Positivewahre Negative
98.64%
99.99%
Minimale Anzahl falsch positiver Ergebnisse (Sensitivität 1)
99.21%
99.97%
Ausgewogen (Sensitivität 2)
99.47%
99.95%
Hochsensibel (Empfindlichkeit 3)
Empfindlichkeit

Textfehleranalyse durch Mensch und KI

Im Rahmen der Evaluierung identifizierten und analysierten wir fehlerhafte Bewertungen des Modells und erstellten einen detaillierten Bericht, der es dem Data-Science-Team ermöglicht, die zugrunde liegenden Ursachen zu beheben. Dies geschieht, ohne die fehlerhaften Bewertungen dem Data-Science-Team offenzulegen. Alle Fehler werden systematisch protokolliert und anhand ihrer Art und ihres Typs in einer Ursachenanalyse kategorisiert. Ziel dieser Analyse ist es, die zugrunde liegenden Ursachen zu verstehen und wiederkehrende Muster zu erkennen. Dieser Prozess ist kontinuierlich und gewährleistet so die ständige Verbesserung und Anpassungsfähigkeit unseres Modells.

Ein Beispiel für einen solchen Test ist unsere Analyse von Internetdaten aus dem Zeitraum 2013–2024 mithilfe unseres V4-Modells. Wir haben aus jedem Jahr, beginnend mit 2013, eine Million Texte als Stichprobe entnommen und dabei alle Fehlalarme aus dem Zeitraum 2013–2020, also vor der Veröffentlichung von KI-Systemen, berücksichtigt, um das Modell weiter zu verbessern.

02013
22014
32015
12016
02017
22018
12019
22020
342021
482022
5792023
15,1012024
Jahr

Ähnlich wie Forscher weltweit verschiedene KI-Detektorplattformen testen, um deren Leistungsfähigkeit und Grenzen zu ermitteln, ermutigen wir unsere Nutzer ausdrücklich zu Praxistests. Sobald neue Modelle veröffentlicht werden, werden wir die Testmethoden, die Genauigkeit und weitere wichtige Aspekte transparent darstellen.