Bewertung der Genauigkeit des Copyleaks -KI-Detektors
Eine schrittweise Vorgehensweise
Wir sind überzeugt, dass es wichtiger denn je ist, die Genauigkeit des KI-Detektors, die Raten falsch positiver und falsch negativer Ergebnisse, Verbesserungspotenziale und weitere Aspekte vollständig transparent darzustellen, um eine verantwortungsvolle Nutzung und breite Akzeptanz zu gewährleisten. Diese umfassende Analyse soll die Testmethodik unseres KI-Detektors V10 vollständig transparent machen.
Testtermin: 16. Oktober 2025
Veröffentlichungsdatum: 12. November 2025
Getestetes Modell: V10
Evaluierungsprozess
Durch die Nutzung eines zweigeteilten Systems haben wir unseren Evaluierungsprozess so gestaltet, dass höchste Qualität, Standards und Zuverlässigkeit gewährleistet sind. Zwei unabhängige Abteilungen – das Data-Science-Team und das QA-Team – evaluieren das Modell. Jede Abteilung arbeitet unabhängig mit ihren eigenen Evaluierungsdaten und -tools und hat keinen Zugriff auf den Evaluierungsprozess der anderen. Diese Trennung stellt sicher, dass die Evaluierungsergebnisse unvoreingenommen, objektiv und präzise sind und alle relevanten Dimensionen der Modellleistung erfassen. Darüber hinaus ist es wichtig zu erwähnen, dass die Testdaten von den Trainingsdaten getrennt sind und wir unsere Modelle ausschließlich mit neuen, bisher unbekannten Daten testen.
Methodik
Die QA- und Data-Science-Teams von Copyleaks haben unabhängig voneinander verschiedene Testdatensätze erstellt. Jeder Datensatz umfasst eine begrenzte Anzahl von Texten. Die erwartete Kennzeichnung – ein Indikator dafür, ob ein Text von einem Menschen oder von einer KI verfasst wurde – basiert auf der Datenquelle. Die von Menschen verfassten Texte stammen aus Publikationen vor dem Aufkommen moderner generativer KI-Systeme oder wurden später von anderen vertrauenswürdigen Quellen veröffentlicht und anschließend vom Team verifiziert. Die KI-generierten Texte wurden mithilfe verschiedener generativer KI-Modelle und -Techniken erstellt.
Die Tests wurden mit der Copyleaks-API durchgeführt. Wir überprüften, ob die Ausgabe der API für jeden Text anhand der Zielbezeichnung korrekt war, und aggregierten anschließend die Ergebnisse, um die Konfusionsmatrix zu berechnen.
Ergebnisse: Data-Science-Team
Das Data-Science-Team führte folgenden unabhängigen Test durch:
- Die Texte waren in englischer Sprache verfasst. Insgesamt wurden 300.000 von Menschen geschriebene Texte und 200.000 KI-generierte Texte aus verschiedenen Sprachlernprogrammen getestet.
- Die Textlängen variieren, aber die Datensätze enthalten nur Texte mit einer Länge von mehr als 350 Zeichen – dem Minimum, das unser Produkt akzeptiert.
Bewertungsmetriken
Die in dieser Textklassifizierungsaufgabe verwendeten Metriken sind:
1. Konfusionsmatrix: Eine Tabelle, die die TP (richtig positive Ergebnisse), FP (falsch positive Ergebnisse), TN (richtig negative Ergebnisse) und FN (falsch negative Ergebnisse) anzeigt.
2. Genauigkeit: Der Anteil der korrekten Ergebnisse (sowohl korrekt positive als auch korrekt negative) an der Gesamtzahl der überprüften Texte .

3. Trefferquote (TNR): Der Anteil der tatsächlich negativen Fälle, die alle negativen Vorhersagen sind .

Im Kontext der KI-gestützten Texterkennung bezeichnet TNR die Genauigkeit des Modells bei der Erkennung von Texten durch menschliche Nutzer.
4. (TPR), auch bekannt als Recall: Der Anteil der korrekt positiven Ergebnisse an allen tatsächlichen Vorhersagen.

Im Kontext der KI-gestützten Texterkennung bezeichnet TPR die Genauigkeit des Modells bei KI-generierten Texten.
5. F-Beta-Score: Das gewichtete harmonische Mittel aus Präzision und Trefferquote, wobei die Präzision stärker gewichtet wird (da wir eine niedrigere Falsch-Positiv-Rate anstreben).

Kombinierte KI- und menschliche Datensätze
| Name des Datensatzes | Anzahl der Texte | Anzahl der menschlichen Texte | Anzahl der KI-Texte | TPR | TNR | F-beta(0,5) |
|---|---|---|---|---|---|---|
| Interne, besonders schwierige Datensätze, einschließlich Angriffe von Gegnern und Spezialwerkzeuge | 500,000 | 300,000 | 200,000 | 0.988 | 0.999 | 0.997 |
Ergebnisse: QA-Team
Das QA-Team führte folgenden unabhängigen Test durch:
- Die Sprache der Texte war Englisch, und insgesamt wurden 229.843 von Menschen verfasste Texte und 18.712 KI-generierte Texte aus verschiedenen LLMs getestet.
- Die Textlängen variieren, aber die Datensätze enthalten nur Texte mit einer Länge von mehr als 350 Zeichen – dem Minimum, das unser Produkt akzeptiert.
Datensätze, die ausschließlich mit Menschen erstellt wurden
| Name des Datensatzes | Anzahl der Texte | Korrekt als Mensch identifiziert. | Fälschlicherweise als KI identifiziert. | Genauigkeit |
|---|---|---|---|---|
| Allgemeine Texte | 9,979 | 9,979 | 0 | 1 |
| Artikel, Nachrichten, Blogs, Social-Media-Beiträge | 9,991 | 9,982 | 9 | 0.9991 |
| Datensatz Internetseiten | 99,921 | 99,918 | 3 | 0.9999 |
| Schüleraufsätze | 10,000 | 9,998 | 2 | 0.9998 |
| Wissenschaftliche Arbeiten | 99,952 | 99,906 | 46 | 0.9995 |
| Gesamt: | 229,843 | 229,783 | 60 | 0.9997 |
Datensätze, die ausschließlich KI nutzen
| Name des Datensatzes | Anzahl der Texte | Fälschlicherweise als Mensch identifiziert. | Korrekt als KI identifiziert. | Genauigkeit |
|---|---|---|---|---|
| OpenAI-Familienmodelle – andere Modelle | 12,880 | 129 | 12,751 | 0.9899 |
| GPT-5 | 1,207 | 11 | 1,196 | 0.9909 |
| Gemini-Familienmodelle | 1,978 | 7 | 1,971 | 0.9964 |
| Claude-Familienmodelle | 1,072 | 1 | 1,071 | 0.9991 |
| Grok-Familienmodelle | 1,575 | 0 | 1,575 | 1 |
| Gesamt: | 18,712 | 148 | 18,564 | 0.992 |
*Die Modellversionen können sich im Laufe der Zeit ändern. Die Texte wurden mit den jeweils verfügbaren Versionen der Modelle der oben genannten KI-Unternehmen generiert.
Empfindlichkeitsstufen
Seit Version 7.1 stehen drei Empfindlichkeitsstufen für das KI-Erkennungsmodell zur Verfügung. Hier sind die Testergebnisse für die Empfindlichkeitsstufen des Modells v10.
| AUSWEIS | Empfindlichkeit | Definition | Falsch-positive Ergebnisse | Falsch-negative Ergebnisse |
|---|---|---|---|---|
| 1 | Extra sicher | Entwickelt, um Fehlalarme durch den Einsatz zusätzlicher KI-basierter Erkennungsfilter zu minimieren. Gut geeignet zur Erkennung von KI-generiertem Text mit minimaler menschlicher Nachbearbeitung. | 0.009% | 1.36% |
| 2 | Ausgewogen (Standardeinstellung - Dies ist die Version das wird gezeigt in (die oben genannten Ergebnisse) | Ideal zur Erkennung von KI-Inhalten bei gleichzeitiger Minimierung von Fehlalarmen. Gut geeignet zur Erkennung von KI-generiertem Text mit einem moderaten Maß an menschlicher Modifikation. | 0.026% | 0.79% |
| 3 | Extra empfindlich | Unser empfindlichstes Modell wurde entwickelt, um KI-Texte zu kennzeichnen, die durch einen „Humanizer“ oder Textspinner geleitet wurden. | 0.05% | 0.53% |
Genauigkeit der korrekten positiven (KI-Texte) und korrekten negativen (menschliche Texte) Ergebnisse nach Sensitivitätsstufe
Textfehleranalyse durch Mensch und KI
Im Rahmen der Evaluierung identifizierten und analysierten wir fehlerhafte Bewertungen des Modells und erstellten einen detaillierten Bericht, der es dem Data-Science-Team ermöglicht, die zugrunde liegenden Ursachen zu beheben. Dies geschieht, ohne die fehlerhaften Bewertungen dem Data-Science-Team offenzulegen. Alle Fehler werden systematisch protokolliert und anhand ihrer Art und ihres Typs in einer Ursachenanalyse kategorisiert. Ziel dieser Analyse ist es, die zugrunde liegenden Ursachen zu verstehen und wiederkehrende Muster zu erkennen. Dieser Prozess ist kontinuierlich und gewährleistet so die ständige Verbesserung und Anpassungsfähigkeit unseres Modells.
Ein Beispiel für einen solchen Test ist unsere Analyse von Internetdaten aus dem Zeitraum 2013–2024 mithilfe unseres V4-Modells. Wir haben aus jedem Jahr, beginnend mit 2013, eine Million Texte als Stichprobe entnommen und dabei alle Fehlalarme aus dem Zeitraum 2013–2020, also vor der Veröffentlichung von KI-Systemen, berücksichtigt, um das Modell weiter zu verbessern.
Ähnlich wie Forscher weltweit verschiedene KI-Detektorplattformen testen, um deren Leistungsfähigkeit und Grenzen zu ermitteln, ermutigen wir unsere Nutzer ausdrücklich zu Praxistests. Sobald neue Modelle veröffentlicht werden, werden wir die Testmethoden, die Genauigkeit und weitere wichtige Aspekte transparent darstellen.