Valutazione dell'accuratezza del rilevatore di Copyleaks basato sull'intelligenza artificiale
Una metodologia passo passo
Riteniamo che sia più importante che mai essere completamente trasparenti sull'accuratezza del nostro Rilevatore di IA, sui tassi di falsi positivi e falsi negativi, sulle aree di miglioramento e altro ancora, al fine di garantirne un utilizzo e un'adozione responsabili. Questa analisi completa mira a garantire la massima trasparenza in merito alla metodologia di test del modello V11 del nostro Rilevatore di IA.
Data del test: 10 settembre 2026
Data di pubblicazione: 28 settembre 2026
Modello testato: V11
Processo di valutazione
Utilizzando un sistema a due dipartimenti, abbiamo progettato il nostro processo di valutazione per garantire qualità, standard e affidabilità di altissimo livello. Due dipartimenti indipendenti si occupano della valutazione del modello: il team di data science e il team di QA. Ciascun dipartimento lavora in modo autonomo con i propri dati e strumenti di valutazione e non ha accesso al processo di valutazione dell'altro. Questa separazione garantisce che i risultati della valutazione siano imparziali, oggettivi e accurati, cogliendo al contempo tutte le possibili dimensioni delle prestazioni del nostro modello. È inoltre fondamentale sottolineare che i dati di test sono separati dai dati di training e che testiamo i nostri modelli solo su nuovi dati mai visti prima.
Metodologia
I team di QA e Data Science di Copyleaks hanno raccolto in modo indipendente diversi set di dati di test. Ogni set di dati di test è composto da un numero finito di testi. L'etichetta prevista, ovvero un indicatore che specifica se un determinato testo è stato scritto da un essere umano o da un'intelligenza artificiale, per ciascun set di dati viene determinata in base alla fonte dei dati. I testi scritti da esseri umani sono stati raccolti da testi pubblicati prima dell'avvento dei moderni sistemi di intelligenza artificiale generativa o successivamente da altre fonti affidabili, a loro volta verificate dal team. I testi generati dall'IA sono stati creati utilizzando una varietà di modelli e tecniche di intelligenza artificiale generativa.
I test sono stati eseguiti utilizzando l'API di Copyleaks. Abbiamo verificato la correttezza dell'output dell'API per ciascun testo in base all'etichetta di destinazione e abbiamo quindi aggregato i punteggi per calcolare la matrice di confusione.
Risultati: Team di Data Science
Il team di Data Science ha condotto il seguente test indipendente:
- La lingua dei testi era l'inglese e, in totale, sono stati testati 300.000 testi scritti da esseri umani e 200.000 testi generati dall'intelligenza artificiale provenienti da diversi LLM.
- La lunghezza dei testi varia, ma i set di dati contengono solo testi con una lunghezza superiore a 350 caratteri, ovvero il minimo accettato dal nostro prodotto.
Metriche di valutazione
Le metriche utilizzate in questo compito di classificazione del testo sono:
1. Matrice di confusione: una tabella che mostra i TP (veri positivi), i FP (falsi positivi), i TN (veri negativi) e gli FN (falsi negativi).
2. Accuratezza: la proporzione di risultati veri (sia veri positivi che veri negativi) rispetto al numero totale di testi controllati.

3. Tasso di veri negativi (TNR): la proporzione di casi negativi effettivi che corrispondono a tutte le previsioni negative .

Nel contesto del rilevamento tramite intelligenza artificiale, il TNR (Total Number Ratio) rappresenta l'accuratezza del modello sui testi umani.
4. (TPR) noto anche come Recall: la proporzione di risultati veri positivi su tutte le previsioni effettive.

Nel contesto del rilevamento tramite IA, il TPR (Total Physical Response) rappresenta l'accuratezza del modello sui testi generati dall'IA.
5. Punteggio F-beta: la media armonica ponderata tra precisione e richiamo, che privilegia la precisione (poiché vogliamo favorire un tasso di falsi positivi inferiore).

Combinazione di dati di intelligenza artificiale e dati umani.
| Nome del set di dati | Numero di testi | Numero di testi umani | Numero di testi IA | TPR | TNR | F-beta(0,5) |
|---|---|---|---|---|---|---|
| Set di dati interni estremamente difficili, inclusi attacchi avversari e strumenti speciali | 500,000 | 300,000 | 200,000 | 0.989 | 0.999 | 0.998 |
Risultati: Team QA
Il team di controllo qualità ha condotto il seguente test indipendente:
- La lingua dei testi era l'inglese e, in totale, sono stati testati 326.120 testi scritti da esseri umani e 128.225 testi generati dall'intelligenza artificiale provenienti da diversi LLM.
- La lunghezza dei testi varia, ma i set di dati contengono solo testi con una lunghezza superiore a 350 caratteri, ovvero il minimo accettato dal nostro prodotto.
Set di dati composti esclusivamente da esseri umani
| Categoria | Testi totali | Corretti (umano) | Errati (IA) | Precisione |
|---|---|---|---|---|
| Testi generali | 50,720 | 50,603 | 117 | 0.9977 |
| Articoli, notizie, blog, post sui social | 115,893 | 115,065 | 828 | 0.9929 |
| Set di dati delle pagine web Internet | 33,530 | 33,503 | 27 | 0.9992 |
| Saggi degli studenti | 74,212 | 74,206 | 6 | 0.9999 |
| Articoli accademici | 51,765 | 51,750 | 15 | 0.9997 |
| Totale: | 326,120 | 325,127 | 923 | 0.9970 |
Set di dati creati esclusivamente tramite intelligenza artificiale
| Nome del set di dati | Numero di testi | Identificato erroneamente come umano | Identificato correttamente come IA | Precisione |
|---|---|---|---|---|
| Modelli della famiglia Claude | 49,490 | 85 | 49,405 | 0.9983 |
| Modelli della famiglia Gemini | 20,000 | 200 | 19,800 | 0.9900 |
| Modelli della famiglia Grok | 10,000 | 128 | 9,872 | 0.9872 |
| Modelli della famiglia OpenAI | 48,735 | 413 | 48,322 | 0.9915 |
| Totale: | 128,225 | 826 | 127,399 | 0.9936 |
*Le versioni dei modelli possono cambiare nel tempo. I testi sono stati generati utilizzando le versioni correnti disponibili dei modelli delle suddette aziende di intelligenza artificiale generativa.
Livelli di sensibilità
Dalla versione 7.1 sono disponibili 3 livelli di sensibilità per il modello di rilevamento basato sull'IA. Ecco i risultati dei test per i livelli di sensibilità del modello v11.
| ID | Sensibilità | Definizione | Falsi positivi | Falsi negativi |
|---|---|---|---|---|
| 1 | Sicurezza extra | Progettato per ridurre al minimo i falsi positivi grazie all'utilizzo di filtri aggiuntivi basati sull'intelligenza artificiale per il rilevamento. Ideale per rilevare testi generati dall'IA con una minima modifica umana. | 0.16% | 0.88% |
| 2 | Bilanciato (predefinito - questa è la versione che viene mostrato in risultati sopra riportati) | Ideale per rilevare contenuti generati dall'IA riducendo al minimo i falsi positivi. Ideale per rilevare testi generati dall'intelligenza artificiale con una moderata quantità di modifiche umane. | 0.30% | 0.64% |
| 3 | Extra sensibile | Il nostro modello più sensibile è stato progettato per individuare i testi generati dall'IA che erano stati sottoposti a un processo di "umanizzazione" o a uno strumento di riscrittura automatica del testo. | 0.66% | 0.49% |
Accuratezza dei veri positivi (testi generati dall'IA) e dei veri negativi (testi generati da esseri umani) in base al livello di sensibilità.
Analisi degli errori di testo tramite intervento umano e intelligenza artificiale
Durante il processo di valutazione, abbiamo identificato e analizzato le valutazioni errate effettuate dal modello e creato un report dettagliato che consentirà al team di data science di correggerne le cause sottostanti. Questo viene fatto senza che il team di data science venga a conoscenza delle valutazioni errate. Tutti gli errori vengono sistematicamente registrati e categorizzati in base alla loro natura e al loro carattere in un "processo di analisi delle cause profonde", che mira a comprendere le cause sottostanti e a identificare schemi ricorrenti. Questo processo è in continua evoluzione, garantendo un miglioramento costante e l'adattabilità del nostro modello nel tempo.
Un esempio di tale test è la nostra analisi dei dati internet dal 2013 al 2024 utilizzando il nostro modello V4. Abbiamo campionato 1 milione di testi per ogni anno, a partire dal 2013, utilizzando tutti i falsi positivi rilevati dal 2013 al 2020, prima del rilascio dei sistemi di intelligenza artificiale, per contribuire a migliorare ulteriormente il modello.
Analogamente a quanto fatto e tuttora in corso, i ricercatori di tutto il mondo testano diverse piattaforme di rilevamento basate sull'intelligenza artificiale per valutarne capacità e limiti, incoraggiamo vivamente i nostri utenti a condurre test in contesti reali. Inoltre, con il rilascio di nuovi modelli, continueremo a condividere le metodologie di test, l'accuratezza e altre considerazioni importanti da tenere presenti.