Evaluación de la precisión del detector de IA Copyleaks
Una metodología paso a paso
Creemos que es más importante que nunca ser totalmente transparentes sobre la precisión del Detector de IA, las tasas de falsos positivos y falsos negativos, las áreas de mejora y otros aspectos para garantizar un uso y una adopción responsables. Este análisis exhaustivo tiene como objetivo garantizar la total transparencia en torno a la metodología de prueba del modelo V10 de nuestro Detector de IA.
Fecha de la prueba: 16 de octubre de 2025
Fecha de publicación: 12 de noviembre de 2025
Modelo probado: V10
Proceso de evaluación
Mediante un sistema de dos departamentos, hemos diseñado nuestro proceso de evaluación para garantizar la máxima calidad, los más altos estándares y la máxima fiabilidad. Contamos con dos departamentos independientes que evalúan el modelo: el de ciencia de datos y el de control de calidad. Cada departamento trabaja de forma independiente con sus propios datos y herramientas de evaluación, sin acceso al proceso del otro. Esta separación garantiza que los resultados de la evaluación sean imparciales, objetivos y precisos, abarcando todas las dimensiones posibles del rendimiento de nuestro modelo. Asimismo, es fundamental destacar que los datos de prueba se separan de los datos de entrenamiento, y que solo probamos nuestros modelos con datos nuevos que no hayan visto previamente.
Metodología
Los equipos de control de calidad y ciencia de datos de Copyleaks han recopilado de forma independiente diversos conjuntos de datos de prueba. Cada conjunto de datos consta de un número finito de textos. La etiqueta esperada —un indicador que señala si un texto específico fue escrito por un humano o por una IA— de cada conjunto de datos se determina en función de su origen. Los textos escritos por humanos se obtuvieron de textos publicados antes del auge de los sistemas modernos de IA generativa o posteriormente por otras fuentes fiables, que fueron verificadas por el equipo. Los textos generados por IA se crearon utilizando diversos modelos y técnicas de IA generativa.
Las pruebas se realizaron con la API de Copyleaks. Verificamos si la salida de la API era correcta para cada texto según la etiqueta objetivo y, a continuación, agregamos las puntuaciones para calcular la matriz de confusión.
Resultados: Equipo de Ciencia de Datos
El equipo de Ciencia de Datos realizó la siguiente prueba independiente:
- El idioma de los textos era el inglés, y se analizaron un total de 300.000 textos escritos por humanos y 200.000 textos generados por IA procedentes de diversos másteres jurídicos.
- La longitud de los textos varía, pero los conjuntos de datos contienen únicamente textos con una longitud superior a 350 caracteres, el mínimo que acepta nuestro producto.
Métricas de evaluación
Las métricas que se utilizan en esta tarea de clasificación de texto son:
1. Matriz de confusión: Una tabla que muestra los TP (verdaderos positivos), FP (falsos positivos), TN (verdaderos negativos) y FN (falsos negativos).
2. Precisión: La proporción de resultados verdaderos (tanto verdaderos positivos como verdaderos negativos) entre el número total de textos que fueron revisados.

3. Tasa de Verdaderos Negativos (TNR): La proporción de casos negativos reales que son todas predicciones negativas .

En el contexto de la detección mediante IA, TNR es la precisión del modelo en textos escritos por humanos.
4. (TPR) también conocido como Recall: La proporción de resultados verdaderos positivos en todas las predicciones reales.

En el contexto de la detección mediante IA, la TPR (Tasa de Verdaderos Probables) es la precisión del modelo en textos generados por IA.
5. Puntuación F-beta: La media armónica ponderada entre precisión y exhaustividad, dando mayor importancia a la precisión (ya que buscamos una menor tasa de falsos positivos).

Conjuntos de datos combinados de IA y humanos
| Nombre del conjunto de datos | Número de textos | Número de textos humanos | Número de textos de IA | TPR | TNR | F-beta(0.5) |
|---|---|---|---|---|---|---|
| Conjuntos de datos internos de extrema dificultad, incluidos ataques adversarios y herramientas especiales. | 500,000 | 300,000 | 200,000 | 0.988 | 0.999 | 0.997 |
Resultados: Equipo de control de calidad
El equipo de control de calidad realizó la siguiente prueba independiente:
- El idioma de los textos era el inglés, y se analizaron un total de 229.843 textos escritos por humanos y 18.712 textos generados por IA procedentes de diversos programas de maestría en derecho (LLM).
- La longitud de los textos varía, pero los conjuntos de datos contienen únicamente textos con una longitud superior a 350 caracteres, el mínimo que acepta nuestro producto.
Conjuntos de datos exclusivamente humanos
| Nombre del conjunto de datos | Número de textos | Identificado correctamente como humano | Identificado erróneamente como IA | Exactitud |
|---|---|---|---|---|
| Textos generales | 9,979 | 9,979 | 0 | 1 |
| Artículos, noticias, blogs, publicaciones en redes sociales | 9,991 | 9,982 | 9 | 0.9991 |
| Conjunto de datos de páginas web de Internet | 99,921 | 99,918 | 3 | 0.9999 |
| Ensayos de estudiantes | 10,000 | 9,998 | 2 | 0.9998 |
| Artículos académicos | 99,952 | 99,906 | 46 | 0.9995 |
| Total: | 229,843 | 229,783 | 60 | 0.9997 |
Conjuntos de datos exclusivamente de IA
| Nombre del conjunto de datos | Número de textos | Identificado erróneamente como humano | Identificado correctamente como IA | Exactitud |
|---|---|---|---|---|
| Modelos de la familia OpenAI - otros modelos | 12,880 | 129 | 12,751 | 0.9899 |
| GPT-5 | 1,207 | 11 | 1,196 | 0.9909 |
| Modelos de la familia Géminis | 1,978 | 7 | 1,971 | 0.9964 |
| Modelos de la familia Claude | 1,072 | 1 | 1,071 | 0.9991 |
| Modelos de la familia Grok | 1,575 | 0 | 1,575 | 1 |
| Total: | 18,712 | 148 | 18,564 | 0.992 |
*Las versiones de los modelos pueden cambiar con el tiempo. Los textos se generaron utilizando las versiones actuales disponibles de los modelos de las empresas de IA generativa mencionadas anteriormente.
Niveles de sensibilidad
Desde la versión 7.1, contamos con 3 niveles de sensibilidad para el modelo de detección de IA. A continuación, se muestran los resultados de las pruebas para los niveles de sensibilidad del modelo v10.
| IDENTIFICACIÓN | Sensibilidad | Definición | Falsos positivos | Falsos negativos |
|---|---|---|---|---|
| 1 | Extra seguro | Diseñado para minimizar los falsos positivos mediante el uso de filtros adicionales basados en la detección por IA. Ideal para detectar texto generado por IA con mínima modificación humana. | 0.009% | 1.36% |
| 2 | Equilibrado (predeterminado - Esta es la versión que se muestra en los resultados anteriores) | Ideal para detectar contenido de IA minimizando los falsos positivos. Útil para detectar texto generado por IA con una cantidad moderada de modificación humana. | 0.026% | 0.79% |
| 3 | Extra sensible | Nuestro modelo más sensible fue diseñado para detectar texto generado por IA que hubiera sido procesado mediante un "humanizador" o un generador de texto. | 0.05% | 0.53% |
Precisión de los verdaderos positivos (textos generados por IA) y los verdaderos negativos (textos generados por humanos) según el nivel de sensibilidad.
Análisis de errores de texto humanos y de IA
Durante el proceso de evaluación, identificamos y analizamos las evaluaciones incorrectas del modelo y creamos un informe detallado que permitirá al equipo de ciencia de datos corregir las causas subyacentes. Esto se realiza sin exponer las evaluaciones incorrectas al equipo de ciencia de datos. Todos los errores se registran sistemáticamente y se clasifican según su naturaleza en un proceso de análisis de causa raíz, cuyo objetivo es comprender las causas subyacentes e identificar patrones recurrentes. Este proceso es continuo, lo que garantiza la mejora constante y la adaptabilidad de nuestro modelo a lo largo del tiempo.
Un ejemplo de este tipo de prueba es nuestro análisis de datos de internet desde 2013 hasta 2024 utilizando nuestro modelo V4. Tomamos muestras de 1 millón de textos de cada año, comenzando en 2013, utilizando los falsos positivos detectados entre 2013 y 2020, antes del lanzamiento de los sistemas de IA, para ayudar a mejorar aún más el modelo.
De forma similar a como investigadores de todo el mundo han probado y siguen probando diferentes plataformas de detección de IA para evaluar sus capacidades y limitaciones, animamos a nuestros usuarios a realizar pruebas en situaciones reales. A medida que se lancen nuevos modelos, seguiremos compartiendo las metodologías de prueba, la precisión y otras consideraciones importantes a tener en cuenta.