AI视频检测功能现已上线

获取演示
资源

评估 Copyleaks AI 检测器的准确性

循序渐进的方法

我们认为,为了确保人工智能检测器得到负责任的使用和推广,充分透明地披露其准确率、误报率和漏报率、需要改进的方面等信息比以往任何时候都更加重要。这份全面的分析旨在确保我们人工智能检测器V10模型测试方法的完全透明。

测试日期: 2025年10月16日

发布日期: 2025年11月12日

测试型号: V10

方法论

Copyleaks 的数据科学和质量保证团队独立进行了测试,以确保结果的公正性和准确性。测试数据与训练数据不同,且不包含任何之前提交给 AI 检测器进行 AI 检测的内容。

测试数据包括来自已验证数据集的人工撰写文本和来自各种人工智能模型的AI生成文本。该测试使用Copyleaks API执行。

指标

评价指标包括总体准确率(基于正确和错误文本识别率)和 ROC-AUC(受试者工作特征曲线下面积),后者用于评估真阳性率 (TPR) 和假阳性率 (FPR)。其他指标还包括 F1 分数、真阴性率 (TNR) 和混淆矩阵。

结果

测试验证了人工智能检测器在区分人类编写的文本和人工智能生成的文本方面表现出较高的检测准确率,同时保持了较低的误报率。

评估过程

我们采用双部门体系,精心设计了评估流程,以确保模型达到最高质量、标准和可靠性。我们有两个独立的部门负责评估模型:数据科学团队和质量保证团队。每个部门独立使用各自的评估数据和工具,互不接触其他部门的评估流程。这种分离确保了评估结果的公正性、客观性和准确性,并能全面反映模型的性能。此外,需要特别注意的是,测试数据与训练数据完全分离,我们只使用模型之前从未接触过的新数据进行测试。

方法论

Copyleaks 的质量保证和数据科学团队独立收集了各种测试数据集。每个测试数据集都包含有限数量的文本。每个数据集的预期标签(用于指示特定文本是由人类撰写还是由人工智能撰写)是根据数据来源确定的。人类撰写的文本来自现代生成式人工智能系统出现之前发布的文本,或来自其他可信来源的后续文本,这些文本均经过团队的再次验证。人工智能生成的文本则使用各种生成式人工智能模型和技术生成。

我们使用 Copyleaks API 执行了这些测试。我们根据目标标签检查了 API 对每段文本的输出是否正确,然后汇总得分以计算混淆矩阵。

结果:数据科学团队

数据科学团队进行了以下独立测试:

  • 文本语言为英语,总共测试了 30 万篇人工撰写的文本和 20 万篇来自各种 LLM 的 AI 生成的文本。
  • 文本长度各不相同,但数据集仅包含长度大于 350 个字符的文本——这是我们的产品接受的最小长度。

评估指标

本文本分类任务中使用的指标有:

1. 混淆矩阵:一个显示 TP(真阳性)、FP(假阳性)、TN(真阴性)和 FN(假阴性)的表格。

2. 准确率:在所检查的文本总数中,真实结果(包括真阳性和真阴性)所占的比例。

3.真阴性率 (TNR):实际阴性实例中所有阴性预测值所占的比例。

在人工智能检测领域,TNR 是模型对人类文本的准确率。

4. (TPR)也称为召回率:所有实际预测结果中真正结果所占的比例。

在人工智能检测领域,TPR 是模型对人工智能生成的文本的准确率。

5. F-beta 分数:精确率和召回率的加权调和平均值,更侧重于精确率(因为我们希望降低假阳性率)。

人工智能与人类数据集的结合

数据集名称文本数量人类文本数量人工智能文本数量TPRTNRF-beta(0.5)
内部超难数据集,包括对抗性攻击和特殊工具500,000300,000200,0000.9880.9990.997

结果:质量保证团队

质量保证团队进行了以下独立测试:

  • 文本语言为英语,总共测试了 229,843 篇人工撰写的文本和 18,712 篇来自不同语言学习模型的 AI 生成的文本。
  • 文本长度各不相同,但数据集仅包含长度大于 350 个字符的文本——这是我们的产品接受的最小长度。

仅限人类的数据集

数据集名称文本数量正确识别为人类被错误地识别为人工智能准确性
一般文本9,9799,97901
文章、新闻、博客、社交媒体帖子9,9919,98290.9991
互联网网页数据集99,92199,91830.9999
学生作文10,0009,99820.9998
学术论文99,95299,906460.9995
全部的:229,843229,783600.9997

仅限人工智能的数据集

数据集名称文本数量被错误地识别为人类被正确识别为人工智能准确性
OpenAI 系列模型 - 其他模型12,88012912,7510.9899
GPT-51,207111,1960.9909
双子座家族模型1,97871,9710.9964
克劳德家族模型1,07211,0710.9991
Grok家族模型1,57501,5751
全部的:18,71214818,5640.992

*模型版本可能会随时间变化。文本是使用上述生成式人工智能公司提供的最新版本模型生成的。

敏感度水平

自 v7.1 版本起,我们的 AI 检测模型提供了 3 个灵敏度级别。以下是模型 v10 各灵敏度级别的测试结果。

ID敏感性定义假阳性假阴性
1格外安全旨在通过使用额外的基于人工智能检测的过滤器来最大限度地减少误报。

适用于检测几乎无需人工修改的 AI 生成文本。
0.009%1.36%
2平衡(默认值 -
这是版本
这表明
(以上结果)
非常适合检测人工智能内容,同时最大限度地减少误报。

适用于检测经过适度人工修改的 AI 生成文本。
0.026%0.79%
3超敏感我们最灵敏的模型旨在标记经过“人性化”或文本转换工具处理的 AI 文本。0.05%0.53%

按敏感度级别划分的真阳性(AI文本)和真阴性(人工文本)准确率

真阳性真阴性
98.64%
99.99%
最小假阳性率(灵敏度 1)
99.21%
99.97%
平衡型(敏感度 2)
99.47%
99.95%
超敏感(敏感度 3)
敏感性

人类和人工智能文本错误分析

在评估过程中,我们识别并分析了模型做出的错误评估,并生成了一份详细报告,以便数据科学团队能够纠正根本原因。整个过程不会让数据科学团队直接接触到这些错误评估结果。所有错误都会被系统地记录,并根据其性质和特点进行分类,这一过程被称为“根本原因分析流程”。该流程旨在了解根本原因并识别重复出现的模式。此流程持续进行,确保我们的模型能够随着时间的推移不断改进并保持适应性。

例如, 我们使用V4模型分析了2013年至2024年的互联网数据。我们从2013年开始,每年抽取100万条文本样本,并利用2013年至2020年(人工智能系统发布之前)检测到的所有误报,以进一步改进模型。

02013
22014
32015
12016
02017
22018
12019
22020
342021
482022
5792023
15,1012024
年

Similar to how researchers worldwide have and continue to test different AI detector platforms to gauge their capabilities and limitations, we fully encourage our users to conduct real-world testing. Ultimately, as new models are released, we will continue to share the testing methodologies, accuracy, and other important considerations to be aware of.