评估 Copyleaks AI 检测器的准确性
循序渐进的方法
我们认为,为了确保人工智能检测器得到负责任的使用和推广,充分透明地披露其准确率、误报率和漏报率、需要改进的方面等信息比以往任何时候都更加重要。这份全面的分析旨在确保我们人工智能检测器V10模型测试方法的完全透明。
评估过程
我们采用双部门体系,精心设计了评估流程,以确保模型达到最高质量、标准和可靠性。我们有两个独立的部门负责评估模型:数据科学团队和质量保证团队。每个部门独立使用各自的评估数据和工具,互不接触其他部门的评估流程。这种分离确保了评估结果的公正性、客观性和准确性,并能全面反映模型的性能。此外,需要特别注意的是,测试数据与训练数据完全分离,我们只使用模型之前从未接触过的新数据进行测试。
方法论
Copyleaks 的质量保证和数据科学团队独立收集了各种测试数据集。每个测试数据集都包含有限数量的文本。每个数据集的预期标签(用于指示特定文本是由人类撰写还是由人工智能撰写)是根据数据来源确定的。人类撰写的文本来自现代生成式人工智能系统出现之前发布的文本,或来自其他可信来源的后续文本,这些文本均经过团队的再次验证。人工智能生成的文本则使用各种生成式人工智能模型和技术生成。
我们使用 Copyleaks API 执行了这些测试。我们根据目标标签检查了 API 对每段文本的输出是否正确,然后汇总得分以计算混淆矩阵。
结果:数据科学团队
数据科学团队进行了以下独立测试:
- 文本语言为英语,总共测试了 30 万篇人工撰写的文本和 20 万篇来自各种 LLM 的 AI 生成的文本。
- 文本长度各不相同,但数据集仅包含长度大于 350 个字符的文本——这是我们的产品接受的最小长度。
评估指标
本文本分类任务中使用的指标有:
1. 混淆矩阵:一个显示 TP(真阳性)、FP(假阳性)、TN(真阴性)和 FN(假阴性)的表格。
2. 准确率:在所检查的文本总数中,真实结果(包括真阳性和真阴性)所占的比例。

3.真阴性率 (TNR):实际阴性实例中所有阴性预测值所占的比例。

在人工智能检测领域,TNR 是模型对人类文本的准确率。
4. (TPR)也称为召回率:所有实际预测结果中真正结果所占的比例。

在人工智能检测领域,TPR 是模型对人工智能生成的文本的准确率。
5. F-beta 分数:精确率和召回率的加权调和平均值,更侧重于精确率(因为我们希望降低假阳性率)。

人工智能与人类数据集的结合
| 数据集名称 | 文本数量 | 人类文本数量 | 人工智能文本数量 | TPR | TNR | F-beta(0.5) |
|---|---|---|---|---|---|---|
| 内部超难数据集,包括对抗性攻击和特殊工具 | 500,000 | 300,000 | 200,000 | 0.988 | 0.999 | 0.997 |
结果:质量保证团队
质量保证团队进行了以下独立测试:
- 文本语言为英语,总共测试了 229,843 篇人工撰写的文本和 18,712 篇来自不同语言学习模型的 AI 生成的文本。
- 文本长度各不相同,但数据集仅包含长度大于 350 个字符的文本——这是我们的产品接受的最小长度。
仅限人类的数据集
| 数据集名称 | 文本数量 | 正确识别为人类 | 被错误地识别为人工智能 | 准确性 |
|---|---|---|---|---|
| 一般文本 | 9,979 | 9,979 | 0 | 1 |
| 文章、新闻、博客、社交媒体帖子 | 9,991 | 9,982 | 9 | 0.9991 |
| 互联网网页数据集 | 99,921 | 99,918 | 3 | 0.9999 |
| 学生作文 | 10,000 | 9,998 | 2 | 0.9998 |
| 学术论文 | 99,952 | 99,906 | 46 | 0.9995 |
| 全部的: | 229,843 | 229,783 | 60 | 0.9997 |
仅限人工智能的数据集
| 数据集名称 | 文本数量 | 被错误地识别为人类 | 被正确识别为人工智能 | 准确性 |
|---|---|---|---|---|
| OpenAI 系列模型 - 其他模型 | 12,880 | 129 | 12,751 | 0.9899 |
| GPT-5 | 1,207 | 11 | 1,196 | 0.9909 |
| 双子座家族模型 | 1,978 | 7 | 1,971 | 0.9964 |
| 克劳德家族模型 | 1,072 | 1 | 1,071 | 0.9991 |
| Grok家族模型 | 1,575 | 0 | 1,575 | 1 |
| 全部的: | 18,712 | 148 | 18,564 | 0.992 |
*模型版本可能会随时间变化。文本是使用上述生成式人工智能公司提供的最新版本模型生成的。
敏感度水平
自 v7.1 版本起,我们的 AI 检测模型提供了 3 个灵敏度级别。以下是模型 v10 各灵敏度级别的测试结果。
| ID | 敏感性 | 定义 | 假阳性 | 假阴性 |
|---|---|---|---|---|
| 1 | 格外安全 | 旨在通过使用额外的基于人工智能检测的过滤器来最大限度地减少误报。 适用于检测几乎无需人工修改的 AI 生成文本。 | 0.009% | 1.36% |
| 2 | 平衡(默认值 - 这是版本 这表明 (以上结果) | 非常适合检测人工智能内容,同时最大限度地减少误报。 适用于检测经过适度人工修改的 AI 生成文本。 | 0.026% | 0.79% |
| 3 | 超敏感 | 我们最灵敏的模型旨在标记经过“人性化”或文本转换工具处理的 AI 文本。 | 0.05% | 0.53% |
按敏感度级别划分的真阳性(AI文本)和真阴性(人工文本)准确率
人类和人工智能文本错误分析
在评估过程中,我们识别并分析了模型做出的错误评估,并生成了一份详细报告,以便数据科学团队能够纠正根本原因。整个过程不会让数据科学团队直接接触到这些错误评估结果。所有错误都会被系统地记录,并根据其性质和特点进行分类,这一过程被称为“根本原因分析流程”。该流程旨在了解根本原因并识别重复出现的模式。此流程持续进行,确保我们的模型能够随着时间的推移不断改进并保持适应性。
例如, 我们使用V4模型分析了2013年至2024年的互联网数据。我们从2013年开始,每年抽取100万条文本样本,并利用2013年至2020年(人工智能系统发布之前)检测到的所有误报,以进一步改进模型。
Similar to how researchers worldwide have and continue to test different AI detector platforms to gauge their capabilities and limitations, we fully encourage our users to conduct real-world testing. Ultimately, as new models are released, we will continue to share the testing methodologies, accuracy, and other important considerations to be aware of.