我们如何测试
本页明确说明 DeAIze 衡量什么、改写如何被接受,以及如何解读我们发布的 数字。这样撰写是为了让任何人都能对照自己的文本核查我们的说法。
1. 什么是检测分数
检测器检测的不是作者身份,而是统计规律性。机器生成的文本 往往比人类写作更可预测——更低的困惑度、更平缓的句子节奏、 更少的词汇意外。你看到的每一个分数,包括我们的,都是基于 该信号的概率估计,而不是对文本作者的测量。
2. 句子级评分
单一的文档分数无法告诉你问题出在哪里。逐句高亮 AI 痕迹——精确定位需要改写哪些行。 逐句分数是改写循环所依据的,也是工作台 所高亮的。
3. 闭环
重写,与您的原意进行比较,并保留听起来像您自己的版本。只有当重写候选与原文的语义相似度超过阈值时才会被接受,这就是为什么意义得以保留,以及为什么当工具无法改进一段文字时,它会报告“无操作自动退款”,而不是凭空捏造改动。
4. 检测器交叉验证
来自我们自己模型的预测不是证据。在配置了检测器 API 的情况下,验证步骤会将重写后的文本发送给真实的检测器并记录该结果。这些运行的次数发布在 统计页面上,因此我们数据背后的第三方检查次数是可见的。报告的通过率不是交叉验证:只有实际发送到检测器 API 的运行才会在那里被计入。
5. “预测人类分数”的含义
这是我们自己的模型对输出读起来有多像人类撰写的估计——一个用于跟踪改进的方向性指标,而不是来自任何第三方检测器的官方分数。当我们引用第三方数字(GPTZero、Turnitin、Copyleaks、Originality.ai、Sapling)时,我们会说明,并在可能的情况下将该次运行记录为交叉验证。
报告的检测器人类分数。 首页和 统计页面上显示的人类分数是 DeAIze 为其自身重写输出报告的第一方 数据。检测器供应商并未发布这些数据,也未对其进行审计,它们不构成对任何单个文档的保证。Turnitin 的 AI 写作指标没有公开的评分 API,因此 Turnitin 条目不是实时 API 读数; 其余四个可以通过其公开 API 重新运行,这些运行按照 §4 计为 交叉验证。我们为这些数据标注日期,并且不会将其作为独立的 基准来呈现。
6. 局限性与披露
- 检测器评分因版本、语言、文本长度和领域而异。没有日期和检测器版本的分数是不可复现的,因此我们会为发布的数字标注日期。
- 非英语的表现弱于英语,短文本比长文本噪声更大。
- 当我们发布基准测试时,会附带其样本量、测试日期和检测器版本。主页上的人工评分被标注为第一方报告的数字,而非经过审计的基准测试,因为事实就是如此。
- 误报是真实存在且有害的。如果检测器标记了你自己的写作,将你的草稿人性化是对概率性把关者的合理回应——歪曲他人的作品则不是。
更正
如果这里的任何数字无法复现,请告诉我们,我们会予以更正: [email protected]。