我们如何测试

本页明确说明 DeAIze 衡量什么、改写如何被接受,以及如何解读我们发布的 数字。这样撰写是为了让任何人都能对照自己的文本核查我们的说法。

1. 什么是检测分数

检测器检测的不是作者身份,而是统计规律性。机器生成的文本 往往比人类写作更可预测——更低的困惑度、更平缓的句子节奏、 更少的词汇意外。你看到的每一个分数,包括我们的,都是基于 该信号的概率估计,而不是对文本作者的测量。

2. 句子级评分

单一的文档分数无法告诉你问题出在哪里。逐句高亮 AI 痕迹——精确定位需要改写哪些行。 逐句分数是改写循环所依据的,也是工作台 所高亮的。

3. 闭环

重写,与您的原意进行比较,并保留听起来像您自己的版本。只有当重写候选与原文的语义相似度超过阈值时才会被接受,这就是为什么意义得以保留,以及为什么当工具无法改进一段文字时,它会报告“无操作自动退款”,而不是凭空捏造改动。

4. 检测器交叉验证

来自我们自己模型的预测不是证据。在配置了检测器 API 的情况下,验证步骤会将重写后的文本发送给真实的检测器并记录该结果。这些运行的次数发布在 统计页面上,因此我们数据背后的第三方检查次数是可见的。报告的通过率不是交叉验证:只有实际发送到检测器 API 的运行才会在那里被计入。

5. “预测人类分数”的含义

这是我们自己的模型对输出读起来有多像人类撰写的估计——一个用于跟踪改进的方向性指标,而不是来自任何第三方检测器的官方分数。当我们引用第三方数字(GPTZero、Turnitin、Copyleaks、Originality.ai、Sapling)时,我们会说明,并在可能的情况下将该次运行记录为交叉验证。

报告的检测器人类分数。 首页和 统计页面上显示的人类分数是 DeAIze 为其自身重写输出报告的第一方 数据。检测器供应商并未发布这些数据,也未对其进行审计,它们不构成对任何单个文档的保证。Turnitin 的 AI 写作指标没有公开的评分 API,因此 Turnitin 条目不是实时 API 读数; 其余四个可以通过其公开 API 重新运行,这些运行按照 §4 计为 交叉验证。我们为这些数据标注日期,并且不会将其作为独立的 基准来呈现。

6. 局限性与披露

更正

如果这里的任何数字无法复现,请告诉我们,我们会予以更正: [email protected]