免费开始
登录

博客文章 ·

如何检查文本是否为AI所写:一种分诊方法

面向编辑和教师的三信号分诊法:检测器评分、来源提问和元数据检查——以及当它们不一致时该怎么办。

本文由机器翻译自英文原文,个别措辞可能略显生硬。 阅读英文原文

要检查文本是否为AI所写,请按顺序运行三个信号:在句子层面读取的检测器分数、在提及AI之前向作者询问的来源问题,以及对文件本身的元数据检查。将每个信号视为证据,而非证明。没有任何单一信号——包括我们的——能确立作者身份,因此决定来自这些信号的组合方式。

AI检测器分数实际测量的是什么?

检测器读取模式。句子节奏、词语可预测性、思想分布的均匀程度、词汇是否围绕最可能的下一个词聚集。它输出的是文本类似于机器生成写作的概率估计,而不是关于谁打字的实情认定。

当你必须采取行动时,这一区别很重要。92%的分数并不意味着“92%确定此人作弊”。它意味着文本携带了大量模型与生成文本相关联的统计信号。人类写作也可能携带这种信号——经过大量编辑的草稿、公式化体裁、第二语言措辞以及在时间压力下写成的文本都会推高这个数字。如果你想了解机制,我们对AI检测如何工作的分解会讲解底层信号。

这就是为什么句子级输出胜过单一文档数字。一篇原本普通的文章中有一个被标记的段落,与每个句子都得分很高看起来非常不同。前者通常是风格上的假象。后者值得进行一次对话。

运行我们自己的数据,作为对这种噪声程度的合理性检查。2026-09-13,我们用DeAIze检测器(本地集成,lite层级)以30%的标记阈值对两个语料库进行了评分。一组23篇手写的DeAIze指南平均得分为21% AI,中位数22%,范围0-46%——其中23篇中有5篇在该阈值下仍被标记。十二个未经编辑的模型输出平均得分为33%,中位数34%,范围4-46%。人类写作和原始模型输出严重重叠。这是我们自己的测量,不是第三方裁决,也是我能给你的反对依据单一数字采取行动的最清晰论据。

在提及AI之前,你应该询问哪些源问题?

询问工作本身,而不是工具。当你说出“你用了AI吗”的那一刻,对话就变成了审问,无论对方如何回答,你得到的都是防御性的答案。相反,你应该从那些你能验证答案的问题开始。

  1. 请带我回顾一下这是如何完成的。 询问工作顺序:阅读、笔记、起草、修改。有真实过程的写作者会描述混乱——错误的开头、删掉的部分、放弃的资料来源。
  2. 这个论点从何而来? 询问是什么让他们选择这个主张而不是显而易见的替代方案。这是AI辅助工作最难应对的问题,因为选择从未被做出。
  3. 你能指出这个版本之前的版本吗? 询问草稿历史,而不是最终文件。
  4. 如果再多一周,你会改变什么? 拥有自己作品的写作者会准备好一份清单。拼凑作品的写作者通常没有。
  5. 哪部分最难? 具体的困难是作者身份的强烈信号。模糊的困难不能证明任何事情——有些人确实不记得了。

倾听实质内容,而不是自信。一个紧张但能解释自己推理的写作者,与一个流利但说不出第三段为何存在的写作者,完全属于不同类别。焦虑不是证据。

如果你需要为自己的笔记提供可辩护的前后对比,DeAIze 会为每个句子评分,并仅重写被标记的行,然后重新评分并显示两个数字。免费套餐在注册时提供200个单词,无需信用卡——足以在做出任何决定之前在一个段落上测试工作流程。付费套餐请参见定价

元数据和版本历史能告诉你什么

元数据是最安静的信号,有时也是最有用的,因为它很难随意伪造,却很容易核查。

检查项能显示什么不能显示什么
文件属性(作者、创建时间、修改时间)文件是否一次创建完成,或是否由与提交其余部分不同的账户创建文字本身是否由机器生成
Google Docs 或 Word 中的版本历史真实的起草轨迹——长时间编辑、删减段落、评论如果作者在其他地方起草并粘贴进来,则什么都显示不了
保留的修订记录修订是否确实发生过早期草稿是否由机器撰写
粘贴行为没有编辑痕迹的大段单次插入插入发生的原因
格式残留异常的标题样式、残留的 Markdown、弯引号文档中的直引号作者身份

干净的起草历史是作者身份的轻微证据。缺失起草历史不能证明什么——许多诚实的作者在笔记应用中写作,然后一次性粘贴。把这张表当作你可以询问的事项清单,而不是定罪的清单。

如何将这些信号综合成一个决定?

将每份提交归入以下三类之一。关键在于不要让自己把高分当作定论。

  • 低度关注。 检测器分数低或混杂,过程叙述合理,且存在起草轨迹。归档并继续。
  • 值得谈一谈。 检测器分数高,大多数句子被标记,对推理的回答薄弱,且没有起草历史。你仍然不要指控。你可以要求对方提交带有批注的下一稿,或者请对方当面讲解论证过程。
  • 基于流程升级,而非基于检测。 多个相互冲突的信号,加上已有政策明确界定了什么构成虚假陈述。通过你所在机构的现有程序处理,将检测器输出作为档案中的一项,而绝不是作为结论。

你选择的类别应取决于如果作者要求你以书面形式证明其合理性时你会怎么说。如果诚实的答案是“工具这么说的”,那你还不到那一步。

这是编辑和教师觉得最难的部分,值得直白地说出来:错误指控的代价高于漏掉一个案例的代价。一个在全班面前被错误指控的学生会记很多年。一次未被发现的提交只是糟糕的一天。请据此权衡你的流程。我们关于误报以及当你被指控时该怎么办的指南是为这张桌子的另一边写的,在发送邮件之前值得一读。

当信号相互矛盾时你该怎么办?

它们会相互矛盾。这是常态,而不是例外。

检测器分数高,来源回答令人信服。 相信过程证据,而不是分数。如果你想要书面记录,就索要草稿历史,然后结案。公式化写作和大量编辑都会让合法作品得到高分。

检测器分数低,回答回避。 低分不是免责证明。如果作者无法解释自己的论点,那是一个你可以直接处理的写作问题——要求附上推理的修订版,这是正常的编辑请求,完全不需要提到AI。

所有检测器都标记了,而且作者是非英语母语者。 这是实际场景中最常见的误报模式。可预测的措辞和更简单的句子结构会推高分数。在做任何决定之前,请阅读我们关于为什么检测器会标记非英语母语写作者的文章,并更加重视原始对话。

两个检测器意见不一致。 这种情况经常发生,因为它们对不同的信号赋予不同权重,并使用不同的阈值。不一致本身就是信息:它告诉你这段文本处于模糊地带。比较句子级别的输出,而不是标题数字,看看同一行是否被两者都标记。如果没有,你的证据就很薄弱。

作者承认部分使用了 AI。 现在你处于政策领域,而不是检测领域。查看你的机构或出版物对辅助起草的实际规定,然后将该规则应用于具体使用情况。许多政策允许辅助,但禁止虚假陈述作者身份。这与文本是否读起来像机器生成是不同的问题——而这才是你一直应该问的问题。

数字还支持另一点:AI 特征并不是可靠的捷径。在同一次 2026-09-13 测量中,我们的人类撰写样本每 100 词约有 4 个 AI 特征短语,而未编辑的模型输出每 100 词约有 1 个。那些据说是破绽的构式在人类写作中出现得更频繁。任何让你数“delve”和“moreover”的清单,衡量的都是错误的东西。

在下一次投稿到来之前,把你的分诊步骤写下来。一个你能向作者展示的流程,才是唯一能经受质疑的流程——也是唯一能让你在信号确实吻合时问心无愧地采取行动的流程。


测量说明:本文中的数据来自我们自己的检测器于 2026-09-13 的运行结果——n = 23 篇手写指南对比 n = 12 份未经编辑的模型输出,AI 得分中位数分别为 22% 和 34%。方法:/methodology/。

常见问题

如何在不冤枉任何人的情况下检查文本是否为AI所写?

将三个信号结合使用:在句子层面解读的检测器评分、关于写作者过程的来源提问,以及元数据或版本历史检查。任何单一信号都不能作为证据。如果三者指向一致,在提出AI问题之前,先请写作者带你梳理其推理过程。如果它们相互矛盾,应更信任过程证据而非评分。

AI检测器评分高是否能证明学生作弊?

不能。检测器输出的是关于文本与机器生成写作相似程度的概率估计,而不是关于作者身份的结论。人类草稿、公式化体裁和第二语言措辞都会产生高读数。在我们自己2026年9月13日对23篇手写指南的测量中,有5篇在30%阈值下仍被标记。

教师应使用哪种AI检测器来检查提交的作业?

应选择显示句子级输出而非单一文档数值的检测器,因为你需要看到哪些行带有信号。GPTZero、Turnitin、Copyleaks和Originality.ai的报告方式各不相同,而且它们常常对同一篇文章意见不一。无论你使用哪一种,都要将结果视为分诊决策的一项输入,而绝不是决策本身。

对于提交的文档,我应该检查哪些元数据?

作者和创建日期的文件属性、Google Docs或Word中用于显示真实编辑轨迹的版本历史、是否保留了修订记录,以及格式残留,例如遗留的Markdown或不匹配的引号样式。干净的起草历史是作者身份的轻微证据。缺失则不能证明任何事,因为许多诚实的写作者会在别处撰写并一次性粘贴。

当两个AI检测器给出不同结果时,我该怎么办?

将这种不一致视为信息:它意味着文本处于模糊地带。比较句子级输出而非总体评分,并检查两者是否标记了相同的行。如果没有,你的检测证据就很薄弱,应转而依赖来源对话和元数据检查。

相关阅读