AI检测器准确吗?作为裁决并不准确。它们根据你文本中的模式估计概率,彼此结论不一,并且会标记大量人类写作。分数是关于页面上文字的某种信号,而非关于作者是谁的证明。句子级视图才是你真正能用的。
关键要点
- 检测器分数是概率估计,而非作者身份的证明。 没有工具能看出是谁输入了这些文字。
- 两个检测器结论不一,是因为它们使用不同的信号、训练数据和阈值。 同一份草稿,答案不同。
- 人类写作会被标记。 在我们2026年9月19日的测量中,46篇手写的DeAIze指南中有17篇超过了30%的标记阈值。
- 句子级分数胜过单一文档分数。 它们会显示哪些行携带了信号。
- 你可以在几分钟内检查自己的草稿,并修正那些读起来像机器生成的特定句子。
- 绝不要为了逃避分数而改写他人的想法。 论点、数据和结论必须是你自己的。
是什么变化让这些分数更难被信任
检测不再是一种新奇事物,而成了基础设施。Turnitin的AI写作指标现在出现在使用它的机构的评分工作流程中。GPTZero、Copyleaks、Originality.ai和Sapling都向学校、出版商、机构和招聘团队出售席位。一个曾经只是猎奇之物的数字,如今与成绩、合同和求职申请挂钩。
与此同时,检测器所寻找的特征已经蔓延到普通的人类写作中。预测文本会补全你的句子。翻译工具会润色你的语法。编辑会让草稿经过改写流程。一位学习了正式学术措辞的非英语母语写作者,其写作风格恰恰是检测器与生成文本相关联的那种语域。
结果是,分数现在有了真实的后果,却仍然本质上不确定。这种错配正是整个问题所在。工具本身没有任何改变来让这个数字成为事实。只是赌注变高了。
为什么两个检测器对同一份草稿意见不一
每个检测器都是在不同文本组合上训练的模型,评分不同的信号集,并在不同的阈值上截断结果。四个因素导致了这种分歧。
不同的训练数据。 一个大量基于某个模型输出训练的检测器会学到该模型的习惯。如果喂给它来自不同模型的文本,或者来自恰好有相同习惯的人类文本,置信度就会因为与作者身份无关的原因而下降或飙升。
不同的信号。 有些工具依赖困惑度和突发性,即你的用词选择的统计可预测性和句子长度的变化。有些依赖端到端学习的分类器特征。有些结合两者并加入自己的启发式规则。基于困惑度的工具对词汇敏感;基于分类器的工具对结构敏感。
不同的阈值。 一家供应商采用保守的截断,只标记高置信度的段落。另一家采用激进的截断,标记任何超过低门槛的内容。同一份草稿在文本没有任何变化的情况下产生两个不同的标签。
粒度不同。 文档级评分对所有内容取平均值,因此一个听起来像机器写的段落就可能把一篇人类写的文档拖过线。句子级评分则能显示信号实际所在的位置。
如果你想看看哪些句子带有信号,请先将草稿通过AI检测器运行。它会对文档评分并高亮每个句子,这样你就可以针对具体句子进行讨论,而不是面对一个无法检查的数字。
说实话,这对你意味着什么
如果草稿是你自己写的,却得到了高分,你并没有在凭空想象问题。我们自己在2026年9月19日的测量就说明了这一点。我们用检测器对46篇手写的DeAIze指南进行了评分,标记阈值为30%:平均AI得分27%,中位数25%,范围0-55%。46篇中有17篇被标记。这些文档是由人撰写的,关于他们自己的工作,没有任何模型参与。
因此,人类写作被标记是正常的,并不稀奇。这有两面性,值得坦诚地说明第二个方向:同一次运行中未经编辑的模型输出平均得分为35%,范围为25-49%。这两个分布有重叠。单一分数无法干净地将它们区分开,任何声称能做到这一点的工具都是在夸大概率估计的能力。
实际后果是,分数是关于文本的证据,而不是关于你的证据。如果你被指控,有用的做法是展示你的过程:草稿、笔记、版本历史、来源。如果你在提交前自我检查,有用的做法是找出那些读起来像机器生成的特定句子并修正它们。两条路径都通过句子级检查来实现。
还有一个诚实的局限。我们的测量还发现,人类样本中每100个词有3个AI特征短语,而未编辑的模型输出中每100个词只有1个。换句话说,人类比模型使用了更多人们与AI关联的套话。表面特征是一个薄弱的指南。结构和节奏更重要。
如果你的草稿是AI辅助的,而不是完全由你写的,规则就不同,值得仔细阅读。学生AI辅助写作涵盖了大多数机构的界限所在。
如何逐句检查你自己的文本
你不需要订阅就能做到这一点。你需要停止把草稿作为一个整体来阅读,开始逐行阅读。
- 给文档打分,然后忽略文档分数。 在能报告逐句输出的检测器中打开草稿。标题数字是屏幕上最不可操作的东西。
- 按AI概率对句子排序。 最上面的几个是你的工作清单。现在下面的都是噪音。
- 大声朗读每个被标记的句子。 机器生成的句子往往语法完美、权重均匀、略显空洞。如果你能删除这个句子而不丢失一个想法,那就是线索。
- 用眼睛检查句子长度差异。 看连续五个句子。如果它们长度和形状大致相同,这种一致性就是检测器反应的原因。真正的写作是凹凸不平的。
- 寻找套式动作。 宣布段落将做什么的开头。重述它的结尾。不起作用的过渡短语。两个项目就够的三项列表。
- 编辑后重新评分。 尽可能一次只改一件事,这样你就能了解哪些编辑会改变阅读结果,哪些不会。
要更深入地解释模型实际在测量什么,AI检测如何工作会不带营销地讲解这些信号。
如何修复被标记的句子
修复比人们想象的更机械,主要在于恢复具体性。
| 问题模式 | 表现 | 替代做法 |
|---|---|---|
| 节奏单一 | 五个句子长度和结构相似 | 拆分一句,合并两句,用连词开头写一句 |
| 空泛框架 | “本节将探讨关键因素” | 删掉它,直接从因素开始 |
| 抽象名词 | “实施”、“优化”、“考量” | 说出具体事物:文件、截止日期、人 |
| 均匀模糊 | 每个主张都以相同方式弱化 | 明确主张,或删掉它 |
| 重复结尾 | 最后一句重复第一句 | 以最新事实结尾 |
| 陈词滥调 | 现在人人都认识的词汇 | 用你大声说出来的方式表达 |
这里是一个示例,不是真实评分。修改前:“重要的是要考虑有助于有效内容策略的各种因素,因为这些元素在实现最佳结果中起着关键作用。”修改后:“内容策略失败的原因很无聊。你选错了渠道,或者你在第三周就停止发布了。”同样的想法,不同的密度。第二句有主语、动词和主张。
如果你正在处理较长的草稿,清理机器生成的模式会在段落层面讲解这一点,而如何改写 ChatGPT 文本则涵盖在删减冗余时保持原意不变。
关于捷径的一个警告。逐句重写所有内容的工具会连同你的节奏一起改变你的意思。如果一次改写无法告诉你意思是否保留,那你就是在用一个问题换一个更糟的问题。DeAIze 的人性化工具为此运行一个闭环:它给文本评分,只重写被标记的句子,只有当语义相似度表明意思保持不变时才保留改写,然后重新评分并向你展示修改前后。在网站上的示例段落中,92% 的 AI 评分变成了 4%。
这些限制是真实存在的。我们报告的是人性化处理后 AI 分数平均降低 60% 以上,最佳情况为 71%,这些都是我们自己的预测分数,而非任何第三方检测器的判定。在已配置的情况下,我们会针对真实的第三方检测器 API 进行交叉验证,包括 GPTZero、Turnitin、Copyleaks、Originality.ai 和 Sapling,而不是依赖内部猜测。没有任何工具,包括我们的,能保证另一个检测器会给出什么结果。
当检测器是对的,而你仍然有问题时
有时分数是准确的,问题出在草稿上。如果你用模型生成了初稿,并且几乎原封不动地提交了,那么检测器只是在履行它的职责。解决办法不是伪装文本,而是补上草稿跳过的工作:核实论断,加入只有你才有的例子,删掉你在对话中无法辩护的部分。
这也是整个类别的诚实边界。人性化工具可以减少你自己写作中的误报,并清理你自己的 AI 辅助草稿。它不是把别人的作品冒充为自己作品的手段,任何严肃的工具都不应该以这种方式销售。如果你是一位非英语母语写作者,因为被教过的正式措辞而被标记,为什么 AI 检测器会标记非英语母语写作者 是相关的阅读材料。
准备好看看哪些句子读起来像机器写的了吗?
不要再跟一个单一数字争论了。获取逐行视图,然后从那里开始处理。
- 运行免费 AI 检测器 — 注册即享 200 词,无需信用卡,句子级高亮,让您准确看到哪些行带有信号。
- 打开草稿编辑器 — 仅重写被标记的句子,只有在含义保持不变时才保留修改,然后重新评分并比较前后结果。
- 查看定价 — 按需付费的积分永不过期,无需订阅。入门版 $20.99 可处理 1,000 词,标准版 $44.99 可处理 3,000 词,专业版 $99.99 可处理 10,000 词,最高版 $199.99 可处理 30,000 词。
- 创建账户 并在您真正担心的段落上测试。上传支持 .txt、.docx 和 .pdf,重写 Word 文档可保留字体、样式和表格。
检测和重写覆盖英语及其他 9 种语言,界面提供 10 种语言。您的文本仅用于当前任务处理,绝不用于训练,也绝不转售。请保持正确的认知:检测器评分是概率估计,并非作者身份的证明。用它来找出您自己作品中的薄弱句子。