無料で始める
ログイン

ブログ記事 ·

テキストがAIによって書かれたかどうかを確認する方法:トリアージ手法

編集者と教師のための3つのシグナルによるトリアージ手法:検出器スコア、情報源に関する質問、メタデータチェック — さらに、それらが一致しない場合の対処法。

この記事は英語原文の機械翻訳です。表現が硬い場合があります。 英語の原文を読む

テキストがAIによって書かれたかどうかを確認するには、3つのシグナルを順番に実行します。文レベルで読む検出器のスコア、AIに言及する前に書き手に尋ねる出典に関する質問、そしてファイル自体のメタデータチェックです。それぞれを証拠として扱い、証明とはしないでください。私たちのものを含め、単一のシグナルが著者性を確立するわけではないため、判断はシグナルの組み合わせ方から導かれます。

AI検出器のスコアは実際に何を測定しているのか?

検出器はパターンを読み取ります。文のリズム、単語の予測可能性、アイデアの間隔の均一さ、語彙が次に来る可能性が最も高い単語の周辺に集まるかどうか。出力するのは、そのテキストが機械生成の文章に似ているという確率の推定値であり、誰が入力したかに関する事実認定ではありません。

行動を起こさなければならない立場の人間にとって、この区別は重要です。92%というスコアは「この人物が不正をしたと92%確信している」という意味ではありません。そのテキストが、モデルが生成された散文と関連付ける統計的シグナルを多く含んでいるという意味です。人間の文章もそのシグナルを含むことがあります。大幅に編集された草稿、定型的なジャンル、第二言語の言い回し、時間的プレッシャーの中で書かれたテキストは、いずれも数値を押し上げます。仕組みを知りたい場合は、AI検出の仕組みに関する私たちの解説で、根底にあるシグナルを詳しく説明しています。

これが、文レベルの出力が単一の文書全体の数値よりも優れている理由です。それ以外は普通のエッセイの中で1つの段落だけがフラグ付けされる場合と、すべての文が高いスコアになる場合は大きく異なります。前者は多くの場合、文体上のアーティファクトです。後者は話し合う価値があります。

これがどれほどノイズが多いかを確認するために、私たち自身の数値を実行してください。2026-09-13に、私たちは2つのコーパスをDeAIze検出器(ローカルアンサンブル、liteティア)で30%のフラグ閾値でスコアリングしました。手書きのDeAIzeガイド23件のセットは、平均21% AI、中央値22%、範囲0-46%で、その23件のうち5件はその閾値でも依然としてフラグ付けされました。未編集のモデル出力12件は、平均33%、中央値34%、範囲4-46%でした。人間の文章と生のモデル出力は大きく重なりました。これは私たち自身の測定であり、第三者の判定ではありません。そして、単一の数値に基づいて行動することに反対する、私が提示できる最も明確な論拠です。

AIに言及する前に、どのような出典確認の質問をすべきか?

ツールではなく、その作業について尋ねましょう。「AIを使いましたか」と言った瞬間に、会話は尋問に変わり、どちらにせよ防御的な答えが返ってきます。代わりに、答えを検証できる質問から始めましょう。

  1. これがどのようにまとまったか、順を追って説明してください。 作業の順序を尋ねます。読む、メモを取る、下書き、推敲。本当のプロセスを持つ書き手は、混乱を語ります——行き詰まり、削ったセクション、捨てた情報源。
  2. その主張はどこから来ましたか? 明白な代替案ではなく、なぜこの主張を選んだのかを尋ねます。これはAI支援の作業が最も苦手とする質問です。なぜなら、その選択は一度も行われていないからです。
  3. この前のバージョンを見せてもらえますか? 最終ファイルではなく、下書きの履歴を求めます。
  4. もう一週間あったら、何を変えますか? 自分の仕事を自分のものとしている書き手は、すぐにリストを出せます。組み立てただけの書き手は、しばしば出せません。
  5. どの部分が一番難しかったですか? 具体的な難しさは、著者性の強いシグナルです。曖昧な難しさは何の証拠にもなりません——本当に覚えていない人もいます。

自信ではなく、中身に耳を傾けましょう。緊張しながらも自分の推論を説明できる書き手は、第3段落がなぜ存在するのか言えない流暢な書き手とは、まったく別のカテゴリーです。不安は証拠ではありません。

自分のメモ用に、説明可能なビフォー・アフターが必要なら、DeAIze が各文を採点し、フラグが立った行だけを書き換え、再採点して両方の数値を表示します。無料プランでは、サインアップ時にカード不要で200語が使えます——何かを決める前に、1段落でワークフローを試すのに十分です。有料プランについては料金をご覧ください。

メタデータとバージョン履歴からわかること

メタデータは最も静かなシグナルであり、時に最も有用です。なぜなら、気軽に偽造するのは難しく、確認するのは容易だからです。

チェック項目示せること示せないこと
ファイルプロパティ(作成者、作成日時、更新日時)ファイルが一度に作成されたか、提出物の他の部分とは異なるアカウントで作成されたか言葉そのものが生成されたかどうか
Google Docs または Word のバージョン履歴実際の下書きの痕跡 — 長い編集、削除された箇所、コメント書き手が別の場所で下書きして貼り付けた場合、何も示せない
変更履歴がオンのまま実際に修正が行われたかどうか以前の下書きが機械によって書かれたかどうか
貼り付けの挙動編集の痕跡がない大きな一括挿入なぜその挿入が行われたか
書式の残留奇妙な見出しスタイル、残ったマークダウン、カーリークォートの文書内のストレートクォート著者であるかどうか

きれいな下書き履歴は、著者であることの弱い証拠です。それが欠けていても何も証明しません — 多くの誠実な書き手がメモアプリで文章を作り、一度貼り付けます。この表は、有罪を確定させるもののリストではなく、尋ねてもよい事柄のリストとして読んでください。

シグナルをどのように組み合わせて判断しますか?

各提出物を三つのバケツのいずれかに分類します。要点は、高いスコアを評決として扱うのをやめることです。

  • 懸念は低い。 検出スコアが低い、または混在している。もっともらしいプロセスの説明があり、下書きの痕跡が存在する。記録して次に進みます。
  • 話し合う価値がある。 検出スコアが高く、ほとんどの文がフラグされている。推論に関する回答が弱く、下書き履歴がない。それでも非難はしません。注釈付きの次の下書きを求めたり、口頭で論証を説明してもらうよう依頼します。
  • 検出ではなくプロセスに基づいてエスカレートする。 複数の矛盾するシグナルがあり、何が不正表示に当たるかをすでに定義したポリシーがある場合。機関の既存の手続きを通じて処理し、検出器の出力はファイル内の一項目として扱い、決して調査結果そのものとはしないでください。

あなたが選ぶバケットは、書き手がそれを書面で正当化するよう求めてきた場合に、あなたが何を言うかによって決まるべきです。正直な答えが「ツールがそう言ったから」であるなら、まだそこには達していません。

これは編集者や教師が最も難しいと感じる部分であり、はっきりと言葉にしておく価値があります。誤った告発のコストは、一件の見逃しのコストよりも高いのです。クラスの前で誤って告発された学生は、それを何年も覚えています。一件の未検出の提出物は、悪い一日にすぎません。それに応じてプロセスを重み付けしてください。誤検知と、告発されたときにどうすべきかに関する私たちのガイドは、この机の反対側のために書かれており、メールを送る前に読む価値があります。

シグナルが矛盾するとき、どうしますか?

それらは矛盾します。それは例外ではなく、通常のケースです。

検出器のスコアが高く、情報源の回答が説得力がある場合。 スコアよりもプロセスの証拠を信頼してください。記録が必要なら下書きの履歴を求め、その後は終わりにしてください。定型的な文章と大幅な編集はどちらも、正当な作業で高い数値を生み出します。

検出器のスコアが低く、回答が回避的である場合。 低いスコアはお墨付きではありません。書き手が自分の主張を説明できないなら、それは直接対処できる文章の問題です — 理由を添えた改訂を求めてください。これは通常の編集上の依頼であり、AIに言及する必要はまったくありません。

すべてがフラグを立て、書き手は英語を母語としない話者である。 これは実際に最もよく見られる偽陽性パターンです。予測可能な言い回しや単純な文構造がスコアを押し上げます。何かを決める前に、なぜ検出器がノンネイティブ英語話者をフラグ立てするのかに関する記事を読み、元の会話をはるかに重視してください。

2つの検出器が一致しない。 異なるシグナルに重みを付け、異なる閾値を使うため、しばしばそうなります。不一致は情報です。それはテキストが曖昧な領域にあることを示しています。見出しの数値ではなく文レベルの出力を比較し、同じ行が両方でフラグ立てされているかを確認してください。そうでなければ、証拠は弱いです。

書き手が一部にAIを使ったことを認めている。 ここで扱うのは検出ではなくポリシーの領域です。所属機関や出版物が支援付きの下書きについて実際に何を定めているかを確認し、そのルールを具体的な使用に適用してください。多くのポリシーは支援を認め、著者性の偽装を禁じています。これはテキストが機械的かどうかとは別の問いであり、ずっと問うべきだった問いです。

数字が裏付けるもう一つの点は、AIの特徴は信頼できる近道ではないということです。同じ2026-09-13の測定では、人間が書いたサンプルは100語あたり約4個のAI特徴フレーズを含み、未編集のモデル出力は100語あたり約1個でした。いわゆる特徴的な構文は、人間の文章により頻繁に現れました。「delve」や「moreover」を数えろと言うチェックリストは、間違ったものを測定しています。

次の投稿が届く前に、トリアージ手順を書き留めてください。書き手に見せられるプロセスだけが異議申し立てに耐えられます。そして、シグナルが本当に一致したときに、良心にやましいところなく行動できる唯一の方法です。


計測に関する注記:本記事の数値は、2026-09-13に当社独自の検出器を実行して得られたものです — 手書きガイド n = 23 対 未編集のモデル出力 n = 12、AIスコアの中央値はそれぞれ22%と34%でした。手法:/methodology/.

よくある質問

誰かを誤って非難することなく、テキストがAIによって書かれたかどうかを確認するにはどうすればよいですか?

3つのシグナルを組み合わせて使用します:文レベルで読み取る検出器スコア、書き手のプロセスに関する情報源への質問、メタデータまたはバージョン履歴のチェックです。単独で証拠となるものはありません。3つすべてが同じ方向を指している場合は、AIについて持ち出す前に、書き手に自分の推論を説明してもらいましょう。それらが矛盾する場合は、スコアよりもプロセスの証拠を信頼してください。

AI検出器のスコアが高いことは、学生がカンニングした証拠になりますか?

いいえ。検出器の出力は、テキストが機械生成の文章にどれだけ似ているかについての確率推定であり、著者性に関する所見ではありません。人間の草稿、定型的なジャンル、第二言語の言い回しはすべて高い数値を示します。私たち自身の2026年9月13日の23件の手書きガイドの測定では、5件が30%の閾値で依然としてフラグが立てられました。

教師は提出物に対してどのAI検出器を使用すべきですか?

単一の文書番号ではなく、文レベルの出力を示すものです。どの行がシグナルを運んでいるかを確認する必要があるからです。GPTZero、Turnitin、Copyleaks、Originality.aiはすべて異なる報告をし、同じエッセイについてしばしば意見が分かれます。どれを使用するにしても、結果はトリアージ判断への1つの入力として扱い、決して判断そのものとして扱わないでください。

提出された文書で確認すべきメタデータは何ですか?

作成者と作成日のファイルプロパティ、実際の編集履歴を示すGoogle DocsやWordのバージョン履歴、変更履歴がオンのままだったかどうか、残ったマークダウンや一致しない引用符スタイルなどの書式の痕跡。きれいな草稿履歴は著者性の弱い証拠です。欠けているからといって何も証明されません。多くの正直な書き手は別の場所で作成し、一度貼り付けるからです。

2つのAI検出器が異なる結果を出した場合、どうすればよいですか?

不一致を情報として扱います:それはテキストが曖昧な領域にあることを意味します。見出しのスコアではなく文レベルの出力を比較し、同じ行が両方でフラグが立てられているかどうかを確認します。そうでない場合、検出証拠は弱く、代わりに情報源との会話とメタデータチェックに頼るべきです。

関連記事