テスト方法
このページでは、DeAIze が何を測定するのか、リライトがどのように承認されるのか、そして私たちが公開する数値をどのように読むべきかを正確に説明します。誰でも私たちの主張を自分のテキストと照らし合わせて確認できるように書かれています。
1. 検出スコアとは何か
検出器は著者を検出するのではなく、統計的な規則性を検出します。機械生成されたテキストは、人間が書いた文章よりも予測しやすい傾向があります — 低いパープレキシティ、平坦な文のリズム、語彙的な驚きの少なさです。私たちのものを含め、目にするすべてのスコアは、そのシグナルからの確率推定値であり、誰がテキストを書いたかの測定値ではありません。
2. 文単位のスコアリング
文書全体の単一のスコアでは、問題がどこにあるのかわかりません。文ごとにAIの痕跡をハイライト — どの行を書き直すべきかを正確に特定します。文ごとのスコアはリライトループが作用する対象であり、ワークベンチがハイライトするものです。
3. 閉ループ
書き直し、元の意味と比較し、あなたらしく聞こえるバージョンを保持します。書き直し候補は、元の文との意味的類似性が 閾値を超えた場合にのみ採用されます。だからこそ意味が保たれ、このツールは文章を改善できない場合に変更をでっち上げるのではなく、 「no-op時の自動返金」を報告します。
4. 検出器によるクロスチェック
私たち自身のモデルによる予測は証拠にはなりません。検出器APIが設定されている場合、 検証ステップは書き直されたテキストを実際の検出器に送信し、その結果を記録します。それらの実行回数は 統計ページに公開されているため、 私たちの数値の背後にある第三者チェックの数が可視化されます。報告された合格率はクロスチェックではありません。 そこにカウントされるのは、実際に検出器APIに送信された実行のみです。
5. 「予測ヒューマンスコア」の意味
これは、出力がどれだけ人間が書いたように読めるかについての私たち自身のモデルの推定値です — 改善を追跡するための方向性を示す指標であり、 第三者検出器による公式スコアではありません。第三者の数値(GPTZero、Turnitin、Copyleaks、Originality.ai、Sapling)を引用する場合は その旨を明記し、可能な場合はその実行をクロスチェックとして記録します。
報告された検出器のヒューマンスコア。 ホームページおよび 統計ページに表示されるヒューマンスコアは、DeAIzeが自身の書き直し出力について報告する ファーストパーティの数値です。検出器ベンダーはそれらを公開しておらず、監査も行っておらず、 個々の文書に対する保証でもありません。TurnitinのAI ライティング指標には公開スコアリングAPIがないため、Turnitinの項目はライブAPIの読み取り値ではありません。 他の4つは公開APIを通じて再実行でき、それらの実行は §4に基づきクロスチェックとしてカウントされます。私たちは数値の日付を明記し、それらを独立した ベンチマークとして提示することはありません。
6. 限界と開示
- 検出器のスコアは、バージョン、言語、テキストの長さ、ドメインによって異なります。日付と検出器のバージョンがない数値は再現不可能であるため、公開する数値には日付を明記しています。
- 英語以外のパフォーマンスは英語より弱く、短いテキストは長いものよりノイズが多いです。
- ベンチマークを公開する際には、サンプルサイズ、テスト日、検出器のバージョンを併記します。ホームページ上の人間スコアは、監査済みのベンチマークではなく、ファーストパーティ報告値としてラベル付けされています。実際にそうだからです。
- 偽陽性は現実に存在し、有害です。検出器があなた自身の文章にフラグを立てた場合、ドラフトを人間らしくすることは確率的なゲートキーパーに対する正当な対応です — 他人の作品を偽って表示することは正当化されません。
訂正
ここに掲載されている数値が再現できない場合は、お知らせください。訂正いたします: [email protected]。