우리가 테스트하는 방법
이 페이지는 DeAIze가 정확히 무엇을 측정하는지, 재작성이 어떻게 승인되는지, 그리고 우리가 게시하는 수치를 어떻게 읽어야 하는지를 설명합니다. 누구나 우리의 주장을 자신의 텍스트와 대조해 확인할 수 있도록 작성되었습니다.
1. 탐지 점수란 무엇인가
탐지기는 저자를 탐지하지 않습니다. 탐지기는 통계적 규칙성을 탐지합니다. 기계 생성 텍스트는 인간이 쓴 글보다 더 예측 가능한 경향이 있습니다 — 더 낮은 혼란도, 더 평탄한 문장 리듬, 더 적은 어휘적 의외성. 우리 것을 포함해 여러분이 보는 모든 점수는 그 신호로부터 나온 확률 추정치이며, 텍스트를 누가 썼는지에 대한 측정값이 아닙니다.
2. 문장 수준 채점
문서 전체 점수 하나만으로는 문제가 어디에 있는지 알 수 없습니다. 문장별로 AI 흔적을 강조 표시하여 — 다시 작성해야 할 줄을 정확히 짚어냅니다. 문장별 점수는 재작성 루프가 작동하는 기준이며, 워크벤치가 강조 표시하는 대상입니다.
3. 폐쇄 루프
다시 작성하고, 원래 의미와 비교한 뒤, 당신처럼 들리는 버전을 유지하세요. 재작성 후보는 원문과의 의미 유사성이 임계값을 통과할 때만 승인됩니다. 이것이 의미가 보존되는 이유이며, 도구가 문장을 개선할 수 없을 때 변경을 만들어내는 대신 "변경 없음 시 자동 환불"을 보고하는 이유입니다.
4. 탐지기 교차 검증
우리 자체 모델의 예측은 증거가 아닙니다. 탐지기 API가 구성된 경우, 검증 단계는 재작성된 텍스트를 실제 탐지기로 보내고 그 결과를 기록합니다. 해당 실행 횟수는 통계 페이지에 게시되어 우리 수치 뒤에 있는 제3자 검증 횟수를 확인할 수 있습니다. 보고된 통과율은 교차 검증이 아닙니다: 실제로 탐지기 API로 전송된 실행만 그곳에서 집계됩니다.
5. "예측 인간 점수"의 의미
이는 출력물이 얼마나 인간이 작성한 것처럼 읽히는지에 대한 우리 자체 모델의 추정치입니다 — 개선을 추적하기 위한 방향성 지표이며, 어떤 제3자 탐지기의 공식 점수도 아닙니다. 제3자 수치(GPTZero, Turnitin, Copyleaks, Originality.ai, Sapling)를 인용할 때는 그렇게 밝히고, 가능한 경우 해당 실행을 교차 검증으로 기록합니다.
보고된 탐지기 인간 점수. 홈페이지와 통계 페이지에 표시된 인간 점수는 DeAIze가 자체 재작성 출력에 대해 보고하는 자사 수치입니다. 탐지기 공급업체는 이를 공개하지 않았고 감사하지도 않았으며, 개별 문서에 대한 보장도 아닙니다. Turnitin의 AI 작성 지표에는 공개 점수 API가 없으므로 Turnitin 항목은 실시간 API 판독값이 아닙니다; 나머지 네 개는 공개 API를 통해 다시 실행할 수 있으며, 해당 실행은 §4에 따라 교차 검증으로 집계됩니다. 우리는 수치에 날짜를 표기하며, 이를 독립적인 벤치마크로 제시하지 않습니다.
6. 한계 및 공개
- 탐지기 점수는 버전, 언어, 텍스트 길이 및 도메인에 따라 달라집니다. 날짜와 탐지기 버전이 없는 숫자는 재현할 수 없으므로, 우리는 발표하는 수치에 날짜를 명시합니다.
- 비영어권 성능은 영어보다 약하며, 짧은 텍스트는 긴 텍스트보다 노이즈가 더 많습니다.
- 벤치마크를 공개할 때는 표본 크기, 테스트 날짜 및 탐지기 버전을 함께 제공합니다. 홈페이지의 인간 점수는 감사된 벤치마크가 아니라 자체 보고 수치로 표시됩니다. 그것이 사실이기 때문입니다.
- 오탐은 실제로 존재하며 해롭습니다. 탐지기가 당신의 글을 표시한다면, 초안을 인간화하는 것은 확률적 게이트키퍼에 대한 정당한 대응입니다 — 다른 사람의 작업을 허위로 표현하는 것은 그렇지 않습니다.
정정
여기 있는 어떤 수치라도 재현할 수 없다면, 알려주시면 정정하겠습니다: [email protected].