우리가 테스트하는 방법

이 페이지는 DeAIze가 정확히 무엇을 측정하는지, 재작성이 어떻게 승인되는지, 그리고 우리가 게시하는 수치를 어떻게 읽어야 하는지를 설명합니다. 누구나 우리의 주장을 자신의 텍스트와 대조해 확인할 수 있도록 작성되었습니다.

1. 탐지 점수란 무엇인가

탐지기는 저자를 탐지하지 않습니다. 탐지기는 통계적 규칙성을 탐지합니다. 기계 생성 텍스트는 인간이 쓴 글보다 더 예측 가능한 경향이 있습니다 — 더 낮은 혼란도, 더 평탄한 문장 리듬, 더 적은 어휘적 의외성. 우리 것을 포함해 여러분이 보는 모든 점수는 그 신호로부터 나온 확률 추정치이며, 텍스트를 누가 썼는지에 대한 측정값이 아닙니다.

2. 문장 수준 채점

문서 전체 점수 하나만으로는 문제가 어디에 있는지 알 수 없습니다. 문장별로 AI 흔적을 강조 표시하여 — 다시 작성해야 할 줄을 정확히 짚어냅니다. 문장별 점수는 재작성 루프가 작동하는 기준이며, 워크벤치가 강조 표시하는 대상입니다.

3. 폐쇄 루프

다시 작성하고, 원래 의미와 비교한 뒤, 당신처럼 들리는 버전을 유지하세요. 재작성 후보는 원문과의 의미 유사성이 임계값을 통과할 때만 승인됩니다. 이것이 의미가 보존되는 이유이며, 도구가 문장을 개선할 수 없을 때 변경을 만들어내는 대신 "변경 없음 시 자동 환불"을 보고하는 이유입니다.

4. 탐지기 교차 검증

우리 자체 모델의 예측은 증거가 아닙니다. 탐지기 API가 구성된 경우, 검증 단계는 재작성된 텍스트를 실제 탐지기로 보내고 그 결과를 기록합니다. 해당 실행 횟수는 통계 페이지에 게시되어 우리 수치 뒤에 있는 제3자 검증 횟수를 확인할 수 있습니다. 보고된 통과율은 교차 검증이 아닙니다: 실제로 탐지기 API로 전송된 실행만 그곳에서 집계됩니다.

5. "예측 인간 점수"의 의미

이는 출력물이 얼마나 인간이 작성한 것처럼 읽히는지에 대한 우리 자체 모델의 추정치입니다 — 개선을 추적하기 위한 방향성 지표이며, 어떤 제3자 탐지기의 공식 점수도 아닙니다. 제3자 수치(GPTZero, Turnitin, Copyleaks, Originality.ai, Sapling)를 인용할 때는 그렇게 밝히고, 가능한 경우 해당 실행을 교차 검증으로 기록합니다.

보고된 탐지기 인간 점수. 홈페이지와 통계 페이지에 표시된 인간 점수는 DeAIze가 자체 재작성 출력에 대해 보고하는 자사 수치입니다. 탐지기 공급업체는 이를 공개하지 않았고 감사하지도 않았으며, 개별 문서에 대한 보장도 아닙니다. Turnitin의 AI 작성 지표에는 공개 점수 API가 없으므로 Turnitin 항목은 실시간 API 판독값이 아닙니다; 나머지 네 개는 공개 API를 통해 다시 실행할 수 있으며, 해당 실행은 §4에 따라 교차 검증으로 집계됩니다. 우리는 수치에 날짜를 표기하며, 이를 독립적인 벤치마크로 제시하지 않습니다.

6. 한계 및 공개

정정

여기 있는 어떤 수치라도 재현할 수 없다면, 알려주시면 정정하겠습니다: [email protected].