Copyleaks AI 점수는 텍스트가 기계 생성 글과 유사할 확률을 추정한 값으로, 작성자의 진위를 증명하는 것은 아닙니다. 이는 당신의 단어에서 나타나는 통계적 패턴을 AI 모델과 연관된 패턴과 비교합니다. 동일한 문단이라도 모델이 출력을 샘플링하기 때문에, 그리고 붙여넣은 텍스트가 약간 변경되었을 수 있기 때문에 두 번의 실행에서 다르게 점수가 매겨질 수 있습니다.
Copyleaks AI 점수는 실제로 무엇을 측정하나요?
Copyleaks는 ChatGPT이(가) 당신의 에세이를 작성했는지 확인하지 않습니다. 채팅 기록이 없습니다. 대신, 인간과 기계 글쓰기 모두로 훈련된 통계 모델에서 당신의 텍스트가 얼마나 예측 가능한지를 측정합니다.
주로 가중치를 두는 신호:
- 당혹도(Perplexity) — 앞에 나온 단어들을 고려할 때 각 단어가 얼마나 놀라운지. 낮은 당혹도(매우 예측 가능한 단어 선택)는 AI 쪽으로 기웁니다.
- 버스티니스(Burstiness) — 문장 길이와 리듬의 변화. 인간의 글쓰기는 보통 짧은 문장과 긴 문장 사이를 오가지만, 기계 글쓰기는 고른 중간을 향하는 경향이 있습니다.
- 토큰 분포 — 단어 선택이 통계적으로 가장 가능성 높은 옵션 주변에 모이는지 여부.
그렇기 때문에 당신이 직접 쓴 딱딱하고 정형화된 문단이 높은 점수를 받을 수 있고, 느슨하고 엉성한 AI 초안이 예상보다 낮은 점수를 받을 수 있습니다. 점수는 의도가 아니라 표면적인 통계를 반영합니다.
이러한 신호들에 대한 더 자세한 분석은 AI 탐지 작동 원리: 점수 뒤에 숨은 신호들을 참고하세요.
왜 같은 텍스트가 두 번 실행했을 때 다른 점수를 받나요?
이것은 가장 흔한 불만이며, 실제 원인이 있습니다.
| 원인 | 무슨 일이 일어나고 있는지 | 할 수 있는 일 |
|---|---|---|
| 모델 샘플링 | 탐지기 자체 모델에 무작위성이 내재되어 있음 | 당황하기 전에 다시 실행하세요; 하나의 숫자를 하나의 샘플로 취급하세요 |
| 텍스트 변동 | 약간 편집된 버전을 붙여넣었음 | 하나의 표준 사본을 저장하고 그것만 테스트하세요 |
| 서식 차이 | 줄 바꿈, 제목, 표가 텍스트 청크 분할 방식에 영향을 줌 | 제출할 것과 동일한 형식으로 테스트하세요 |
| 세그먼트 길이 | 매우 짧은 구절은 모델이 작업할 재료를 적게 제공함 | 고립된 문장이 아닌 전체 문단을 테스트하세요 |
| 임계값 민감도 | 작은 확률 변화가 표시 임계값을 넘음 | 헤드라인 숫자만 보지 말고 문장 수준 하이라이트를 확인하세요 |
이것이 탐지기가 고장났다는 의미는 아닙니다. 확률적 추정치를 보고 있다는 뜻이며, 확률 추정치는 흔들립니다. Copyleaks만 이런 것이 아닙니다 — GPTZero, Turnitin 등도 같은 행동을 보입니다. 이러한 도구들의 행동을 직접 비교한 내용은 AI 탐지기 정확도: GPTZero, Turnitin 등은 얼마나 신뢰할 수 있나요?에 있습니다.
플래그가 아마도 잘못된 경우
오탐은 실제로 발생하며, 특정 집단에게 더 큰 타격을 줍니다.
- 비원어민 영어 작성자. 문법적으로 균일하고 신중한 문장은 통계 모델에 낮은 복잡도로 읽힙니다. 이는 AI 탐지에서 가장 잘 문서화된 실패 유형 중 하나입니다.
- 정형화된 학술 글쓰기. 문헌 검토, 방법 섹션, 실험 보고서는 템플릿을 따릅니다. 템플릿은 예측 가능해 보입니다.
- 과도하게 편집된 초안. 모든 문장을 매끄럽게 만드는 문법 도구로 자신의 글을 돌렸다면, 탐지기가 찾는 바로 그 변이를 제거한 것입니다.
- 인용되거나 바꿔 쓴 자료. 출처의 블록 인용은 작성자가 아닌 출처의 통계적 특징을 지닐 수 있습니다.
이 중 하나라도 귀하의 상황에 해당한다면, 그 표시는 귀하의 과정이 아니라 문체에 대한 신호입니다. 이 구분은 교수와 대화할 때 중요합니다.
구체적인 예시
다음은 설명을 위한 예시이며, 실제 제출물이 아닙니다.
이전 (전형적으로 표시된 문장):
지속 가능한 관행의 실행은 경쟁 시장에서 장기적 생존 가능성을 유지하려는 조직에게 필수적입니다.
이후 (같은 아이디어, 인간적인 리듬):
지속 가능성을 무시하는 기업은 나중에 그 대가를 치르는 경향이 있다. 그렇지 않은 기업은 보통 10년 후에도 여전히 살아남아 있다.
같은 주장이다. 두 번째 버전에는 짧은 문장, 축약형, 구체적인 시간 프레임이 있다. 탐지기는 이에 반응한다. 독자도 마찬가지다.
플래그가 잘못되었다고 생각될 때 해야 할 일
다음 단계를 순서대로 진행하라. 재작성으로 건너뛰지 마라.
- 증거를 저장하라. 초안 기록, 버전 타임스탬프, 메모, 원본 파일. Google Docs나 Word에서 작성했다면 버전 기록이 가장 강력한 자산이다.
- 정확히 같은 텍스트를 다시 테스트하라. 기억이 아니라 저장한 파일에서 복사하라. 점수가 달라지면 도구가 불안정하다는 증거가 된다.
- 문장 수준 하이라이트를 확인하라. 대부분의 탐지기는 어떤 문장이 트리거되었는지 표시한다. 하이라이트가 인용문, 참고문헌 또는 정형화된 방법 단락에 찍혔다면 구체적인 설명이 있는 것이다.
- 자신의 과정을 점검하라. 브레인스토밍, 개요 작성, 문법에 AI를 사용했는가? 다른 사람과 논쟁하기 전에 자신에게 솔직해져라.
- 교수에게 일찍 말하라. 변명이 아니라 증거를 가져가라. 무엇을 했는지 설명하고, 초안을 보여주고, 무엇이 필요한지 물어보라.
3단계는 문장 수준 탐지가 진가를 발휘하는 곳이다. 단일 문서 점수는 거의 아무것도 알려주지 않는다; 어떤 줄이 신호를 담고 있는지 아는 것이 어디를 봐야 할지 알려준다. DeAIze의 탐지기는 이렇게 작동한다 — 전체 문서 점수와 문장별 하이라이팅 — 이는 휴머나이저를 전혀 사용하지 않더라도 유용하다.
AI를 사용했다면, 제대로 수정하세요
정직한 방법은 표시된 부분을 자신의 목소리와 이해를 바탕으로 직접 다시 쓰는 것입니다. 아이디어, 데이터, 결론은 반드시 본인의 것이어야 합니다. 이는 형식적인 문제가 아니라 과제의 핵심입니다.
AI를 초안 작성 보조로 사용한 후 텍스트를 자신의 스타일로 되돌려야 한다면, 휴머나이저가 문장 리듬, 단어 선택, 티 나는 균일함 제거 등 표면적인 부분을 도울 수 있습니다. 하지만 사고를 대신할 수는 없습니다. DeAIze의 휴머나이저는 폐쇄 루프로 작동합니다: 텍스트를 점수화하고, 표시된 문장만 다시 쓰고, 의미가 유지되었음을 의미적 유사성이 확인할 때만 재작성을 유지한 다음, 다시 점수화하여 전후를 보여줍니다. 사이트의 예시 문단에서 92% AI 점수가 4%로 바뀝니다. 사이트는 평균 60% 이상 감소(최고 71%)를 보고하며, 이는 제품 자체의 예측 점수이지 Copyleaks이나 다른 제3자 탐지기의 판정이 아닙니다. 작동 방식은 Humanize AI Text에서 확인할 수 있습니다.
더 간단한 첫 단계: 표시된 문장을 소리 내어 읽어보세요. 절대 그렇게 말하지 않을 것 같다면, 다시 쓰세요. 대부분의 오탐 수정은 그게 전부입니다.
알아두어야 할 한계
Copyleaks를 포함한 어떤 탐지기도 검증된 정확도 수치를 공개하지 않으며, 온라인에서 인용된 어떤 숫자도 의심스럽게 여겨야 합니다. 탐지는 확률 추정치입니다. 증거가 아니며, 그 자체로 부정행위의 증거가 되지 않습니다.
이는 양날의 검입니다. 낮은 점수가 해당 텍스트가 사람이 작성했음을 보증하지 않으며, 높은 점수가 그렇지 않음을 보증하지도 않습니다. 두 수치 중 하나를 확정적인 것으로 취급하는 기관은 이 도구를 오용하는 것입니다.
당신이 통제할 수 있는 것: 초안, 메모, 자신의 과정을 설명하려는 의지, 그리고 자신의 글의 명확성입니다. 다음에 무엇을 할지 결정하기 전에 더 넓은 그림을 보고 싶다면 AI Detector 허브부터 시작하세요.