텍스트가 AI로 작성되었는지 확인하려면 세 가지 신호를 순서대로 실행하세요: 문장 수준에서 읽는 탐지기 점수, AI를 언급하기 전에 작성자에게 묻는 출처 질문, 그리고 파일 자체의 메타데이터 확인입니다. 각각을 증거로 취급하고 증명으로 취급하지 마세요. 우리 것을 포함해 어떤 단일 신호도 저자를 확립하지 못하므로, 결정은 신호들이 어떻게 결합되는지에서 나옵니다.
AI 탐지기 점수는 실제로 무엇을 측정하나요?
탐지기는 패턴을 읽습니다. 문장 리듬, 단어 예측 가능성, 아이디어가 얼마나 균등하게 배치되는지, 어휘가 가장 가능성 높은 다음 단어 주변에 모이는지 여부입니다. 이는 텍스트가 기계 생성 글쓰기와 유사하다는 확률 추정치를 출력할 뿐, 누가 입력했는지에 대한 사실 판정이 아닙니다.
이 구분은 조치를 취해야 하는 사람일 때 중요합니다. 92% 점수는 “이 사람이 부정행위를 했다고 92% 확신한다”는 의미가 아닙니다. 이는 텍스트가 모델이 생성된 산문과 연관 짓는 통계적 신호를 많이 담고 있다는 의미입니다. 인간의 글쓰기도 그 신호를 담을 수 있습니다 — 과도하게 편집된 초안, 정형화된 장르, 제2언어 표현, 시간 압박 속에서 작성된 텍스트 모두 수치를 높입니다. 메커니즘을 원하신다면, AI 탐지 작동 방식에 대한 저희 분석에서 기본 신호를 자세히 설명합니다.
이것이 문장 수준 출력이 단일 문서 숫자보다 나은 이유입니다. 그 외에는 평범한 에세이 안에 표시된 한 문단은 모든 문장이 높은 점수를 받는 것과 매우 다르게 보입니다. 첫 번째는 종종 문체적 인공물입니다. 두 번째는 대화할 가치가 있습니다.
이것이 얼마나 노이즈가 많은지 sanity check로 저희 자체 수치를 실행해 보세요. 2026-09-13에 저희는 두 코퍼스를 DeAIze 탐지기(로컬 앙상블, lite tier)로 30% 플래그 임계값에서 점수화했습니다. 손으로 작성한 DeAIze 가이드 23개 세트는 평균 21% AI, 중앙값 22%, 범위 0-46%를 기록했으며 — 그 23개 중 5개는 여전히 그 임계값에서 플래그되었습니다. 편집되지 않은 모델 출력 12개는 평균 33%, 중앙값 34%, 범위 4-46%를 기록했습니다. 인간 글쓰기와 원시 모델 출력은 크게 겹쳤습니다. 이는 저희 자체 측정이지 제3자의 판정이 아니며, 하나의 숫자에 따라 행동하는 것에 반대하는 제가 드릴 수 있는 가장 명확한 논거입니다.
AI를 언급하기 전에 어떤 출처 질문을 해야 할까?
도구가 아니라 작업에 대해 물어보세요. “AI를 사용했나요”라고 말하는 순간, 대화는 심문으로 바뀌고 어느 쪽이든 방어적인 답변을 듣게 됩니다. 대신 답변을 검증할 수 있는 질문으로 시작하세요.
- 이게 어떻게 완성되었는지 과정을 설명해 주세요. 읽기, 메모, 초안 작성, 수정 등 작업 순서를 물어보세요. 진짜 과정을 거친 작가는 혼란을 설명합니다 — 잘못된 시작, 삭제한 섹션, 포기한 출처 등.
- 이 주장은 어디서 나왔나요? 왜 뻔한 대안 대신 이 주장을 선택했는지 물어보세요. AI 지원 작업이 가장 어려워하는 질문입니다. 선택이 이루어진 적이 없기 때문입니다.
- 이 버전 이전의 버전을 보여줄 수 있나요? 최종 파일이 아니라 초안 이력을 요청하세요.
- 일주일이 더 있다면 무엇을 바꾸시겠어요? 자신의 작업을 소유한 작가는 목록을 준비해 둡니다. 조립한 작가는 종종 그렇지 않습니다.
- 어느 부분이 가장 어려웠나요? 구체적인 어려움은 저자임을 보여주는 강한 신호입니다. 모호한 어려움은 아무것도 증명하지 못합니다 — 어떤 사람들은 진짜로 기억하지 못하기도 합니다.
자신감이 아니라 실질적인 내용에 귀 기울이세요. 긴장한 작가라도 자신의 추론을 설명할 수 있다면, 세 번째 문단이 왜 존재하는지 말하지 못하는 유창한 작가와는 완전히 다른 범주입니다. 불안은 증거가 아닙니다.
자신의 노트를 위해 방어 가능한 전후 비교가 필요하다면, DeAIze가 각 문장을 점수화하고 표시된 줄만 다시 쓴 다음, 다시 점수화하여 두 숫자를 모두 보여줍니다. 무료 등급은 가입 시 카드 없이 200단어를 제공합니다 — 무엇이든 결정하기 전에 한 문단에서 워크플로를 테스트하기에 충분합니다. 유료 등급은 가격을 참조하세요.
메타데이터와 버전 이력이 알려줄 수 있는 것
메타데이터는 가장 조용한 신호이면서 때로는 가장 유용한데, 일상적으로 위조하기 어렵고 확인하기 쉽기 때문이다.
| 확인 항목 | 보여줄 수 있는 것 | 보여줄 수 없는 것 |
|---|---|---|
| 파일 속성(작성자, 생성, 수정) | 파일이 한 번에 작성되었는지, 또는 제출물의 나머지와 다른 계정으로 작성되었는지 | 단어 자체가 생성되었는지 |
| Google Docs 또는 Word의 버전 기록 | 실제 작성 흔적 — 긴 편집, 삭제된 구절, 댓글 | 작성자가 다른 곳에서 초안을 작성하고 붙여넣은 경우에는 아무것도 |
| 변경 내용 추적이 켜진 상태 | 수정이 실제로 일어났는지 | 이전 초안이 기계로 작성되었는지 |
| 붙여넣기 동작 | 편집 흔적 없이 한 번에 크게 삽입 | 삽입이 일어난 이유 |
| 서식 잔여물 | 이상한 제목 스타일, 남은 마크다운, 곱은따옴표 문서의 직선따옴표 | 저자 여부 |
깔끔한 작성 기록은 저자 여부에 대한 약한 증거다. 없는 것은 아무것도 증명하지 않는다 — 정직한 작성자 중 상당수는 메모 앱에서 작성하고 한 번 붙여넣는다. 이 표를 유죄로 만드는 항목 목록이 아니라 물어볼 수 있는 항목 목록으로 읽어라.
신호를 어떻게 결정으로 결합하는가?
각 제출물을 세 가지 범주 중 하나로 분류하라. 핵심은 높은 점수를 판결처럼 취급하지 않는 것이다.
- 낮은 우려. 탐지기 점수가 낮거나 혼재하고, 과정 설명이 그럴듯하며, 작성 기록이 존재한다. 기록하고 넘어가라.
- 대화할 가치가 있음. 탐지기 점수가 높고 대부분의 문장이 표시되며, 추론에 대한 답변이 약하고, 작성 기록이 없다. 그래도 비난하지 않는다. 메모가 포함된 다음 초안을 요청하거나, 논증을 직접 설명해 달라고 요청하라.
- 탐지가 아니라 과정을 기준으로 에스컬레이션하라. 여러 상충하는 신호와 함께 무엇이 허위 표시에 해당하는지 이미 정의한 정책이 있는 경우. 기관의 기존 절차를 통해 처리하고, 탐지기 출력은 파일의 한 항목일 뿐 결론이 되어서는 안 된다.
당신이 선택하는 버킷은 작성자가 그것을 서면으로 정당화해 달라고 요청했을 때 당신이 무엇이라고 말할지에 따라 달라져야 합니다. 솔직한 답이 “도구가 그렇게 말했어요”라면, 당신은 아직 거기까지 가지 못한 것입니다.
이것이 편집자와 교사가 가장 어려워하는 부분이며, 분명히 짚고 넘어갈 가치가 있습니다. 잘못된 고발의 대가는 한 건을 놓치는 대가보다 더 큽니다. 학급 앞에서 부당하게 고발당한 학생은 그 일을 수년간 기억합니다. 탐지되지 않은 제출물 한 건은 안 좋은 하루일 뿐입니다. 그에 맞게 당신의 절차에 비중을 두세요. 오탐과 고발당했을 때 해야 할 일에 관한 우리 가이드는 이 책상 반대편에 있는 사람을 위해 쓰였으며, 이메일을 보내기 전에 읽어볼 가치가 있습니다.
신호가 서로 충돌할 때는 어떻게 해야 할까요?
그것들은 충돌할 것입니다. 그것이 예외가 아니라 일반적인 경우입니다.
높은 탐지기 점수, 설득력 있는 출처 답변. 점수보다 절차 증거를 신뢰하세요. 기록을 남기고 싶다면 초안 이력을 요청한 뒤, 그 사안을 마무리하세요. 정형화된 글쓰기와 과도한 편집은 모두 정당한 작업에서도 높은 수치를 만들어냅니다.
낮은 탐지기 점수, 회피하는 답변. 낮은 점수는 결백을 뜻하지 않습니다. 작성자가 자신의 논증을 설명하지 못한다면, 그것은 당신이 직접 다룰 수 있는 글쓰기 문제입니다. 근거를 첨부한 수정본을 요청하세요. 이는 일반적인 편집 요청이며 AI를 언급할 필요가 전혀 없습니다.
모든 항목이 플래그되고, 작성자는 영어가 모국어가 아닌 사람입니다. 이는 실제에서 가장 흔한 오탐 패턴입니다. 예측 가능한 표현과 단순한 문장 구조가 점수를 끌어올립니다. 무엇이든 결정하기 전에 탐지기가 비원어민 영어 작성자를 플래그하는 이유에 관한 글을 읽고, 원본 대화에 훨씬 더 큰 비중을 두세요.
두 탐지기의 결과가 서로 다릅니다. 서로 다른 신호에 가중치를 두고 서로 다른 임계값을 사용하기 때문에 흔히 그렇습니다. 불일치는 정보입니다. 즉, 해당 텍스트가 모호한 영역에 있다는 것을 알려줍니다. 대표 수치보다 문장 수준의 출력을 비교하고, 동일한 문장이 두 탐지기 모두에서 플래그되는지 확인하세요. 그렇지 않다면 증거가 약한 것입니다.
작성자가 일부에 AI를 사용했음을 인정합니다. 이제는 탐지의 영역이 아니라 정책의 영역입니다. 소속 기관이나 출판물이 보조 초안 작성에 대해 실제로 무엇이라고 규정하는지 확인한 뒤, 그 규칙을 해당 구체적 사용에 적용하세요. 많은 정책이 보조를 허용하면서 저자 표시의 허위 기재를 금지합니다. 이는 텍스트가 기계처럼 읽히는지와는 다른 문제이며, 처음부터 물었어야 할 질문입니다.
수치가 뒷받침하는 한 가지가 더 있습니다. AI 특유의 표현은 신뢰할 만한 지름길이 아닙니다. 동일한 2026-09-13 측정에서 사람이 작성한 표본은 100단어당 약 4개의 AI 특유 표현이 나타났고, 편집하지 않은 모델 출력은 100단어당 약 1개가 나타났습니다. 이른바 결정적 단서라고 여겨지는 표현은 오히려 사람이 쓴 글에서 더 자주 나타났습니다. “delve”와 “moreover”를 세라고 알려주는 체크리스트는 잘못된 것을 측정하고 있는 것입니다.
다음 제출물이 도착하기 전에 분류 단계를 문서로 적어 두세요. 작성자에게 보여줄 수 있는 절차만이 이의 제기를 견뎌내며, 신호가 진정으로 일치할 때 양심에 거리낌 없이 행동할 수 있게 해주는 유일한 절차입니다.
측정 참고: 이 글의 수치는 2026-09-13에 자체 탐지기를 실행하여 얻은 결과입니다 — 손으로 작성한 가이드 n = 23 대 편집되지 않은 모델 출력 n = 12, 중앙값 AI 점수는 각각 22%와 34%입니다. 방법: /methodology/.