탐지기는 입력할 때 어떤 소프트웨어가 열려 있었는지 알 수 없습니다. 완성된 텍스트를 읽고 단어 선택이 얼마나 예측 가능한지 추정합니다. 자동 완성을 사용했다고 해서 텍스트가 기계가 생성한 것으로 식별되지는 않지만, 탐지기가 사람의 글을 잘못 분류할 수는 있습니다.

탐지기가 실제로 측정하는 것

이러한 도구는 텍스트의 통계적 특성을 살펴봅니다. 앞에 나온 단어를 기준으로 각 단어가 얼마나 예측 가능한지, 문장 길이가 얼마나 다양하게 변하는지, 어휘가 얼마나 폭넓은지를 측정합니다. 언어 모델이 생성한 텍스트는 이러한 분포에서 확률이 높은 중간 영역에 놓이는 경향이 있습니다. 모델이 그렇게 생성하도록 만들어졌기 때문입니다. 사람의 글은 더 자유롭게 오갑니다.

이는 텍스트에 대한 판단이지, 텍스트가 어떻게 만들어졌는지에 대한 기록이 아닙니다. 문서에는 어떤 키 입력이 제안에서 비롯되었는지 알려 주는 정보가 없으며 — 반대로 우연히 평범하고 규칙적인 글이 된 경우에도 이를 보호해 주는 정보가 없습니다.

연구 결과는 탐지기에 호의적이지 않습니다

스탠퍼드의 Liang, Yuksekgonul, Mao, Wu, Zou가 실시한 독립 평가가 Patterns 에 2023년에 게재되었습니다. 연구진은 사람이 작성한 TOEFL 에세이 91편과 미국 중학교 2학년 학생들이 역시 직접 작성한 에세이 88편에 널리 사용되는 탐지기 7개를 적용했습니다.

  • 중학교 2학년 에세이는 정확하게 분류되지 않았습니다 — 약 5.1%가 잘못 표시되었습니다.
  • TOEFL 에세이는 그렇지 않았습니다. 평균 오탐률은 61.3%였습니다.
  • 7개 탐지기 모두 TOEFL 에세이의 19.8%를 잘못 표시했습니다.
  • 탐지기 중 하나 이상은 해당 에세이의 97.8%를 표시했습니다.

저자들은 이 결과를 탐지기가 사용하는 특징 때문이라고 설명합니다. 제한된 어휘 범위와 예측 가능한 문장 구조는 탐지기에게 기계적인 특징처럼 보일 수 있지만, 제2언어로 작성된 글에서도 흔히 나타납니다. 따라서 이러한 도구는 통계적으로 평범하다는 이유만으로 사람이 작성한 글에 불이익을 줄 위험이 있습니다.

이 연구는 2023년에 수행되었고 그 이후 탐지기도 바뀌었습니다. 그러나 문제의 본질은 달라지지 않았습니다. 탐지기는 확률적 분류기이며, 누구를 고발할 때 의존할 수 있는 문서별 오류율을 공개하는 탐지기는 하나도 없습니다.

그렇다면 자동 완성은 어디에 해당할까요

전적으로 텍스트의 어느 부분을 직접 작성했는지에 달려 있습니다.

사용자가 한 일 탐지기가 보는 것
직접 구성한 문장에서 몇 개의 단어 완성 제안을 수락함사용자의 구조와 어휘로 작성된 글
일상적인 문장을 마무리하려고 가끔 구문을 수락함대부분 사용자가 작성한 글입니다. 어느 쪽이든 일상적인 문장은 일상적입니다.
챗봇에게 문단을 작성해 달라고 요청하고 붙여 넣음생성된 텍스트입니다. 실제로 생성된 텍스트이기 때문입니다.
제2언어로 직접, 평범하게 작성함그래도 표시될 수 있습니다 — 위 내용을 참고하세요

중요한 구분 기준은 텍스트를 직접 구성했는지 여부입니다. 자신의 문장을 제안으로 완성하면 작성자의 구성은 그대로 유지되지만, 생성된 문단을 요청하고 수락하면 그렇지 않습니다.

독창성을 평가받는 경우

  • 실제 규정을 확인하세요. 많은 기관은 맞춤법, 문법 및 예측 텍스트 보조 기능을 허용하고 생성된 콘텐츠는 금지합니다. 모든 보조 기능을 금지하는 기관도 있습니다. 어느 쪽이든 추측하는 것보다 서면 규정이 더 중요합니다.
  • 버전 기록을 보관하세요. Google Docs와 Word에는 모두 버전 기록이 있습니다. 몇 시간에 걸쳐 내용이 추가되고 삭제되며 문장이 두 번씩 작성된 문서는 실제로 글을 작성해 온 과정의 기록입니다 — 점수와는 다른 종류의 증거이며, 점수로는 이에 답할 수 없습니다.
  • 탐지기를 피하려고 글을 다시 작성하지 마세요. 점수를 낮추려고 흔하지 않은 단어로 문장을 부풀리면 글이 더 나빠지고, “humanizer” 도구가 하는 작업과 구분할 수 없게 됩니다. 의심을 받는다면 버전 기록이 답입니다.
  • 점수는 판정이 아니라 대화를 시작하는 자료로 보세요. 앞서 본 것과 같은 오탐률을 고려하면, 정직하게 말해 점수가 할 수 있는 일은 그것뿐입니다.

로컬 자동 완성이 다른 점

탐지와 관계없는 실용적인 차이도 하나 있습니다. 클라우드 글쓰기 도우미는 제안을 생성하기 위해 입력한 내용을 서버로 전송합니다. Typeahead Typeahead는 llama.cpp를 통해 사용자의 PC에서 소형 모델을 실행하므로, 모델을 다운로드한 뒤에는 사용자가 작성하는 어떤 내용도 어디에도 전송되지 않으며 연결이 전혀 없어도 작동합니다.

이미 작성 중인 문장의 다음 몇 단어를 커서 옆에 제안하고, Tab을 누르지 않으면 아무것도 삽입하지 않습니다. 문단을 생성하지 않으며, 문서에 생성된 텍스트를 실제로 추가하게 만드는 기능인 “대신 작성해 줘” 기능도 없습니다.

그렇다고 해서 특정 탐지기 결과가 보장되는 것은 아닙니다. 사용자의 문장은 계속 사용자의 컴퓨터에 남아 있으며, 이 도구에는 사용자를 대신해 문단을 생성하는 기능이 없습니다.

출처

자주 묻는 질문

AI 탐지기가 내가 자동 완성을 사용했다는 사실을 알아낼 수 있나요?
아니요. 탐지기는 완성된 텍스트의 통계적 패턴을 분석합니다. 어떤 소프트웨어가 실행 중이었는지, 어떤 키 입력이 제안에서 비롯되었는지에 대한 기록은 없습니다.
AI 탐지기는 얼마나 정확한가요?
점수만으로 증거라고 봐서는 안 될 만큼 신뢰하기 어렵습니다. 스탠퍼드 평가가 Patterns 2023년에 발표되었으며, 7개 탐지기는 사람이 작성한 TOEFL 에세이를 평균 61.3% 잘못 표시했고, 미국 중학교 2학년 학생들이 작성한 에세이도 약 5.1% 잘못 표시했습니다.
탐지기는 왜 비원어민 영어 작가를 그렇게 자주 표시하나요?
탐지기는 제한된 어휘 범위와 예측 가능한 문장 구조를 기계적인 특징으로 간주하지만, 이는 제2언어로 능숙하게 작성한 글에서 나타나는 특징이기도 합니다. 편향은 탐지기가 측정하는 대상에 있습니다.
예측 텍스트를 사용하는 것은 부정행위로 간주되나요?
기관의 공식 규정에 따라 다르며, 규정은 서로 다릅니다. 많은 기관은 입력 보조 기능이 아니라 생성된 콘텐츠를 기준으로 선을 긋습니다. 어느 쪽이라고 단정하지 말고 물어보세요.
부당하게 표절 또는 부정행위 의심을 받으면 어떻게 해야 하나요?
문서의 버전 기록을 보여 주세요. Google Docs와 Word는 모두 파일이 시간에 따라 어떻게 작성되었는지 기록하며, 편집 기록은 실제로 글을 작성해 온 과정의 기록입니다 — 확률 점수로는 알 수 없는 부분입니다.
Typeahead가 제 대신 문단을 작성하나요?
아니요. 입력 중인 문장의 다음 몇 단어를 제안하고, Tab을 눌렀을 때만 삽입합니다. 문단을 생성하는 명령은 없습니다.