같은 한 시간 안에 전혀 다른 두 사람이 검색창에 AI 탐지기라고 입력합니다. 한 사람은 언어 모델의 도움을 받아 초안을 쓴 마흔 개의 페이지를 공개한 뒤, 그 때문에 Google이 사이트에 불이익을 줄 것이라는 말을 들은 마케팅 담당자입니다. 다른 한 사람은 어떤 도구가 숫자 하나를 내놓았고 권한을 가진 누군가가 그것을 믿었다는 이유로 부정행위를 의심받은 사람입니다.

두 사람이 도착하는 곳은 확신을 파는 종류의 소프트웨어이고, 두 사람 모두 불편한 쪽의 답을 들을 자격이 있습니다. 이 도구들에 대해 공개된 증거는 일관되며 그리 호의적이지 않습니다. 점수가 한 사람에 관해 무엇도 결정해서는 안 될 만큼 자주 틀리고, 사람이 손을 댄 글 앞에서는 무너지며, 그 오류는 필자들 사이에 고르게 흩어져 있지도 않습니다.

검색 엔진에 관한 질문은 별개의 질문이고 별개의 답을 가지며, 그 답은 탐지와는 아무 상관이 없습니다.

이 도구들은 정확한가, 그리고 Google은 AI 콘텐츠에 불이익을 주는가. 동료 심사를 거친 검증에서 모든 도구가 정확도 80% 아래에 머물렀고, 다른 말로 바꿔 쓴 AI 텍스트에서는 26%까지 떨어졌습니다. 별도의 연구에서는 탐지기가 영어 비원어민의 에세이를 AI가 썼다고 판정한 비율이 61.3%였습니다. Google은 AI가 생성했다는 이유로 콘텐츠를 제재하지 않습니다. 제재하는 것은 대규모 콘텐츠 남용(scaled content abuse)이며, 이는 목적과 가치의 문제이지 누가 썼는가의 문제가 아닙니다.


AI 탐지기는 실제로 어떻게 작동하는가

이 분야에서 팔리는 것의 거의 전부는 두 계열 가운데 하나에 속하고, 그 구분은 중요합니다. 실패하는 방식이 서로 다르기 때문입니다.

퍼플렉시티와 버스티니스

오래된 계열은 텍스트 자체의 통계적 성질을 측정합니다. 퍼플렉시티는 앞선 단어들이 주어졌을 때 언어 모델이 각 단어를 얼마나 뜻밖으로 느끼는지를 나타내므로, 모델이 보기에 예측하기 쉬운 문장일수록 값이 낮게 나옵니다. 버스티니스는 그 예측 가능성이 문장에서 문장으로 얼마나 출렁이는지를 나타냅니다. 사람이 쓴 글은 뻔한 것과 낯선 것 사이를 오가지만 생성된 텍스트는 더 좁은 띠 안에 머문다는 전제를 깔고 있는 지표입니다.

이렇게 만들어진 도구는 기계를 식별하고 있는 것이 아닙니다. 문장이 얼마나 관습적인지를 측정한 다음, 관습적인 문장은 기계의 문장이라고 단언하고 있을 뿐입니다. 그 추론이 곧 제품의 전부이며, 모든 실패 양상은 거기에서 나옵니다.

생성 텍스트로 학습한 분류기

새로운 계열은 사람이 쓴 텍스트와 생성된 텍스트를 짝지은 말뭉치로 모델을 학습시켜 둘을 가르는 무엇이든 배우게 합니다. 학습한 분포 위에서는 순수한 퍼플렉시티보다 성적이 좋지만, 더 까다로운 문제를 함께 물려받습니다. 그 분포는 모델이 갱신될 때마다, 또는 프롬프트가 문체의 결을 바꿀 때마다 이동합니다.

두 계열 모두 그 텍스트가 어떻게 만들어졌는지에 관한 사실에는 전혀 접근하지 못합니다. 둘 다 완성된 결과물만 보고 문체를 추측하고 있으며, 바로 그래서 문체를 바꾸면 무력해집니다. 세 번째 접근인 워터마킹은 작동 방식이 다르고 뒤에서 다룹니다. 추론이 아니라 증거에서 출발하는 유일한 방법이기 때문입니다.

AI 탐지기 정확도에 대해 연구는 무엇을 말하는가

열네 개 도구 벤치마크

가장 많이 인용되는 통제 실험은 2023년 International Journal for Educational Integrity에 실린 AI 생성 텍스트 탐지 도구 검증입니다. Weber-Wulff와 동료들은 54건의 시험 문서를 14개 도구, 즉 무료 12개와 상용 2개(Turnitin과 PlagiarismCheck)에 통과시켜 모두 756회의 개별 시험을 수행했습니다.

결과는 가차 없습니다. 모든 도구가 정확도 80%를 밑돌았고 70%를 넘긴 것은 다섯 개뿐이었습니다. 진짜로 사람이 쓴 문서에 대한 정확도는 96%로, 이것만 보면 나쁘지 않지만 나머지를 보면 인상이 달라집니다. 손대지 않은 AI 텍스트에서는 74%. 사람이 가볍게 편집한 AI 텍스트에서는 42%. 다른 말로 바꿔 쓰는 도구를 거친 AI 텍스트에서는 26%였습니다.

논문은 자신들의 결과가 “일부 AI 생성 텍스트 탐지 도구가 주장하는 바와 상당히 다르다"고 적고 있습니다. 그리고 마땅히 더 자주 인용되어야 할 결론은 이렇습니다. 이 도구들은 “정확하지도 신뢰할 만하지도 않으며”, “우리가 검증한 시스템은 학술 환경에서 사용되어서는 안 된다”.

상용 선두 제품을 검증한 2026년 연구

3년 뒤 같은 학술지의 2026년 2월 연구는 Turnitin과 Originality를 192건의 텍스트로 이루어진 균형 잡힌 묶음으로 검증했습니다. 구성은 생성형 AI가 널리 쓰이기 전에 나온 진짜 학생 글, 전문가가 쓴 사람 글, AI 출력, 그리고 둘을 대략 절반씩 섞어 만든 혼합 문서입니다.

Originality의 매크로 평균 정확도는 0.69, Turnitin은 0.61이었고 둘 다 매크로 평균 F1 점수가 0.55에 못 미쳤습니다. 오늘날 대부분의 사람이 실제로 글을 쓰는 방식에 해당하는 혼합 텍스트에서 Originality의 재현율은 거의 0이었습니다. 거의 한 건도 잡아내지 못했다는 뜻입니다.

기술 콘텐츠를 내는 사람이라면 분야별 격차라는 발견이 더 신경 쓰일 것입니다. Turnitin의 정확도는 인문 분야 텍스트의 0.86에서 과학 분야의 0.51로 떨어졌습니다. Originality는 0.96에서 0.58로 떨어졌습니다. 두 차이 모두 통계적으로 유의했습니다. 과학 글쓰기에서 0.51이라면 탐지기가 하는 일은 동전을 던지는 것과 크게 다르지 않습니다.

자신의 실패를 스스로 공개한 유일한 업체

OpenAI는 2023년 1월 분류기를 내놓았다가 거두어들였습니다. 자사 공지 페이지에는 지금 “2023년 7월 20일부로 정확도가 낮아 AI 분류기를 더 이상 제공하지 않는다"는 안내가 붙어 있고, 원래 본문에는 숫자가 그대로 남아 있습니다. 이 분류기는 “AI가 쓴 텍스트의 26%를 AI가 썼을 가능성이 높음으로 올바르게 식별하는 한편, 사람이 쓴 텍스트를 9%의 비율로 AI가 쓴 것으로 잘못 표시한다"고 되어 있습니다. 페이지는 또한 이것을 “주된 의사결정 도구로 사용해서는 안 된다"고 경고했습니다. 학습 분포에 가장 가까이 접근할 수 있는 조직이 진양성률을 대략 넷에 하나로 보고한 것입니다.

오탐 문제, 그리고 그것이 누구에게 떨어지는가

TOEFL 연구

Liang, Yuksekgonul, Mao, Wu, Zou가 쓴 GPT 탐지기는 영어 비원어민 필자에게 편향되어 있다는 2023년 학술지 Patterns에 실렸습니다. 방법은 단순합니다. 널리 쓰이는 탐지기 7개를 영어 비원어민이 쓴 TOEFL 에세이 91편과 미국 8학년 학생이 쓴 에세이 88편에 돌렸습니다.

미국 학생들의 글은 탐지기들이 정확하게 처리했습니다. TOEFL 에세이에서는 평균 오탐률이 61.3%였습니다. 사람이 쓴 이 에세이들 가운데 19.8%는 일곱 개 모두가 일치해 AI가 썼다고 표시했고, 97.8%는 적어도 하나의 탐지기가 표시했습니다.

그다음 연구진은 판을 뒤집어 보이는 조작을 하나 더했습니다. 같은 에세이를 더 문어적인 어휘로 다시 쓰게 하자 평균 오탐률은 61.3%에서 11.6%로 떨어졌습니다.

오류가 하필 그곳에 떨어지는 이유

그 하락은 무엇이 측정되고 있는지를 그대로 지목합니다. 도구가 탐지하는 것은 어휘의 폭이 좁다는 사실이고, 그것은 제2언어로 글을 쓸 때 따라오는 성질입니다. 그것을 기계가 썼다고 보고하고 있을 뿐입니다. 2023년 벤치마크도 다른 각도에서 같은 효과를 찾아냈습니다. 사람이 쓴 텍스트를 기계 번역으로 영어로 옮기면 정확도가 20퍼센트포인트 떨어졌으므로, 모국어로 초안을 쓰고 번역하는 연구자는 억울한 혐의를 쓸 위험이 그만큼 높아집니다.

여기서 따라 나오는 결론은 아슬아슬한 판단이 아닙니다. 식별 가능한 하나의 필자 집단에 대해 오탐률 61.3%를 보이는 도구는 사람에 관해 중대한 결과를 낳는 판단에 사용되어서는 안 됩니다. 2023년 논문은 그 실무적 의미를 잘 표현합니다. 이 도구들이 돌려주는 것은 아무 증거도 붙어 있지 않은 백분율이며, 그것만을 근거로 고발당한 학생에게는 “방어할 가능성이 전혀 없다"는 것입니다.

편집이 AI 탐지기를 무력화하는 이유

가장 분명한 실험은 Krishna, Song, Karpinska, Wieting, Iyyer의 의역은 AI 생성 텍스트 탐지기를 피해 간다입니다. 이들은 DIPPER라는 110억 파라미터 의역 모델을 만들어 생성 텍스트를 통과시켰습니다. 오탐률을 1%로 고정한 조건에서 DetectGPT의 탐지 정확도는 70.3%에서 4.6%로 떨어졌습니다. 워터마킹, GPTZero, OpenAI의 분류기도 마찬가지로 회피되었습니다.

여기서 따라오는 귀결을 곱씹어 볼 만합니다. 그것이 이 분야 전체에 대한 정직한 요약이기 때문입니다. 손대지 않은 출력이 74%로 탐지되고 편집된 출력이 42%로 탐지된다면, 도구가 안정적으로 식별하는 것은 기계가 썼다는 사실이 아닙니다. 성의 없음입니다. 채팅 창에서 그대로 붙여 넣은 페이지는 걸립니다. 유능한 편집자가 3분의 1을 덜어내고, 저자만 아는 구체적인 사실 두 가지를 넣고, 도입부를 다시 쓴 뒤의 같은 페이지는 걸리지 않습니다. 탐지기는 들인 공의 대리 지표이며, 그것도 형편없는 대리 지표입니다.

Krishna 논문이 제안한 방어책은 애초에 탐지가 아니라는 점에서 적어 둘 가치가 있습니다. 그것은 검색입니다. 과거에 생성된 1500만 건의 시퀀스로 이루어진 데이터베이스에서 근사 일치를 찾는 방식으로, 사람이 쓴 텍스트를 1% 잘못 표시하는 수준에서 의역된 생성물의 80%에서 97%를 잡아냈습니다. 이것이 통하는 이유는 실제로 생성된 기록과 대조하기 때문입니다. 동시에 이 방법은 모델 제공자가 그 기록을 보관하고 대조를 실행할 것을 요구하며, 이는 공개된 어떤 도구도 할 수 없는 일입니다.

워터마킹, 기술적으로 진지한 대안

무엇이 다른가

워터마킹은 나중에 추측하는 대신 생성 시점에 개입합니다. Google DeepMind의 텍스트용 SynthID는 로짓 프로세서로 샘플링 루프 안에 자리 잡으며, Google 자신의 표현으로는 “의사난수 g 함수를 사용해 모델의 로짓을 증강함으로써, 텍스트 품질을 크게 해치지 않으면서 해당 텍스트가 자신의 모델에서 생성되었는지 판별할 수 있는 방식으로 워터마크 정보를 인코딩"합니다. 개발자 문서는 워터마크 있음, 없음, 불확실 가운데 하나를 돌려주는 베이즈 탐지기를 설명합니다.

Google은 2024년 5월 Gemini 앱과 웹 환경에 텍스트 워터마킹을 도입한다고 발표했습니다. 이는 실제 배포이며, 문체 추측과는 종류가 다른 주장입니다. 신호가 추론된 것이 아니라 의도적으로 삽입된 것이기 때문입니다.

Google이 스스로 밝힌 한계

같은 문서는 무엇이 이것을 깨뜨리는지에 대해 솔직합니다. 워터마킹은 “사실을 서술하는 응답에서는 효과가 덜하다. 정확도를 떨어뜨리지 않으면서 생성에 손댈 여지가 적기 때문"이라고 하며, 탐지기의 “신뢰도 점수는 AI 생성 텍스트가 철저히 다시 쓰이거나 다른 언어로 번역될 때 크게 낮아질 수 있다"고 합니다. Google은 SynthID가 “동기를 가진 적대자가 해를 끼치는 것을 직접 막도록 설계되지는 않았다"고 덧붙입니다.

통계적 신호가 아니라 출처 메타데이터로 같은 문제에 접근하는 흐름도 있습니다. 현재 버전 2.4인 C2PA Content Credentials 규격은 암호학적으로 서명된 매니페스트를 결과물에 묶어 그 출처와 가해진 편집을 기록합니다. 참여는 명시적으로 선택 사항이며, 전 세계적 채택은 현재 상태가 아니라 목표로 내걸린 단계입니다.

두 접근은 같은 단단한 한계를 공유합니다. 둘 다 참여하는 제공자가 특정 문자열을 생성했다는 사실은 알려 줍니다. 참여하지 않는 제공자의 출력에 대해서는 아무것도 알려 주지 못하고, 신중한 사람이 어차피 하는 바로 그 다시 쓰기 앞에서 힘을 잃습니다. 워터마킹은 모델을 운영하는 쪽의 공급망 통제 수단입니다. 남의 문서를 감사하는 방법이 아닙니다.

Google은 AI 콘텐츠에 불이익을 주는가

Google의 입장은 2023년 2월에 공개되었고 그 뒤로 움직이지 않았습니다. Search Central 글의 제목은 AI 생성 콘텐츠에 대한 Google 검색의 안내이고, 절 제목은 “제작 방식과 무관하게 고품질 콘텐츠에 보상한다"이며, 무게를 지탱하는 문장은 이것입니다. “콘텐츠가 어떻게 제작되었는지가 아니라 콘텐츠의 품질에 초점을 맞추는 것은 수년 동안 사용자에게 신뢰할 수 있는 고품질 결과를 제공하는 데 도움이 된 유용한 지침입니다.”

이 글은 또한 “AI 생성을 포함해 자동화를 사용하는 모든 경우가 스팸인 것은 아니다"라고 밝히며, 자동화가 오래전부터 스포츠 경기 결과와 일기 예보와 녹취록을 만들어 왔다고 지적합니다. 위반이 되는 것은 AI를 포함한 자동화를 검색 결과 순위를 조작하려는 주된 목적으로 사용하는 경우입니다.

실제로 제재받는 것

실제로 물리는 정책은 대규모 콘텐츠 남용입니다. Google은 이를 “사용자를 돕기보다 검색 순위를 조작하려는 주된 목적으로 많은 페이지가 생성되는 경우"로 정의하며, “어떻게 만들어졌든 상관없이 사용자에게 가치를 거의 또는 전혀 제공하지 않는 독창적이지 않은 콘텐츠를 대량으로 만드는 것"을 겨냥합니다.

마지막 구절은 두 번 읽을 만합니다. 제작 방식은 명시적으로 무관하다고 되어 있습니다. 지명 템플릿으로 손수 찍어 낸 200개의 얄팍한 페이지는 모델이 찍어 낸 200개와 똑같은 정도로 이 정책을 위반합니다. Google의 생성형 AI 콘텐츠 사용 안내는 같은 이야기를 반대편에서 합니다. 이 기술은 조사와 구성에는 유용하지만, “사용자에게 가치를 더하지 않은 채 많은 페이지를 생성하는” 데 쓰면 “대규모 콘텐츠 남용에 관한 Google의 스팸 정책을 위반할 수 있다"는 것입니다.

그러므로 탐지해야 할 AI 페널티 같은 것은 없고, Google이 참조하는 탐지 점수도 없습니다. 갈림길은 목적과 가치입니다. 고객이 실제로 묻는 질문에 답하고 당신의 사업만이 아는 무언가를 담은 한 페이지는, 첫 초안을 모델이 썼다 해도 남용이 아닙니다.

점수 대신 무엇을 측정할 것인가

우리 자신의 숫자가 논증보다 이 점을 더 잘 보여 줍니다. 최근 28일 구간에서 이 사이트는 Google로부터 52,331회의 노출을 얻었고 531개의 검색어가 상위 열 개 안에 있었습니다. 그 531개가 만들어 낸 것은 28,847회의 노출과 161회의 클릭, 클릭률로는 0.56%입니다. 네 번째에서 열 번째 자리는 보통 2%에서 8%를 가져갑니다. 그중 452개는 클릭을 하나도 얻지 못했습니다.

이 가운데 어느 것도 탐지의 문제가 아닙니다. 차별화의 문제이며, 이 분야의 어떤 도구도 그것을 측정하지 않습니다.

지켜볼 가치가 있는 지표는 지금 차지한 순위 대비 클릭률, 그리고 AI 답변이 당신을 인용하는지 아니면 그저 순위만 매기는지입니다. 이에 대해서는 콘텐츠가 상위에 올라도 인용되지 않는 이유와 Google AI 모드가 트래픽에 의미하는 것에서 다뤘습니다. 그다음은 뒤따르는 편집 결정입니다. 구체적으로 아무것도 답하지 않는 페이지에는 콘텐츠 가지치기를, 한때 답했던 페이지에는 콘텐츠 리프레시를 적용합니다. 기술 SEO 감사는 같은 그림의 기계적인 절반, 즉 당신이 중요하게 여기는 페이지가 애초에 보일 자격이 있는지를 드러냅니다.

탐지기가 당신의 작업물을 표시했다면

점수는 증거가 아니다

그 숫자는 문체에 대한 모델의 의견이고, 그 텍스트가 어떻게 만들어졌는지에 관한 어떤 사실에도 접근하지 않은 채 산출됩니다. 이는 수사가 아니라 설계 그 자체입니다. 그 점을 분명히 말하고, 자신의 신뢰도를 근거로 다투는 대신 동료 심사를 거친 검증을 인용하십시오. 연구는 당신 편이고, 지금 의심받고 있는 것이 바로 당신의 신뢰도이기 때문입니다.

스스로 통제할 수 있는 출처 기록

버전 기록은 당신이 가질 수 있는 가장 강력한 것이며, 필요해지기 전부터 존재해야만 도움이 됩니다. 개정 이력을 남기는 시스템에 문서를 두고, 개요와 메모를 남기고, 읽은 자료와 읽은 시점을 남기십시오. 아흐레 동안 마흔 번의 저장을 거치며 자란 문서는 어떤 반대 점수보다도 훨씬 나은 답입니다.

생성형 AI가 나오기 전, 여러 해 전에 쓴 글에 같은 도구를 돌려 달라고 요구하십시오. 2026년 연구가 사용한 것이 바로 그 대조군입니다. 두 번째 도구가 같은 판정을 내리는지도 물으십시오. 도구 사이의 불일치, 그리고 같은 도구를 반복 실행했을 때의 불일치는 2023년 벤치마크에 기록되어 있습니다. 영어가 모국어가 아니거나 다른 언어로 초안을 쓰고 번역했다면, 61.3%라는 숫자와 번역에 따른 20퍼센트포인트의 하락을 결정을 내리는 사람 앞에 놓으십시오.

휴머나이저, 그리고 고장 난 검사를 이기는 일의 경제학

정말 중요한 사례의 26%에서 58%에서 이미 틀리는 검사를 이기려고 매달 구독료를 내는 것은 돈을 잘못 쓰는 일입니다. 게다가 2023년 벤치마크는 이 분야의 한 도구가 사용자에게 탐지되는 AI 콘텐츠가 줄어들 때까지 텍스트를 편집하라고 조언했다고 기록했습니다. 한 업종이 자기 전제를 스스로 반박하고 있는 셈입니다.

구독료 말고도 실제 비용이 있습니다. 휴머나이징 처리는 어휘 분산을 늘리는 방식으로 작동하고, 실무에서 그것은 유의어 치환과 얼버무리는 표현과 부풀린 문장을 뜻합니다. 결국 당신의 순위에 아무 영향도 주지 않는 기계에 맞춰 최적화하게 되고, 문의할지 말지를 실제로 결정하는 사람이 그 대가를 치릅니다. 여기에 쓸 예산이 있다면 편집자에게 쓰십시오.

에이전시가 실제로 가치를 더하는 지점

탐지기를 피하는 데가 아닙니다. 결과를 바꾸는 일은 편집 프로세스와 증명 가능한 전문성입니다. 경쟁사가 모르는 것 가운데 당신의 사업이 아는 것을 짚어 내는 주제 브리프, 실제 이력을 가진 실명 저자, 날짜와 함께 밝힌 출처, 그리고 그 일을 해 본 사람이 주장이 사실인지 확인하는 검토 단계입니다. 이 과정은 결과물을 탐지하기 어렵게 만들기도 하지만, 그것은 목적이 아니라 부수 효과입니다.

Mecanik은 그 전제 위에서 콘텐츠 프로그램을 설계하고, 기존 프로그램은 SEO 감사 서비스로 점검합니다. 출발점은 그 페이지가 어떻게 쓰였는가가 아니라 지금 무엇을 벌고 있는가입니다. 순위는 있는데 아무 일도 일어나지 않는다면 고쳐야 할 것은 구체성과 권위이며, 둘 가운데 무엇이 실제로 발목을 잡는지는 기술 SEO 감사가 알려 줍니다. 탐지기 점수는 보고서에 등장하지 않습니다. 당신이 행동으로 옮길 수 있는 것을 아무것도 측정하지 않기 때문입니다. 더 넓은 상업적 그림을 먼저 보고 싶다면, AI SEO 에이전시가 하는 일과 지불할 금액을 다룬 안내가 돈이 실제로 어디로 가는지를 설명합니다.



자주 묻는 질문

AI 탐지기는 정확한가요? 안정적으로 정확하지는 않습니다. 2023년 International Journal for Educational Integrity에 실린 연구는 14개 도구를 756회의 개별 시험으로 검증해 모두 정확도 80%를 밑돌았고 70%를 넘긴 것은 다섯 개뿐이라고 보고했습니다. 정확도는 손대지 않은 AI 텍스트에서 74%, 사람이 편집한 뒤 42%, 기계 의역 뒤 26%였습니다. 2026년 2월 Turnitin과 Originality를 다룬 연구에서 매크로 평균 정확도는 각각 0.61과 0.69였습니다.

Google은 AI가 생성한 콘텐츠에 불이익을 주나요? 아닙니다. Google이 공개한 안내는 콘텐츠가 어떻게 제작되었는지가 아니라 품질에 초점을 맞춘다고 밝히고 있으며, 자동화 사용이 모두 스팸인 것은 아니라고 말합니다. 정책을 위반하는 것은 대규모 콘텐츠 남용, 즉 사용자를 돕기보다 순위를 조작하려는 주된 목적으로 많은 페이지를 생성하는 일이며, Google은 이것이 콘텐츠 제작 방식과 무관하게 적용된다고 명시합니다.

AI 탐지기는 왜 영어 비원어민 필자를 표시하나요? 저자가 누구인지가 아니라 어휘의 다양성과 예측 가능성을 측정하기 때문입니다. 2023년 학술지 Patterns에 실린 연구는 탐지기 7개를 비원어민이 쓴 TOEFL 에세이 91편에 돌려 평균 오탐률 61.3%를 기록했고, 미국 8학년 에세이에서는 거의 정확한 결과를 얻었습니다. 같은 에세이를 더 문어적인 어휘로 다시 쓰자 오탐률은 11.6%로 낮아졌습니다.

AI 탐지기가 사람이 편집했는지 알아낼 수 있나요? 사실상 불가능하며 이것이 가장 큰 구멍입니다. 2023년 벤치마크에서 사람이 가볍게 편집한 AI 텍스트에 대한 정확도는 42%였고, 2026년 연구는 사람과 AI를 대략 절반씩 섞은 혼합 문서에서 재현율이 거의 0이라고 밝혔습니다. 의역에 관한 연구에서는 오탐률을 1%로 고정했을 때 한 탐지기가 70.3%에서 4.6%로 떨어졌습니다.

AI를 썼다고 잘못 고발당하면 어떻게 해야 하나요? 점수를 증거가 아니라 문체에 대한 의견으로 다루고, 발표된 연구를 인용해 그렇게 말하십시오. 스스로 통제할 수 있는 출처 기록, 즉 문서 버전 기록과 초안과 메모와 시각이 찍힌 자료를 제시하십시오. 생성형 AI가 존재하기 전에 쓴 작업물에 같은 도구를 돌려 달라고 요구하고, 두 번째 도구가 같은 판정을 내리는지도 물으십시오. 도구 사이의 불일치는 기록되어 있습니다.