AI 검증기라는 말을 처음 들었을 때는 저도 약간 단순하게 생각했습니다.
“아, 이 글이 ChatGPT로 썼는지 판별해주는 프로그램인가 보다.” 정도.
그런데 실제로 여러 개를 돌려보면 생각보다 훨씬 애매합니다.
같은 글인데 어떤 검증기는 “AI 작성 확률 95%”라고 하고, 다른 곳은 “사람 작성 가능성 높음”이라고 뜨는 경우가 꽤 많거든요.
심지어 제가 직접 손으로 쓴 메모도 AI라고 잡힌 적이 있었습니다.
──────────────────
【 AI 검증기라는 게 정확히 뭔가 】
대표적으로 많이 쓰는 건 이런 계열입니다.
원리는 대체로 비슷합니다.
문장의 패턴, 예측 가능성, 단어 반복, 문장 길이 규칙성 같은 걸 분석해서 “이건 AI 특유의 리듬이다”라고 추정하는 방식입니다.
문제는 여기서부터입니다.
AI도 점점 사람처럼 쓰고 있고, 사람도 요즘은 AI 스타일 영향을 많이 받아서 씁니다.
특히 정보성 글. 블로그 후기. 비교 리뷰. 이런 건 문체가 서로 섞이기 시작했어요.
그래서 검증기가 절대적인 판정기를 못 합니다.
━━━━━━━━━━━━━━━━━━
【 실제로 돌려보면 꽤 흔들린다 】
예전에 테스트 삼아 같은 내용을 이렇게 나눠서 넣어봤습니다.
결과가 재미있었는데,
초안 그대로는 거의 모든 검증기가 AI라고 잡았습니다. 이건 예상 범위.
근데 수정본부터 이상해집니다.
문장 순서 조금 바꾸고, 말투 섞고, 중간에 애매한 표현 넣고, 일부 문장을 짧게 끊으니까 판정이 확 흔들렸어요.
어떤 검증기는 80% → 20%까지 떨어졌습니다.
더 웃긴 건 직접 손으로 쓴 글인데도 “AI 가능성 높음” 뜬 적이 있다는 거.
특히 설명을 깔끔하게 잘 쓰는 사람들은 오히려 AI로 오탐되는 경우가 있습니다.
문장이 너무 정돈돼 있으면 그렇게 보는 거죠.
──────────────────
【 왜 신뢰도가 완벽하지 않은가 】
핵심은 이겁니다.
AI 검증기는 “증명”을 하는 게 아니라 “추정”을 합니다.
즉:
“이 문장은 AI가 썼을 확률이 높아 보인다”
정도지,
“100% AI가 작성했다”
를 기술적으로 확정하는 건 아닙니다.
OpenAI 쪽에서도 예전에 AI 텍스트 감지기를 공개했다가 정확도 문제 때문에 중단한 적이 있습니다. OpenAI
오탐(false positive)이 꽤 컸거든요.
영어보다 한국어는 더 어렵다는 얘기도 많습니다.
학습 데이터나 문체 분석량 차이 때문인지 한국어 검출은 특히 들쭉날쭉한 편입니다.
━━━━━━━━━━━━━━━━━━
【 그래도 왜 계속 쓰는가 】
완전히 못 믿을 정도는 아닙니다.
특히 아래 상황에서는 어느 정도 참고용으로는 쓸 만합니다.
이런 건 꽤 잘 잡습니다.
실제로 GPT 기본 출력 특유의 패턴이 있긴 해요.
“먼저~, 또한~, 결론적으로~” 같은 연결 구조 반복이라든가, 문단 길이가 지나치게 일정한 경우.
다만 사람이 개입해서 실제 경험을 섞고 문장을 흔들기 시작하면 정확도가 급격히 떨어지는 느낌이 있습니다.
──────────────────
【 그래서 현실적으로는 어떻게 봐야 하나 】
지금 기준으로 AI 검증기는:
이 정도에 가까운 것 같습니다.
특히 학교·회사·콘텐츠 플랫폼에서 검증 결과만으로 단정하는 건 꽤 위험하다는 의견도 많습니다.
실제로 억울한 사례 얘기도 계속 나오고 있고요.
개인적으로는 “AI 검출 여부”보다 더 중요한 건 결과물 자체였습니다.
결국 사람들은 그걸 더 빨리 눈치채더라고요.
검증기 점수보다 글의 살아있는 느낌이 훨씬 강하게 작동하는 경우가 많았습니다.