Anthropic의 Claude Opus 5.5가 엠 대시를 사실상 쓰지 않게 됐다. 기계가 쓴 글을 가리키는 표식처럼 통하던 그 문장 부호다. 연구 기업 Graphite가 10월 1일 공개한 후속 연구는 이 모델의 엠 대시 사용량을 1000단어당 0.015개로 측정했다. Opus 5의 2.92개와 비교하면 99% 줄어든 값이다. 반면 모델 지문의 나머지 부분은 거의 손대지 않은 채 살아남았다.
핵심 요약
- Opus 5.5의 엠 대시 사용량은 1000단어당 0.015개로, Opus 5의 2.92개에서 99% 감소했다.
- Graphite는 Opus 5.5 출력에서 서로 다른 흔적 2548개를 여전히 셌다. Opus 5에서 찾은 2666개보다 4% 적은 수준이다.
- "this matters"라는 표현은 ChatGPT 출시 이전에 쓰인 기사 모음보다 Opus 5.5의 글에서 116배 자주 등장했다.
Graphite는 인간 필자보다 최소 두 배 자주 쓰이는 단어와 구절, 문장 틀을 흔적으로 정의한다. 이 기준으로 Opus 5.5가 지닌 흔적은 2548개이며, Opus 5의 2666개에서 줄어든 값이다. AI 문체에서 가장 쉽게 알아보는 습관 하나를 지웠더니 전체 수치는 4%만 움직였다.
Opus 5.5를 들키게 하는 표현들
연구에서 가장 두드러진 단어는 "dependable"이다. Opus 5.5는 인간 대조군보다 이 단어를 23배 자주 끌어다 썼다. 가장 강한 구조적 습관은 의미를 강조하려는 충동이다. "this matters"는 인간 텍스트보다 116배, "why _ matters" 틀은 92배 자주 나왔다.
이전 Claude 버전을 규정했던 "it's not X, it's Y" 구문은 모델이 버렸다. Graphite의 최고 AI 책임자 Gregory Druck은 TechCrunch에 그 자리를 가까운 친척 격 표현이 차지했다고 말했다. 이제 모델은 무엇이 단순한 X 이상이며 실은 Y라고 말하는 방식을 선호한다는 설명이다.
Graphite가 말뭉치를 만든 방법
방법론은 Graphite의 9월 16일 보고서에서 왔다. ChatGPT 출시 이전에 발행된 기사 1만 건을 인간 기준선으로 모은 뒤, 최전선 대규모 언어 모델 9종에 각 기사를 요약문에서 다시 쓰게 했다. 그 결과 주제가 서로 맞물린 기계 작성 기사 9만 건이 나왔고, 대부분의 문체 비교를 교란하는 주제 편향이 제거됐다.
길이를 보정한 사용 빈도를 비교해 9개 모델 전체에서 고유 흔적 1만 2877개를 찾아냈다. 모델별로는 2355개에서 3746개 사이였다. 이 가운데 약 65%는 특정 모델 계열 하나에만 속했다. 다른 지표도 두 집단을 그만큼 깔끔하게 갈랐다. AI 기사는 단어당 평균 5.2~5.7자였고 인간은 4.9자였으며, AI 쪽 문장 길이 편차는 훨씬 작았다.
경쟁 모델이 남기는 흔적
OpenAI의 GPT-6 Astra는 교정형 서술에 기댄다. "not simply X"나 "rather than relying on X" 같은 구문으로 대상을 그것이 아닌 것으로 정의하는 방식이다. Graphite는 이 습관을 인간 대비 약 12배로 측정했다. Google의 Gemini 3.1 Pro는 대신 "absolutely", "highly" 같은 강조어를 인간의 13배로 선호했고, "furthermore" 같은 격식 있는 연결어도 함께 썼다.
Graphite의 과장된 문체 점수에서 Opus 5와 Gemini 3.1 Pro는 인간 기준선의 2.5배 근처에 자리했고, Astra는 1.2배로 측정됐다. Opus 5.5는 자기 점수를 16.75에서 10.57로 끌어내렸다. 37% 줄인 값이지만 여전히 인간의 약 1.6배다. 전체 단어 분포도 인간 텍스트 쪽으로 이동해, 유니그램 발산값이 0.064에서 0.052로 내려갔다.
흔적이 계속 되살아나는 이유
Druck은 TechCrunch에 Claude의 단어 분포가 버전을 거치며 인간의 글쓰기에 가까워진 반면 OpenAI 모델은 더 멀어졌다고 말했다. 또 흔적의 총량은 줄어드는 게 아니라 제자리를 지키고 있다고 했다. 연구소들이 가장 널리 알려진 흔적을 걷어내면 그 자리에 새로운 습관이 떠오르고, 그 습관은 버전마다 다르다는 것이다. 그는 이를 규모의 문제로 봤다. 파라미터가 수십억 개인 모델은 연구소가 출시 전에 돌릴 수 있는 유한한 테스트를 앞질러 버린다는 주장이다.
두 연구소 모두 바로 이 지점에서 진전을 이뤘다고 밝힌 바 있다. Anthropic은 Opus 5.5 발표에서 이 모델이 이전 세대보다 더 자연스럽게 소통하며, 초기 사용자들이 글이 더 명확하고 읽기 쉬워졌다고 평가했다고 전했다. OpenAI도 GPT-6 기반 Sol과 Luna를 두고 비슷한 주장을 내놨다. 더 명확하고, 전문 용어가 줄고, 어색한 표현도 적어졌다는 약속이었다.
AI 탐지에 주는 함의
발행사와 탐지 솔루션 업체에 남는 실질적 교훈은 단일 신호 휴리스틱이 빨리 낡는다는 점이다. 쓸 만할 정도로 유명해진 흔적이라면, 사후 학습 단계에서 깎여 나갈 만큼 유명해졌다는 뜻이기도 하다. Graphite는 흔적 데이터와 원본 기사 말뭉치를 내려받을 수 있다고 밝혔다. 분류기를 만드는 쪽에는 모델별 어휘집을, 연구소에는 점검 목록을 넘겨주는 셈이다. ChatGPT 이후 발행된 웹 페이지의 35%에서 AI 작성 징후가 나타났다는 Pew 조사를 다룬 본지 기사는 이 질문이 지금 얼마나 많은 텍스트를 포괄하는지 보여준다.
FAQ 자주 묻는 질문
엠 대시는 아직 믿을 만한 AI 탐지 신호인가?
아니다. Graphite는 Opus 5.5의 엠 대시를 1000단어당 0.015개로 측정했다. Opus 5보다 99% 낮은 값이며, Gemini 3.1 Pro도 이 부호를 거의 없앤 것으로 나타났다. GPT-6 Astra는 ChatGPT 이전 인간 말뭉치보다 88% 덜 쓴다. 이제는 엠 대시가 있다는 사실보다 없다는 사실이 최근 학습 방식을 더 많이 말해준다.
Graphite가 찾아낸 AI 글쓰기 흔적은 모두 몇 개인가?
9월 보고서는 9개 모델에 걸쳐 AI가 인간보다 최소 두 배 자주 쓰는 단어·구절·문장 틀 1만 2877개를 고유 항목으로 식별했다. 모델별로는 각각 2355~3746개였고, 전체의 약 65%는 특정 모델 계열에만 나타나는 흔적이었다.
데이터를 독립적으로 검증할 수 있는가?
가능하다. Graphite는 흔적 데이터와 원본 기사 말뭉치를 보고서 페이지에서 내려받을 수 있다고 밝혔다. 10월 후속 연구는 같은 방법론을 Claude Opus 5.5에 적용하고, 인간 기준선 대비 표현별 비율을 함께 제시했다.






