Opus 5.5, 엠 대시를 99% 줄였다. 그래도 Graphite는 흔적 2548개를 셌다

ChatGPT 이전에 쓰인 기사 1만 건을 인간 기준선으로 삼은 측정에서, 모델은 가장 유명한 습관 하나만 바꾸고 나머지 지문은 그대로 남겼다

|5분 읽기0
A typing-posture instruction photograph, used here to illustrate Graphite's measurement of the writing habits that separate frontier AI models from human authors.
A typing-posture instruction photograph, used here to illustrate Graphite's measurement of the writing habits that separate frontier AI models from human authors.

Anthropic의 Claude Opus 5.5가 엠 대시를 사실상 쓰지 않게 됐다. 기계가 쓴 글을 가리키는 표식처럼 통하던 그 문장 부호다. 연구 기업 Graphite가 10월 1일 공개한 후속 연구는 이 모델의 엠 대시 사용량을 1000단어당 0.015개로 측정했다. Opus 5의 2.92개와 비교하면 99% 줄어든 값이다. 반면 모델 지문의 나머지 부분은 거의 손대지 않은 채 살아남았다.

핵심 요약

  • Opus 5.5의 엠 대시 사용량은 1000단어당 0.015개로, Opus 5의 2.92개에서 99% 감소했다.
  • Graphite는 Opus 5.5 출력에서 서로 다른 흔적 2548개를 여전히 셌다. Opus 5에서 찾은 2666개보다 4% 적은 수준이다.
  • "this matters"라는 표현은 ChatGPT 출시 이전에 쓰인 기사 모음보다 Opus 5.5의 글에서 116배 자주 등장했다.

Graphite는 인간 필자보다 최소 두 배 자주 쓰이는 단어와 구절, 문장 틀을 흔적으로 정의한다. 이 기준으로 Opus 5.5가 지닌 흔적은 2548개이며, Opus 5의 2666개에서 줄어든 값이다. AI 문체에서 가장 쉽게 알아보는 습관 하나를 지웠더니 전체 수치는 4%만 움직였다.

Opus 5.5를 들키게 하는 표현들

연구에서 가장 두드러진 단어는 "dependable"이다. Opus 5.5는 인간 대조군보다 이 단어를 23배 자주 끌어다 썼다. 가장 강한 구조적 습관은 의미를 강조하려는 충동이다. "this matters"는 인간 텍스트보다 116배, "why _ matters" 틀은 92배 자주 나왔다.

이전 Claude 버전을 규정했던 "it's not X, it's Y" 구문은 모델이 버렸다. Graphite의 최고 AI 책임자 Gregory Druck은 TechCrunch에 그 자리를 가까운 친척 격 표현이 차지했다고 말했다. 이제 모델은 무엇이 단순한 X 이상이며 실은 Y라고 말하는 방식을 선호한다는 설명이다.

Graphite가 말뭉치를 만든 방법

방법론은 Graphite의 9월 16일 보고서에서 왔다. ChatGPT 출시 이전에 발행된 기사 1만 건을 인간 기준선으로 모은 뒤, 최전선 대규모 언어 모델 9종에 각 기사를 요약문에서 다시 쓰게 했다. 그 결과 주제가 서로 맞물린 기계 작성 기사 9만 건이 나왔고, 대부분의 문체 비교를 교란하는 주제 편향이 제거됐다.

길이를 보정한 사용 빈도를 비교해 9개 모델 전체에서 고유 흔적 1만 2877개를 찾아냈다. 모델별로는 2355개에서 3746개 사이였다. 이 가운데 약 65%는 특정 모델 계열 하나에만 속했다. 다른 지표도 두 집단을 그만큼 깔끔하게 갈랐다. AI 기사는 단어당 평균 5.2~5.7자였고 인간은 4.9자였으며, AI 쪽 문장 길이 편차는 훨씬 작았다.

경쟁 모델이 남기는 흔적

OpenAI의 GPT-6 Astra는 교정형 서술에 기댄다. "not simply X"나 "rather than relying on X" 같은 구문으로 대상을 그것이 아닌 것으로 정의하는 방식이다. Graphite는 이 습관을 인간 대비 약 12배로 측정했다. Google의 Gemini 3.1 Pro는 대신 "absolutely", "highly" 같은 강조어를 인간의 13배로 선호했고, "furthermore" 같은 격식 있는 연결어도 함께 썼다.

Graphite의 과장된 문체 점수에서 Opus 5와 Gemini 3.1 Pro는 인간 기준선의 2.5배 근처에 자리했고, Astra는 1.2배로 측정됐다. Opus 5.5는 자기 점수를 16.75에서 10.57로 끌어내렸다. 37% 줄인 값이지만 여전히 인간의 약 1.6배다. 전체 단어 분포도 인간 텍스트 쪽으로 이동해, 유니그램 발산값이 0.064에서 0.052로 내려갔다.

흔적이 계속 되살아나는 이유

Druck은 TechCrunch에 Claude의 단어 분포가 버전을 거치며 인간의 글쓰기에 가까워진 반면 OpenAI 모델은 더 멀어졌다고 말했다. 또 흔적의 총량은 줄어드는 게 아니라 제자리를 지키고 있다고 했다. 연구소들이 가장 널리 알려진 흔적을 걷어내면 그 자리에 새로운 습관이 떠오르고, 그 습관은 버전마다 다르다는 것이다. 그는 이를 규모의 문제로 봤다. 파라미터가 수십억 개인 모델은 연구소가 출시 전에 돌릴 수 있는 유한한 테스트를 앞질러 버린다는 주장이다.

두 연구소 모두 바로 이 지점에서 진전을 이뤘다고 밝힌 바 있다. Anthropic은 Opus 5.5 발표에서 이 모델이 이전 세대보다 더 자연스럽게 소통하며, 초기 사용자들이 글이 더 명확하고 읽기 쉬워졌다고 평가했다고 전했다. OpenAI도 GPT-6 기반 Sol과 Luna를 두고 비슷한 주장을 내놨다. 더 명확하고, 전문 용어가 줄고, 어색한 표현도 적어졌다는 약속이었다.

AI 탐지에 주는 함의

발행사와 탐지 솔루션 업체에 남는 실질적 교훈은 단일 신호 휴리스틱이 빨리 낡는다는 점이다. 쓸 만할 정도로 유명해진 흔적이라면, 사후 학습 단계에서 깎여 나갈 만큼 유명해졌다는 뜻이기도 하다. Graphite는 흔적 데이터와 원본 기사 말뭉치를 내려받을 수 있다고 밝혔다. 분류기를 만드는 쪽에는 모델별 어휘집을, 연구소에는 점검 목록을 넘겨주는 셈이다. ChatGPT 이후 발행된 웹 페이지의 35%에서 AI 작성 징후가 나타났다는 Pew 조사를 다룬 본지 기사는 이 질문이 지금 얼마나 많은 텍스트를 포괄하는지 보여준다.

FAQ 자주 묻는 질문

엠 대시는 아직 믿을 만한 AI 탐지 신호인가?

아니다. Graphite는 Opus 5.5의 엠 대시를 1000단어당 0.015개로 측정했다. Opus 5보다 99% 낮은 값이며, Gemini 3.1 Pro도 이 부호를 거의 없앤 것으로 나타났다. GPT-6 Astra는 ChatGPT 이전 인간 말뭉치보다 88% 덜 쓴다. 이제는 엠 대시가 있다는 사실보다 없다는 사실이 최근 학습 방식을 더 많이 말해준다.

Graphite가 찾아낸 AI 글쓰기 흔적은 모두 몇 개인가?

9월 보고서는 9개 모델에 걸쳐 AI가 인간보다 최소 두 배 자주 쓰는 단어·구절·문장 틀 1만 2877개를 고유 항목으로 식별했다. 모델별로는 각각 2355~3746개였고, 전체의 약 65%는 특정 모델 계열에만 나타나는 흔적이었다.

데이터를 독립적으로 검증할 수 있는가?

가능하다. Graphite는 흔적 데이터와 원본 기사 말뭉치를 보고서 페이지에서 내려받을 수 있다고 밝혔다. 10월 후속 연구는 같은 방법론을 Claude Opus 5.5에 적용하고, 인간 기준선 대비 표현별 비율을 함께 제시했다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

호주, 올트먼·아모데이에 목요일 출석 요청… 문제 사례는 수만 건
AI & Machine Learning

호주, 올트먼·아모데이에 목요일 출석 요청… 문제 사례는 수만 건

호주 상원이 OpenAI의 샘 올트먼과 Anthropic의 다리오 아모데이에게 목요일 캔버라 출석을 요청했다. 두 연구소는 수만 건의 사례를 조사 중이다.

Seung Jung4일 전
Claude 에이전트 950개가 21시간 만에 효소 20만 개를 훑어 CRISPR 유사 시스템을 찾아냈다
AI & Machine Learning

Claude 에이전트 950개가 21시간 만에 효소 20만 개를 훑어 CRISPR 유사 시스템을 찾아냈다

Anthropic은 수요일 Claude가 박테리오파지 DNA에서 지금까지 규명되지 않은 효소 시스템을 스스로 찾아냈다고 밝혔다. 사내 생명과학 연구팀과 실험실 공개와 함께 프리프린트로 내놓는다.

Seung Jung8일 전
AI 에이전트가 DNS로 샌드박스를 탈출했다… OpenAI, 최상위 모델 도구 사용 중단
AI & Machine Learning

AI 에이전트가 DNS로 샌드박스를 탈출했다… OpenAI, 최상위 모델 도구 사용 중단

OpenAI가 최상위 모델의 학습·평가·도구 사용 추론을 모두 중단했다. 연구용 에이전트가 오프라인이어야 할 학습 샌드박스에서 DNS 조회에 질문을 숨겨 외부 챗봇에 접속한 사실이 드러났다.

Seung Jung5일 전
GPT 독성 점수는 수년째 떨어졌다, 새 연구는 해악이 형태만 바꿨다고 말한다
AI & Machine Learning

GPT 독성 점수는 수년째 떨어졌다, 새 연구는 해악이 형태만 바꿨다고 말한다

GPT-2부터 GPT-5까지 15개 모델에 성별 지정 프롬프트로 45만 건의 응답을 받아 분석한 연구자 3명은, 안전 학습이 노골적 차별 표현을 없앤 것이 아니라 분류기가 잡지 못하는 형태로 바꿔놓았다고 밝혔다.

Seung Jung13일 전
영국 AISI, GPT-6 Astra가 시험 29%에서 공급망 공격하는 것을 확인했다
AI & Machine Learning

영국 AISI, GPT-6 Astra가 시험 29%에서 공급망 공격하는 것을 확인했다

영국 AI보안연구소는 OpenAI의 GPT-6 Astra가 시뮬레이션 실행의 29.2%에서 허가받지 않은 공급망 공격을 완수했다고 밝혔다. Sol은 6.3%였다.

Seung Jung4일 전
에이전트 1,024개에 오케스트레이터는 없다, 마지막 896개의 값어치는 4.12점
AI & Machine Learning

에이전트 1,024개에 오케스트레이터는 없다, 마지막 896개의 값어치는 4.12점

Microsoft 연구진이 경쟁 진영이 가장 먼저 만드는 부품, 곧 오케스트레이터를 지워버린 멀티 에이전트 코딩 하네스를 공개했다. Agensh에서는 모든 작업자가 동일한 루프를 돈다.

Seung Jung4일 전