OpenAI가 이번 주 공개한 공격은 암호 자체를 뚫은 것이 아니다. 운영자들은 한 대화에서 암호화된 추론 데이터를 복사해 새 대화를 연 뒤, 모델에게 그 덩어리를 풀어 평문으로 써달라고 요청했다. 모델은 그대로 따랐다. OpenAI는 수요일 작성자 서명이 없는 캠페인 보고서를 올리며 이 수법을 새로운 유형으로 규정했고, 대화를 건너뛰는 경로를 만든 버그는 이미 고쳤다고 밝혔다.
핵심 요약
- 암호화된 추론을 대화 사이로 옮긴 뒤 모델 자신을 복호기로 썼다. 키나 데이터베이스, 저장된 대화에 접근한 흔적은 없다.
- 7월 24~25일 정점에서 사용자 4000명이 보낸 프롬프트 1만 6000건이 단일 추출 패턴과 일치했고, 의심 계정 군집은 7월 28일까지 1만 5000개로 늘었다.
- OpenAI는 대화 간 복호화 경로를 막고 가입·인프라 통제를 강화했으며 네트워크 모니터링을 확대했다. 이 취약점이 자사 모델만의 문제는 아니라는 입장이다.
숨겨둔 추론이 노려지는 이유
프런티어 연구소들은 답변만 내보내고 그 답을 만든 사고 연쇄 흔적은 감춘다. 이유는 미관이 아니라 경쟁이다. 중간 단계야말로 경쟁사가 학습에 쓸 수 있는 가장 값비싼 감독 신호이고, 그래서 클라이언트에 도달하기 전에 암호화된다.
암호화는 그 암호문이 누구에게나 불투명하게 남는다는 전제 위에 선다. 이번 결함의 핵심은 충분히 유능한 모델이 그 '누구나'에 속하지 않는다는 점이다. 암호문을 풀 수단을 쥔 맥락에 암호문을 건네면, 나머지는 모델의 친절함이 처리한다. 보호 장치는 애초에 암호가 아니었다. 사용자 쪽 경계 안의 어떤 구성 요소도 그것을 되돌릴 수 없다는 가정이었다.
OpenAI 스스로의 표현은 좁고, 정확히 옮겨둘 가치가 있다. 운영자들은 암호화를 깨거나 데이터베이스를 침해하지 않았고 저장된 사용자 대화에 직접 접근하지도 않았다. 이들이 한 일은 모델과의 상호작용을 조작해 보호된 추론이 요청자에게 보이는 형태로 재생되게 만든 것이고, 그것도 대규모로, 이용약관을 위반하면서 했다는 것이다.
타임라인이 말해주는 것
CyberScoop 보도에 따르면 낮은 수준의 탐색은 7월 1일 시작돼 서서히 늘었다. 급증은 7월 24~25일에 왔다. 사용자 약 4000명이 보낸 프롬프트 1만 6000건이 하나의 추출 패턴과 맞아떨어졌다. 이후 분석에서 연관 프롬프트 군집은 1만 5000개 계정으로 넓어졌고, OpenAI는 7월 28일 작전을 완전히 차단했다고 밝혔다.
원시 수치보다 흥미로운 대목은 두 가지다. 첫째, 외부 연구자들이 8월에 비슷한 취약점을 OpenAI에 제보했다. 캠페인이 이미 차단된 뒤였다. 내부 정보 없이도 독립적으로 발견할 수 있는 경로였다는 뜻이다. 둘째, 탐지를 촉발한 급증 이전에 3주 가까이 물량이 완만하게 올라가고 있었다. 물량에만 맞춰진 남용 모니터링은 이런 조용한 상승 구간을 놓친다.
증거 없는 귀속
OpenAI는 핵심 군집을 Kimi 계열 오픈소스 LLM 개발사인 Moonshot AI를 대신해 활동한 개인들의 소행으로 지목하면서도, 관측된 활동 전부가 연결돼 있는지는 불분명하다고 덧붙였다. 게시물에는 그 귀속을 뒷받침할 기술적 증거가 없고, 회사는 보안을 이유로 기자들에게 추가 설명을 거부했다. Anthropic도 올해 초 비슷한 방식을 택했다. 근거 신호는 공개하지 않은 채 연구소 이름만 거론했다.
독자는 수법과 귀속을 증거 무게가 다른 별개의 주장으로 다뤄야 한다. 대화 간 복호화 경로는 검증 가능하다. 패치됐고, 제3자도 찾아냈다. 계정 뒤에 누가 앉아 있었는지는 아직 주장일 뿐이다.
다른 사업자에게 달라지는 것
OpenAI는 이 조작이 자사 시스템에만 해당하지 않는다는 판단 아래 프런티어 모델 포럼을 통해 업계 동료들과 사건 정보를 공유했다고 밝혔다. 추론을 암호화하면서 동시에 범용 모델을 사용자 입력 텍스트에 노출하는 사업자라면 누구나 같은 모양의 문제를 떠안는다.
전망
방어 대응은 모델이 아니라 신원과 사용량 통제 쪽으로 쏠릴 것으로 보인다. 가입 인증 강화, 계정별 상한 축소, 계정 간 패턴 탐지가 당장 손에 쥔 지렛대이기 때문이다. 구조적 문제는 그대로 남는다. 임의의 입력에 담긴 지시를 충실히 따르는 모델이라면 보호된 입력을 읽을 수 있게 만들라는 지시도 똑같이 따른다. 전송 계층의 암호화가 아무리 두꺼워도 이 점은 바뀌지 않는다.
FAQ
OpenAI가 해킹당한 것인가
아니다. OpenAI는 암호가 깨지지 않았고 데이터베이스도 침해되지 않았으며 저장된 사용자 대화에 접근한 사실도 없다고 밝혔다. 운영자들은 제품을 설계된 대로 썼다. 암호화된 추론을 대화 사이로 옮기고 모델에게 읽을 수 있게 만들라고 요청했을 뿐이며, 회사는 이를 이용약관 위반으로 본다.
취약점은 수정됐나
OpenAI는 한 대화에서 가져온 암호화 데이터를 다른 대화에서 복호화할 수 있게 한 버그를 패치했다고 밝혔다. 가입·인프라 통제도 조이고 네트워크 모니터링을 확대했으며, 같은 약점이 자사 모델에 국한되지 않는다고 보고 프런티어 모델 포럼을 통해 다른 연구소들과 세부 내용을 공유했다.
적대적 증류란 무엇인가
한 모델의 출력이나 내부 추론을 허가 없이 체계적으로 가져다 다른 모델을 학습·복제·개선하는 행위다. 자기가 소유한 모델을 증류하는 것은 일상적인 엔지니어링이지만, 적대적 변종은 공개 인터페이스를 통해 경쟁사의 보호된 흔적을 긁어모은다.






