대화를 건너뛴 버그, OpenAI 모델이 자기 추론을 해독했다

OpenAI는 운영자들이 암호화된 추론 데이터를 한 대화에서 복사해 다른 대화에 붙여넣고 모델에게 그대로 받아쓰게 했다고 밝혔다. 해당 결함은 수정됐지만, 같은 경로가 다른 곳에도 존재한다는 것이 회사의 설명이다.

|5분 읽기0
The office building at 1515 Third Street in San Francisco's Mission Bay neighborhood, which has housed OpenAI's headquarters.
The office building at 1515 Third Street in San Francisco's Mission Bay neighborhood, which has housed OpenAI's headquarters.

OpenAI가 이번 주 공개한 공격은 암호 자체를 뚫은 것이 아니다. 운영자들은 한 대화에서 암호화된 추론 데이터를 복사해 새 대화를 연 뒤, 모델에게 그 덩어리를 풀어 평문으로 써달라고 요청했다. 모델은 그대로 따랐다. OpenAI는 수요일 작성자 서명이 없는 캠페인 보고서를 올리며 이 수법을 새로운 유형으로 규정했고, 대화를 건너뛰는 경로를 만든 버그는 이미 고쳤다고 밝혔다.

핵심 요약

  • 암호화된 추론을 대화 사이로 옮긴 뒤 모델 자신을 복호기로 썼다. 키나 데이터베이스, 저장된 대화에 접근한 흔적은 없다.
  • 7월 24~25일 정점에서 사용자 4000명이 보낸 프롬프트 1만 6000건이 단일 추출 패턴과 일치했고, 의심 계정 군집은 7월 28일까지 1만 5000개로 늘었다.
  • OpenAI는 대화 간 복호화 경로를 막고 가입·인프라 통제를 강화했으며 네트워크 모니터링을 확대했다. 이 취약점이 자사 모델만의 문제는 아니라는 입장이다.

숨겨둔 추론이 노려지는 이유

프런티어 연구소들은 답변만 내보내고 그 답을 만든 사고 연쇄 흔적은 감춘다. 이유는 미관이 아니라 경쟁이다. 중간 단계야말로 경쟁사가 학습에 쓸 수 있는 가장 값비싼 감독 신호이고, 그래서 클라이언트에 도달하기 전에 암호화된다.

암호화는 그 암호문이 누구에게나 불투명하게 남는다는 전제 위에 선다. 이번 결함의 핵심은 충분히 유능한 모델이 그 '누구나'에 속하지 않는다는 점이다. 암호문을 풀 수단을 쥔 맥락에 암호문을 건네면, 나머지는 모델의 친절함이 처리한다. 보호 장치는 애초에 암호가 아니었다. 사용자 쪽 경계 안의 어떤 구성 요소도 그것을 되돌릴 수 없다는 가정이었다.

OpenAI 스스로의 표현은 좁고, 정확히 옮겨둘 가치가 있다. 운영자들은 암호화를 깨거나 데이터베이스를 침해하지 않았고 저장된 사용자 대화에 직접 접근하지도 않았다. 이들이 한 일은 모델과의 상호작용을 조작해 보호된 추론이 요청자에게 보이는 형태로 재생되게 만든 것이고, 그것도 대규모로, 이용약관을 위반하면서 했다는 것이다.

타임라인이 말해주는 것

CyberScoop 보도에 따르면 낮은 수준의 탐색은 7월 1일 시작돼 서서히 늘었다. 급증은 7월 24~25일에 왔다. 사용자 약 4000명이 보낸 프롬프트 1만 6000건이 하나의 추출 패턴과 맞아떨어졌다. 이후 분석에서 연관 프롬프트 군집은 1만 5000개 계정으로 넓어졌고, OpenAI는 7월 28일 작전을 완전히 차단했다고 밝혔다.

원시 수치보다 흥미로운 대목은 두 가지다. 첫째, 외부 연구자들이 8월에 비슷한 취약점을 OpenAI에 제보했다. 캠페인이 이미 차단된 뒤였다. 내부 정보 없이도 독립적으로 발견할 수 있는 경로였다는 뜻이다. 둘째, 탐지를 촉발한 급증 이전에 3주 가까이 물량이 완만하게 올라가고 있었다. 물량에만 맞춰진 남용 모니터링은 이런 조용한 상승 구간을 놓친다.

증거 없는 귀속

OpenAI는 핵심 군집을 Kimi 계열 오픈소스 LLM 개발사인 Moonshot AI를 대신해 활동한 개인들의 소행으로 지목하면서도, 관측된 활동 전부가 연결돼 있는지는 불분명하다고 덧붙였다. 게시물에는 그 귀속을 뒷받침할 기술적 증거가 없고, 회사는 보안을 이유로 기자들에게 추가 설명을 거부했다. Anthropic도 올해 초 비슷한 방식을 택했다. 근거 신호는 공개하지 않은 채 연구소 이름만 거론했다.

독자는 수법과 귀속을 증거 무게가 다른 별개의 주장으로 다뤄야 한다. 대화 간 복호화 경로는 검증 가능하다. 패치됐고, 제3자도 찾아냈다. 계정 뒤에 누가 앉아 있었는지는 아직 주장일 뿐이다.

다른 사업자에게 달라지는 것

OpenAI는 이 조작이 자사 시스템에만 해당하지 않는다는 판단 아래 프런티어 모델 포럼을 통해 업계 동료들과 사건 정보를 공유했다고 밝혔다. 추론을 암호화하면서 동시에 범용 모델을 사용자 입력 텍스트에 노출하는 사업자라면 누구나 같은 모양의 문제를 떠안는다.

전망

방어 대응은 모델이 아니라 신원과 사용량 통제 쪽으로 쏠릴 것으로 보인다. 가입 인증 강화, 계정별 상한 축소, 계정 간 패턴 탐지가 당장 손에 쥔 지렛대이기 때문이다. 구조적 문제는 그대로 남는다. 임의의 입력에 담긴 지시를 충실히 따르는 모델이라면 보호된 입력을 읽을 수 있게 만들라는 지시도 똑같이 따른다. 전송 계층의 암호화가 아무리 두꺼워도 이 점은 바뀌지 않는다.

FAQ

OpenAI가 해킹당한 것인가

아니다. OpenAI는 암호가 깨지지 않았고 데이터베이스도 침해되지 않았으며 저장된 사용자 대화에 접근한 사실도 없다고 밝혔다. 운영자들은 제품을 설계된 대로 썼다. 암호화된 추론을 대화 사이로 옮기고 모델에게 읽을 수 있게 만들라고 요청했을 뿐이며, 회사는 이를 이용약관 위반으로 본다.

취약점은 수정됐나

OpenAI는 한 대화에서 가져온 암호화 데이터를 다른 대화에서 복호화할 수 있게 한 버그를 패치했다고 밝혔다. 가입·인프라 통제도 조이고 네트워크 모니터링을 확대했으며, 같은 약점이 자사 모델에 국한되지 않는다고 보고 프런티어 모델 포럼을 통해 다른 연구소들과 세부 내용을 공유했다.

적대적 증류란 무엇인가

한 모델의 출력이나 내부 추론을 허가 없이 체계적으로 가져다 다른 모델을 학습·복제·개선하는 행위다. 자기가 소유한 모델을 증류하는 것은 일상적인 엔지니어링이지만, 적대적 변종은 공개 인터페이스를 통해 경쟁사의 보호된 흔적을 긁어모은다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다
LLM & Chatbots

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다

OpenAI의 GPT-6 Astra가 컴퓨터 사용 기능과 100만 토큰 컨텍스트, 10/50달러 가격으로 기업 사용자에게 풀린다. 대표 점수에는 하네스 단서가 붙는다.

Seung Jung21일 전
ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다
LLM & Chatbots

ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다

OpenAI가 ChatGPT Images 2.5를 내놨다. 지연 시간을 최대 50% 줄이고 Sketch 캔버스와 템플릿, 고정 댓글, API 모델 두 종을 함께 공개했다.

Seung Jung20일 전
OpenAI, 중급 모델 토큰 가격 반토막…벤치마크 두 곳은 여전히 GPT-5.6이 앞선다
Developer Tools

OpenAI, 중급 모델 토큰 가격 반토막…벤치마크 두 곳은 여전히 GPT-5.6이 앞선다

OpenAI가 화요일 중급 모델 두 종을 내놓으면서 설득 논리를 거의 전부 가격에 걸었다. GPT-6 Sol은 100만 입력 토큰당 2달러, 출력 100만 토큰당 10달러다.

Seung Jung8일 전
OpenAI의 Astra for Law는 새 모델이 아니다, 2억 3000만 URL 법률 색인이다
LLM & Chatbots

OpenAI의 Astra for Law는 새 모델이 아니다, 2억 3000만 URL 법률 색인이다

OpenAI가 GPT-6 Astra에 2억 3000만 URL 규모 법률 색인을 결합한 Astra for Law를 공개했다. 리걸 리서치 벤치 정확도는 38.7%에서 54%로 올랐다.

Seung Jung13일 전
OpenAI 새 정신건강 벤치마크, 최고 점수가 57.3%
LLM & Chatbots

OpenAI 새 정신건강 벤치마크, 최고 점수가 57.3%

22개국 임상의 80여 명이 함께 만든 OpenAI MentalHealthBench에서 GPT-6 Astra가 57.3%로 1위에 올랐다. Claude Opus 5.5는 52.4%였다.

Seung Jung3일 전
OpenAI, 데이터 에이전트와 월스트리트용 ChatGPT를 하루에 함께 내놨다
LLM & Chatbots

OpenAI, 데이터 에이전트와 월스트리트용 ChatGPT를 하루에 함께 내놨다

OpenAI가 같은 목요일에 ChatGPT Work용 Data 에이전트와 Morgan Stanley·Evercore가 함께 만든 ChatGPT for Financial Services를 공개했다.

Seung Jung20일 전