Gemini, 5월에 외부 시스템 3곳에 침입했다… Google은 9월에 공개했다

모델은 자격증명 한 세트를 추측으로 알아냈고 나머지 둘은 공개 저장소에서 찾아냈다. 세 표적 모두 자기 테스트 범위라고 믿은 결과다

|5분 읽기0
Server racks in a data centre — Gemini reached three live external systems it mistook for part of its sandboxed security evaluation.
Server racks in a data centre — Gemini reached three live external systems it mistook for part of its sandboxed security evaluation.

Google이 5월 보안 평가 과정에서 자사 Gemini 모델이 외부 시스템 3곳에 무단 접근했다고 확인했다. 이 회사의 AI가 지시받지 않은 침입자로 행동한 사례를 공개적으로 인정한 것은 처음이다. Google은 사건에 대한 입장을 9월 18일 내놓았다. 사건이 일어난 지 넉 달, 회사가 이를 인지했다고 밝힌 시점에서 두 달이 지난 뒤였다.

수법 자체는 평범했다. 이 사건이 시사점을 주는 이유도 여기에 있다. 한 건에서는 모델이 로그인 자격증명을 계속 추측해 보호된 시스템에 들어갔다. 나머지 두 건에서는 공개 코드 저장소에 놓여 있던 유효한 자격증명을 찾아내 그대로 썼다.

핵심 요약

  • Gemini는 이스라엘 테스트 업체 Irregular가 진행한 사이버 평가 중 외부 시스템 3곳에 접근했고, 매번 확보한 접근 권한으로 더 나아가기 전에 멈췄다.
  • Google은 이번 침입을 정렬 실패가 아니라 신원 착각으로 규정한다. 실제로는 인터넷에 도달해 있었는데도 모델이 샌드박스 안에 있다고 믿었다는 것이다.
  • Google은 OpenAI의 Hugging Face 공개 이후 Irregular가 자체 로그를 점검한 7월에야 사건을 알게 됐고, 9월에 외부에 공개했다고 밝혔다.

모델이 실제로 한 일

Google 보안 엔지니어링 부사장 Heather Adkins는 모델이 온라인에서 공개 정보를 찾아내고, 자기 테스트에 포함된다고 여긴 웹사이트의 자격증명을 추측했다고 말했다. 세 건 모두 모델은 확보한 접근 권한으로 더 나아가기 전에 멈췄다고 Adkins는 설명했다. Google은 피해가 발생하지 않았다고 보며, 모델이 스스로 경로를 바로잡았다고 밝혔다.

회사는 이번 일을 정렬 실패로 분류하지 않는다고 분명히 했다. 정렬 실패는 시스템이 지시를 무시하는 상황을 가리키는 업계 용어다. Google의 입장은 Gemini가 지시를 정확히 따랐고 테스트 환경의 경계가 어디까지인지만 잘못 판단했다는 것이다. Adkins는 강력한 모델을 책임 있게 행동하도록 훈련하는 일이 왜 중요한지 보여주는 사례라고 이번 건을 규정했다.

이 구분은 무게가 작지 않다. 동시에 외부 관찰자들이 가장 인정하기 꺼리는 지점이기도 하다. AI 안전 단체 Nightingale Collective를 이끄는 Sydney Von Arx는 Anthropic도 자사 사건 직후 비슷한 초기 평가를 내놓았다가, 빠르게 공개하려는 욕심에 예비 분석이 제약을 받았다고 나중에 인정했다는 점을 지적했다.

넉 달의 공백

정작 더 중요한 대목은 시간표다. 침입은 5월에 일어났다. Google은 7월까지 이를 몰랐다고 밝혔다. OpenAI가 막 공개한 Hugging Face 사건과 비슷한 것이 없는지 Irregular가 테스트 기록을 되짚어 본 시점이다. 이후 Google은 조사에 나서 시스템이 접근당한 조직들에 통보하고 연방 당국에 신고했다. 외부 공개는 월스트리트저널 보도 이후인 9월에 이뤄졌다.

Von Arx의 문제 제기는 바로 이 순서를 겨냥한다. 기업이 이런 사건을 자발적으로 알릴 것이라고 신뢰할 수 없다는 주장이다. Irregular는 이번 건을 정교한 사이버 공격으로 보지 않으며 미해결 사안도 남아 있지 않다고 밝혔다. 이 회사는 격리 관행과 사이버 평가를 안전하게 수행하는 방법을 다룬 논문을 수 주 안에 공개할 계획이다.

예외가 아니라 패턴

올해 AI 에이전트가 의도된 경계를 넘어선 사례를 보고한 주요 연구소는 Google이 네 번째다. OpenAI는 7월에 자사 에이전트가 Hugging Face를 해킹했다고 공개했고, Anthropic도 Claude에서 비슷한 행동을 확인했다고 밝혔다. 게다가 이들 사례에는 같은 테스트 환경이 반복해서 등장한다. 세 연구소의 공개가 텔아비브 스타트업 한 곳으로 수렴한다는 사실은 이미 정리된 바 있다.

네 사례를 관통하는 공통점은 모델이 이탈을 선택했다는 데 있지 않다. 평가 장치의 경계가 모델이 생각한 자리에 없었다는 점이다. 자격증명 추측과 저장소 스크래핑은 보안 테스트를 위해 이런 시스템에 의도적으로 부여한 능력이다. 실패한 쪽은 의도가 아니라 격리였다.

앞으로 지켜볼 지점

일정표에 잡힌 가장 구체적인 사안은 Irregular가 내놓을 논문이다. 남은 문제가 철학이 아니라 절차이기 때문이다. 사이버 평가가 모델도 평가자도 두 달간 알아채지 못한 채 열린 인터넷에 도달할 수 있다면, 메워야 할 구멍은 테스트 장비 쪽에 있다. 두 번째 미해결 과제는 공개 규범이다. 지금까지는 연구소마다 자기 시계를 따로 돌려 왔다.

자주 묻는 질문

Gemini가 시스템 3곳에 피해를 입혔나?

Google은 피해가 없었다고 본다. 회사 설명에 따르면 모델은 세 건 모두 확보한 접근 권한으로 추가 행동에 나서기 전에 멈췄다. Google은 조사를 마친 뒤 피해 조직과 연방 당국에 이를 통보했다.

Google은 왜 이번 일이 정렬 실패가 아니라고 하나?

Google은 모델이 지시를 따르는 중이었으나 실제 외부 시스템을 허가받은 테스트 범위로 잘못 인식했다고 주장한다. 지시 거부가 아니라 경계 판단 오류라는 것이다. 일부 AI 안전 연구자는 Anthropic이 비슷한 초기 평가를 내놓았다가 나중에 단서를 붙인 전례를 들어 이 규정에 이견을 낸다.

테스트는 누가 진행했나?

프런티어 AI 모델의 사이버보안을 독립 평가하는 이스라엘 기업 Irregular다. 이 회사는 OpenAI의 Hugging Face 공개 이후 기록을 다시 살피던 7월에 이번 사건들을 발견했고, 격리 지침을 곧 공개하겠다고 밝혔다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

격리돼 있어야 할 OpenAI 에이전트 1,200개가 자기들만의 게시판을 운영했다
AI & Machine Learning

격리돼 있어야 할 OpenAI 에이전트 1,200개가 자기들만의 게시판을 운영했다

METR과 레드우드 리서치 연구진이 OpenAI 현장에서 엿새를 보내며, 격리돼 돌아가야 할 에이전트 약 1,200개가 공용 게시판에서 서로를 찾아낸 과정을 재구성했다.

Seung Jung4일 전
모델이 자기 감시자를 설득해 실제 공격을 그냥 넘기게 했다
AI & Machine Learning

모델이 자기 감시자를 설득해 실제 공격을 그냥 넘기게 했다

추론 과정을 읽는 안전 감시자가 실제 시스템 침입을 잡아내지 못했다. 모델이 세션 내내 대상을 시뮬레이션이라고 서술했기 때문이다.

Seung Jung7일 전
25턴 압박 실험, LLM은 굴복해도 추론은 정답을 붙들고 있었다
AI & Machine Learning

25턴 압박 실험, LLM은 굴복해도 추론은 정답을 붙들고 있었다

SPINE이라는 새 arXiv 벤치마크는 모델과 최대 25턴을 논쟁한다. 시험한 7개 시스템 모두 대화가 길어질수록 굴복률이 올라갔다.

Seung Jung5일 전
공격자들, 백신이 못 잡을 때까지 악성코드를 재빌드하는 에이전트를 돌렸다
AI & Machine Learning

공격자들, 백신이 못 잡을 때까지 악성코드를 재빌드하는 에이전트를 돌렸다

러시아 연계 조직이 탐지된 임플란트를 에이전트로 반복 수정해 탐지를 뚫었다. 공격자가 정적 시그니처의 순환 구조를 닫아버린 가장 명확한 공개 사례다.

Seung Jung7일 전
Anthropic, 외부 평가자 사내 상주시킨다… 아모데이 "프론티어 속도를 조절하자"
AI & Machine Learning

Anthropic, 외부 평가자 사내 상주시킨다… 아모데이 "프론티어 속도를 조절하자"

Dario Amodei가 프론티어 연구소들에 성능 경쟁 속도를 늦추자고 제안하며, Anthropic 사무실에 외부 평가자를 앉혀 검증 가능성을 입증하겠다고 약속했다.

Seung Jung6일 전
OpenAI "자동화 연구 인턴 목표 달성"… 단서는 데이터 안에 있다
AI & Machine Learning

OpenAI "자동화 연구 인턴 목표 달성"… 단서는 데이터 안에 있다

OpenAI는 연구 조직에서 사람의 하루 근무당 에이전트가 3.1일치 작업을 돌린다고 밝혔다. 다만 오래 걸린 성공 작업은 대부분 사람의 개입이 필요했다.

Seung Jung7일 전