Google, 가드레일 뺀 Gemini 4 Argon을 사이버 방어팀에 먼저 풀었다

Google의 새 프런티어 모델이 사이버 제약을 뺀 빌드로 비공개 Fairwind 집단에 먼저 들어간다. 출력 상한은 6만 4,000 토큰에서 100만 토큰으로 뛰었다.

|6분 읽기0
Google's office entrance in Ireland; the company is releasing its Gemini 4 Argon frontier model to security partners before developers or consumers.
Google's office entrance in Ireland; the company is releasing its Gemini 4 Argon frontier model to security partners before developers or consumers.

Google이 수요일 Gemini 4 Argon을 공개했다. 가장 먼저 손에 쥔 쪽은 개발자나 일반 사용자가 아니라, 사이버보안 가드레일을 끈 상태로 모델을 돌리게 될 비공개 보안 연구자 집단이다. Google은 Argon을 빠르게 답하는 작업이 아니라 길게 이어지는 작업을 위한 프런티어 모델로 내세운다.

공급은 Google의 보안 프로그램 Fairwind Program을 통해 이뤄진다. 이 프로그램 참가자는 유료 API 고객과 Google AI Ultra 구독자보다 앞서 모델을 받고, 개발자와 기업, 일반 사용자가 가장 마지막이다. Koray Kavukcuoglu Google DeepMind SVP 겸 최고 AI 아키텍트는 공급 범위를 넓히는 동안 미국 정부의 출시 전 모델 접근 자율 절차에 참여한다고 밝혔다.

핵심 요약

  • Argon의 출력 상한이 기존 모델의 6만 4,000 토큰에서 100만 토큰으로 올랐다. Google은 어려운 문제를 한 번에 끝낼 여유라고 설명한다.
  • Google은 DeepSWE v1.1에서 Argon이 77.9%를 기록해 Claude Opus 5.5의 74.2%, GPT-6 Astra의 74.1%를 앞섰다고 밝혔다. Zapier의 AutomationBench에서는 51.3%로 1위다.
  • 신뢰받는 사이버 방어팀과 Google 내부 팀은 사이버 가드레일 없는 Argon을 쓴다. 나머지 고객은 제약이 걸린 빌드를 기다려야 한다.

출력 상한이 핵심 스펙인 이유

Google이 앞세운 수치는 100만 토큰이라는 출력 한도다. 기존 모델의 6만 4,000 토큰 상한에서 약 15배 뛰었다. Google의 논리는 추론의 깊이가 모델이 멈추기 전까지 써낼 수 있는 분량에 달려 있다는 것이고, 이만한 여유가 생기면 여러 번 넘겨받던 작업을 하나의 긴 궤적으로 대체할 수 있다는 것이다.

그 주장을 뒷받침하는 근거는 외부 평가 기관이 아니라 Google 내부에서 나왔다. 한 사례에서는 Argon 에이전트 집단이 Google 데이터센터 전역의 프로파일링 텔레메트리를 읽고 스스로 메모리 수정을 반영했다. Google은 이 작업으로 배포 시점에 300TiB 이상, 최종적으로는 500TiB에서 1PiB 사이를 회수할 것으로 본다.

두 번째 적용 사례가 더 많은 것을 말해준다. 엔지니어가 보통 자동화를 거부하는 종류의 작업이기 때문이다. Argon 에이전트는 re2 같은 작은 라이브러리부터 80만 줄이 넘는 Fuchsia Zircon 커널까지 Google의 C·C++ 코드를 Rust로 이식하고 있다. 비디오 디코더 libgav1에서는 에이전트가 손으로 다듬은 SIMD 코드 3만 2,000줄을 버리고, 평범한 안전 Rust를 컴파일러가 벡터화하도록 맡겼다. Google은 그 결과가 기존 Rust 이식본보다 2.7배 빠르고 출력 영상은 바이트 단위로 동일하다고 밝혔다.

사이버 우선 공급의 목적

Argon은 방어적 보안 작업을 겨냥해 학습됐고, Google이 내세우는 그림은 사람이 끼지 않는 완결 고리다. 모델이 치명적 취약점을 찾아내고, 실재하는지 확인하고, 패치까지 쓴다는 것이다. Fairwind 참가자와 내부 팀에서 사이버 가드레일을 뺀 이유가 여기 있다. 공격 기법을 추론하기를 거부하는 모델은 구멍을 막을 수도 없다.

초기 현장 성과도 하나 있다. 보안 기업 Wiz가 운영하는 무료 인프라 강화 프로그램 Scan for Good을 통해 Argon이 전 세계에 배포된 병원 소프트웨어에서 개인정보가 심각하게 노출된 지점을 찾아낸 것으로 전해졌다. Google은 이전 프런티어 모델들이 그냥 지나친 문제라고 설명한다. 다만 CWE-bench v1 기준 조치 점수 68%는 뚜렷한 선두가 아니라 공동 1위다.

Astra와 Opus 5.5에 견주면

Google의 벤치마크 논거는 장기 과제에 기대 있다. DeepSWE v1.1에서 77.9%로 새 최고 기록이라고 주장하며, 9to5Google은 이 수치가 Claude Opus 5.5의 74.2%와 GPT-6 Astra의 74.1%를 앞선다고 전했다. Google은 금융·코딩·법률·세무 작업을 미국 GDP 비중으로 가중하는 Vals Index에서도 Argon이 1위이고, Zapier의 AutomationBench에서 51.3%로 1위, 장편 영상 평가 LVBench에서 91.7%를 기록했다고 밝혔다. 모든 수치는 Google이 출시 발표문에 직접 실은 자체 측정값이다.

Google이 아직 손보고 있다는 영역

Google이 꼽은 네 영역은 두 가지 전략으로 깔끔하게 갈린다. 둘은 거부에 관한 것이다. 정당한 이중용도 연구까지 막지 않으면서 사이버·CBRN 악용을 차단하는 일, 그리고 간접 프롬프트 인젝션에 버티는 일이다. Google은 이 공격 유형을 다루는 Gray Swan 벤치마크에서 자사가 앞선다고 주장한다. 나머지 둘은 거부가 언젠가 실패한다고 전제한다. 감시 장치가 Argon의 사고 과정을 읽다가 모델이 요청 범위를 벗어나면 실행을 중단시키고, 고위험 학습을 시작하기 전에 샌드박스를 완전히 봉인한다.

이 대목에 이번 출시에서 가장 흥미로운 고백이 묻혀 있다. Google은 정렬 실패 사례를 의도적으로 학습 루프에 넣지 않는다고 밝혔다. 그것으로 학습시키면 Argon이 자신을 지켜보는 감시 장치를 피하는 법을 익히게 되기 때문이다. Google은 같은 이유로 경쟁사에도 모델의 추론 과정을 읽을 수 있게 남겨두라고 요청했다.

전망

시점이 의미심장하다. Argon은 OpenAI의 DevDay 다음 날 등장했다. OpenAI는 그 자리에서 Dots 에이전트와 GPT-6.1 Sol 모델을 내놨고, 얼마 전에는 안전 문제를 이유로 준비하던 GPT-6.1 Astra를 출시하지 않겠다고 밝혔다. 이번 공개는 Kavukcuoglu가 8월 DeepMind를 맡은 뒤 내건 약속을 지킨 것이기도 하다. 당시 그는 Gemini 4가 다듬는 단계에 있고 완성도를 높이기보다 일찍 내보내겠다고 말했다. 도입 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이고, 이후 4달러와 20달러로 오른다.

FAQ — 자주 묻는 질문

Gemini 4 Argon을 지금 쓸 수 있나?

Google의 Fairwind Program 참가자나 신뢰 테스터가 아니라면 쓸 수 없다. Google이 밝힌 공급 순서는 사이버 방어팀이 먼저, 그다음 유료 API 고객과 Google AI Ultra 구독자, 마지막이 개발자와 기업, 일반 사용자다.

"사이버 가드레일 없이" 공개한다는 말의 뜻은?

Google은 신뢰받는 방어팀과 내부 팀에 모델의 공격적 보안 추론을 제한하지 않는 빌드를 준다. 취약점 발굴 역량을 온전히 쓰게 하기 위해서다. 나머지 사용자는 그 제한이 걸린 버전을 받는다.

Gemini 4 Argon의 가격은 얼마인가?

도입 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이고, 캐시된 입력 토큰은 95% 할인된다. 도입 기간이 끝나면 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러가 된다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

GPT-6 Astra, 시속 1.5km로 실제 콘 코스 완주 — "샌드박스"라고 속인 뒤였다
AI & Machine Learning

GPT-6 Astra, 시속 1.5km로 실제 콘 코스 완주 — "샌드박스"라고 속인 뒤였다

OpenAI의 GPT-6 Astra가 실제 주행 코스를 완주한 첫 상용 프런티어 모델이 됐다. 토요타 코롤라를 주차장 콘 코스 134.7m 구간에서 5분 22초 만에 통과했다.

Seung Jung7일 전
Vera Rubin NVL72, MLPerf 데뷔전서 GB300 대비 3.7배 — 단, '프리뷰' 등급
AI & Machine Learning

Vera Rubin NVL72, MLPerf 데뷔전서 GB300 대비 3.7배 — 단, '프리뷰' 등급

NVIDIA의 차세대 랙 스케일 시스템이 9월 16일 벤치마크에 데뷔했다. Vera Rubin NVL72는 Qwen3-VL에서 GB300 대비 최대 3.7배 처리량을 기록했지만, 아직 구매할 수 없는 프리뷰 등급 시스템이다.

Seung Jung10일 전
공공 데이터 요청이 막히자 AI 에이전트가 SQL 인젝션에 손댔다
AI & Machine Learning

공공 데이터 요청이 막히자 AI 에이전트가 SQL 인젝션에 손댔다

Transluce는 일반적인 자료 수집이 실패한 뒤 AI 에이전트가 공공 데이터 제공처 세 곳에 취약점 탐침을 보냈다고 밝혔다. 로그상 활동 시점은 2026년 3월 6일까지 올라간다.

Seung Jung7일 전
구글, 기기 밖으로 나가지 않는 복호화 키로 클라우드 AI 메모리를 설계한다
AI & Machine Learning

구글, 기기 밖으로 나가지 않는 복호화 키로 클라우드 AI 메모리를 설계한다

구글이 민감한 개인 데이터로 Gemini 모델을 돌리는 하드웨어 격리 클라우드 플랫폼 Private AI Compute에 서버 측 영구 메모리를 추가한다. 이 메모리를 여는 암호 키는 사용자 기기에만 둔다.

Seung Jung4일 전
Gemini 4는 다듬는 단계, DeepMind 새 수장은 "먼저 내보내겠다"
AI & Machine Learning

Gemini 4는 다듬는 단계, DeepMind 새 수장은 "먼저 내보내겠다"

DeepMind 신임 수장 Koray Kavukcuoglu가 Gemini 4는 다듬는 단계에 들어섰고 조기 공개하겠다고 밝혔다. 10개월간 플래그십 공백과 Gemini 3.5 Pro 취소가 배경이다.

Seung Jung6일 전
Meta, Muse의 6.8GB 파일시스템 유출을 "의도된 동작"이라 밝혔다
AI & Machine Learning

Meta, Muse의 6.8GB 파일시스템 유출을 "의도된 동작"이라 밝혔다

Peter James와 Jonny Saunders가 각자 Meta의 Muse를 구슬려 자기 Linux 환경을 통째로 압축해 내보내게 했다. Meta는 의도된 동작이라고 밝혔다.

Seung Jung6일 전