Google이 수요일 Gemini 4 Argon을 공개했다. 가장 먼저 손에 쥔 쪽은 개발자나 일반 사용자가 아니라, 사이버보안 가드레일을 끈 상태로 모델을 돌리게 될 비공개 보안 연구자 집단이다. Google은 Argon을 빠르게 답하는 작업이 아니라 길게 이어지는 작업을 위한 프런티어 모델로 내세운다.
공급은 Google의 보안 프로그램 Fairwind Program을 통해 이뤄진다. 이 프로그램 참가자는 유료 API 고객과 Google AI Ultra 구독자보다 앞서 모델을 받고, 개발자와 기업, 일반 사용자가 가장 마지막이다. Koray Kavukcuoglu Google DeepMind SVP 겸 최고 AI 아키텍트는 공급 범위를 넓히는 동안 미국 정부의 출시 전 모델 접근 자율 절차에 참여한다고 밝혔다.
핵심 요약
- Argon의 출력 상한이 기존 모델의 6만 4,000 토큰에서 100만 토큰으로 올랐다. Google은 어려운 문제를 한 번에 끝낼 여유라고 설명한다.
- Google은 DeepSWE v1.1에서 Argon이 77.9%를 기록해 Claude Opus 5.5의 74.2%, GPT-6 Astra의 74.1%를 앞섰다고 밝혔다. Zapier의 AutomationBench에서는 51.3%로 1위다.
- 신뢰받는 사이버 방어팀과 Google 내부 팀은 사이버 가드레일 없는 Argon을 쓴다. 나머지 고객은 제약이 걸린 빌드를 기다려야 한다.
출력 상한이 핵심 스펙인 이유
Google이 앞세운 수치는 100만 토큰이라는 출력 한도다. 기존 모델의 6만 4,000 토큰 상한에서 약 15배 뛰었다. Google의 논리는 추론의 깊이가 모델이 멈추기 전까지 써낼 수 있는 분량에 달려 있다는 것이고, 이만한 여유가 생기면 여러 번 넘겨받던 작업을 하나의 긴 궤적으로 대체할 수 있다는 것이다.
그 주장을 뒷받침하는 근거는 외부 평가 기관이 아니라 Google 내부에서 나왔다. 한 사례에서는 Argon 에이전트 집단이 Google 데이터센터 전역의 프로파일링 텔레메트리를 읽고 스스로 메모리 수정을 반영했다. Google은 이 작업으로 배포 시점에 300TiB 이상, 최종적으로는 500TiB에서 1PiB 사이를 회수할 것으로 본다.
두 번째 적용 사례가 더 많은 것을 말해준다. 엔지니어가 보통 자동화를 거부하는 종류의 작업이기 때문이다. Argon 에이전트는 re2 같은 작은 라이브러리부터 80만 줄이 넘는 Fuchsia Zircon 커널까지 Google의 C·C++ 코드를 Rust로 이식하고 있다. 비디오 디코더 libgav1에서는 에이전트가 손으로 다듬은 SIMD 코드 3만 2,000줄을 버리고, 평범한 안전 Rust를 컴파일러가 벡터화하도록 맡겼다. Google은 그 결과가 기존 Rust 이식본보다 2.7배 빠르고 출력 영상은 바이트 단위로 동일하다고 밝혔다.
사이버 우선 공급의 목적
Argon은 방어적 보안 작업을 겨냥해 학습됐고, Google이 내세우는 그림은 사람이 끼지 않는 완결 고리다. 모델이 치명적 취약점을 찾아내고, 실재하는지 확인하고, 패치까지 쓴다는 것이다. Fairwind 참가자와 내부 팀에서 사이버 가드레일을 뺀 이유가 여기 있다. 공격 기법을 추론하기를 거부하는 모델은 구멍을 막을 수도 없다.
초기 현장 성과도 하나 있다. 보안 기업 Wiz가 운영하는 무료 인프라 강화 프로그램 Scan for Good을 통해 Argon이 전 세계에 배포된 병원 소프트웨어에서 개인정보가 심각하게 노출된 지점을 찾아낸 것으로 전해졌다. Google은 이전 프런티어 모델들이 그냥 지나친 문제라고 설명한다. 다만 CWE-bench v1 기준 조치 점수 68%는 뚜렷한 선두가 아니라 공동 1위다.
Astra와 Opus 5.5에 견주면
Google의 벤치마크 논거는 장기 과제에 기대 있다. DeepSWE v1.1에서 77.9%로 새 최고 기록이라고 주장하며, 9to5Google은 이 수치가 Claude Opus 5.5의 74.2%와 GPT-6 Astra의 74.1%를 앞선다고 전했다. Google은 금융·코딩·법률·세무 작업을 미국 GDP 비중으로 가중하는 Vals Index에서도 Argon이 1위이고, Zapier의 AutomationBench에서 51.3%로 1위, 장편 영상 평가 LVBench에서 91.7%를 기록했다고 밝혔다. 모든 수치는 Google이 출시 발표문에 직접 실은 자체 측정값이다.
Google이 아직 손보고 있다는 영역
Google이 꼽은 네 영역은 두 가지 전략으로 깔끔하게 갈린다. 둘은 거부에 관한 것이다. 정당한 이중용도 연구까지 막지 않으면서 사이버·CBRN 악용을 차단하는 일, 그리고 간접 프롬프트 인젝션에 버티는 일이다. Google은 이 공격 유형을 다루는 Gray Swan 벤치마크에서 자사가 앞선다고 주장한다. 나머지 둘은 거부가 언젠가 실패한다고 전제한다. 감시 장치가 Argon의 사고 과정을 읽다가 모델이 요청 범위를 벗어나면 실행을 중단시키고, 고위험 학습을 시작하기 전에 샌드박스를 완전히 봉인한다.
이 대목에 이번 출시에서 가장 흥미로운 고백이 묻혀 있다. Google은 정렬 실패 사례를 의도적으로 학습 루프에 넣지 않는다고 밝혔다. 그것으로 학습시키면 Argon이 자신을 지켜보는 감시 장치를 피하는 법을 익히게 되기 때문이다. Google은 같은 이유로 경쟁사에도 모델의 추론 과정을 읽을 수 있게 남겨두라고 요청했다.
전망
시점이 의미심장하다. Argon은 OpenAI의 DevDay 다음 날 등장했다. OpenAI는 그 자리에서 Dots 에이전트와 GPT-6.1 Sol 모델을 내놨고, 얼마 전에는 안전 문제를 이유로 준비하던 GPT-6.1 Astra를 출시하지 않겠다고 밝혔다. 이번 공개는 Kavukcuoglu가 8월 DeepMind를 맡은 뒤 내건 약속을 지킨 것이기도 하다. 당시 그는 Gemini 4가 다듬는 단계에 있고 완성도를 높이기보다 일찍 내보내겠다고 말했다. 도입 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이고, 이후 4달러와 20달러로 오른다.
FAQ — 자주 묻는 질문
Gemini 4 Argon을 지금 쓸 수 있나?
Google의 Fairwind Program 참가자나 신뢰 테스터가 아니라면 쓸 수 없다. Google이 밝힌 공급 순서는 사이버 방어팀이 먼저, 그다음 유료 API 고객과 Google AI Ultra 구독자, 마지막이 개발자와 기업, 일반 사용자다.
"사이버 가드레일 없이" 공개한다는 말의 뜻은?
Google은 신뢰받는 방어팀과 내부 팀에 모델의 공격적 보안 추론을 제한하지 않는 빌드를 준다. 취약점 발굴 역량을 온전히 쓰게 하기 위해서다. 나머지 사용자는 그 제한이 걸린 버전을 받는다.
Gemini 4 Argon의 가격은 얼마인가?
도입 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이고, 캐시된 입력 토큰은 95% 할인된다. 도입 기간이 끝나면 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러가 된다.






