Sonnet 5.5, 차단된 사이버 요청을 Sonnet 5로 넘긴다 — API는 직접 켜야 한다

Anthropic 자체 테스트에서 우회된 트래픽의 인젝션 침해율이 Sonnet 5.5가 직접 답한 요청보다 약 175배 높게 나왔다

|5분 읽기0
A user interacting with a chat assistant, the interface layer where Anthropic's Claude apps display a notice when a blocked request falls back to Sonnet 5
A user interacting with a chat assistant, the interface layer where Anthropic's Claude apps display a notice when a blocked request falls back to Sonnet 5

Claude Sonnet 5.5 출시 자료에서 가장 위험한 대목은 성능 점수가 아니라 라우팅 규칙이다. 분류기가 사이버보안 요청을 차단하면 플랫폼이 그 요청을 구형인 Sonnet 5에 넘겨 답하게 할 수 있는데, Anthropic 자체 프롬프트 인젝션 테스트에서 이렇게 우회된 트래픽이 훨씬 쉽게 뚫렸다. The New Stack가 Claude 앱과 API의 동작 차이를 먼저 정리했다.

핵심 요약

  • Claude 앱은 차단된 사이버 요청을 Sonnet 5로 자동 재전송하지만, API 이용자는 폴백을 직접 켜야 한다. 꺼두면 차단된 요청은 답을 받지 못하고 그대로 실패한다.
  • Anthropic의 코딩 환경 테스트에서 우회된 요청의 12.01%가 뚫렸다. Sonnet 5.5가 직접 처리한 5,901건 중에서는 4건에 그쳤다. 약 100배 규모의 격차다.
  • Sonnet 5.5는 Anthropic이 그동안 Opus에만 적용하던 사이버 정책을 달고 나온 첫 Sonnet 등급 모델이다.

요청 경로에서 무엇이 달라졌나

새로 생긴 것은 두 가지인데, 모델 카드에 드러나는 것은 하나뿐이다. 첫째는 차단 자체다. 좁게 정의된 사이버 요청군과, 특정 ML 가속기용 커널 작업처럼 프런티어 모델 개발과 맞닿은 소수 범주가 아예 거부될 수 있다.

둘째는 그다음이다. Anthropic 앱에서는 거부된 사이버 요청이 Sonnet 5로 다시 넘어가고, 어느 모델이 답했는지 이용자에게 표시된다. API에서는 개발자가 켜기 전까지 이 재시도가 아예 없다. 이번 출시를 설정 파일의 버전 숫자만 바꾸면 되는 일로 여기는 쪽에는 여기가 함정이다. Sonnet 5에서 잘 돌던 파이프라인이 같은 보안 인접 프롬프트에 대해 그대로 실패를 뱉기 시작할 수 있다.

폴백은 가용성이 아니라 보안 결정이다

폴백을 켜는 일은 언뜻 가용성을 얻는 선택으로 보인다. Anthropic이 내놓은 수치는 다른 이야기를 한다. 코딩 환경 프롬프트 인젝션 테스트에서 Sonnet 5.5를 겨냥한 요청 가운데 4분의 1이 사이버 분류기에 걸려 Sonnet 5로 넘어갔다. 디스크를 지우거나 파일을 삭제하라는 주입 명령이 분류기가 막으려는 행동과 그대로 닮았기 때문이다.

그렇게 넘어간 요청 가운데 12.01%가 실제로 뚫렸다. Sonnet 5.5가 직접 처리했을 때는 5,901회 시도 중 4회, 약 0.07%였다. 정리하면 폴백을 켜는 순간 적대적 트래픽의 4분의 1이, 정작 개발자가 고른 모델보다 인젝션 테스트 실패율이 100배 넘게 높은 모델로 흘러갈 수 있다. 다만 가드레일 업체 Gray Swan의 간접 인젝션 벤치마크에서는 폴백을 켜도 점수가 떨어지지 않아, 효과가 모든 테스트 묶음에서 같게 나타나지는 않는다.

정책을 끌어낸 성능 도약

이 조치가 막연한 예방 차원에서 나온 것은 아니다. Anthropic이 공개한 수치를 보면 Sonnet 5.5는 에이전트 코딩 테스트인 Terminal-Bench 4.0에서 70.6%를 기록했다. Sonnet 5는 10.3%, 더 비싼 Opus 5.5는 66.4%였다. 가격은 100만 입력 토큰당 2달러, 100만 출력 토큰당 10달러로 그대로다.

공격 보안 쪽 향상은 더 가팔랐다. 안전장치를 끈 상태에서 시스템 카드는 ExploitBench 410회 중 178회에서 임의 코드 실행이 끝까지 성공했다고 적었다. Irregular의 CyScenarioBench에서는 Sonnet 5가 0.7%에 그친 과제를 46.1% 완수했고, 구글 OSS-Fuzz 코퍼스를 바탕으로 만든 바이너리 익스플로잇 벤치마크에서는 제어 흐름 탈취를 50회 만들어냈다. Sonnet 5는 3회였다. Anthropic은 여전히 이 모델의 사이버 역량을 Opus 5.5보다 아래로 매긴다. 다만 이전 Sonnet과 벌어진 격차가 Opus 등급 정책을 한 단계 아래 가격대까지 끌어내릴 만큼 컸다.

차단은 어떻게 작동하나

세 구성 요소가 판단한다. 프로브가 모델 내부 활성값을 들여다보고, 가벼운 분류기가 Sonnet 5.5 위에서 돌며, 따로 학습시킨 LLM 분류기가 프로브의 판정을 저울질한 뒤 대화를 끊는다. Anthropic은 사이버 탐지 수준이 Opus 5와 비슷하되 탈옥 방어는 의도적으로 느슨하다고 설명한다. 또 정당한 보안 업무를 포함해 Sonnet 5보다 거부가 늘어날 것이라고 이용자에게 미리 일러둔다. 회사 관계자는 침투 테스트, 익스플로잇 생성, 바이너리 취약점 스캔을 적용 범위 예시로 들었다.

업그레이드 전에 정리할 것

  1. 폴백 설정을 재시도 정책이 아니라 보안 선택으로 보고 의식적으로 정한 뒤 문서로 남긴다.
  2. 요청마다 어느 모델이 답했는지 기록한다. Anthropic은 우회된 응답이 스스로를 밝힌다고 설명한다.
  3. 이름만 골라둔 모델이 아니라 Sonnet 5를 상대로도 인젝션 테스트를 다시 돌린다.

오탐을 줄이기 위한 분류기 조정은 계속되고, 검증된 방어자에게는 확대된 Cyber Verification Program을 통해 더 넓은 접근 권한이 주어질 예정이다. Sonnet 5.5는 출시 시점에 이 프로그램에 편입되지 않았다. 같은 출시의 벤치마크 측면은 앞선 기사에서 다뤘다.

FAQ 자주 묻는 질문

Sonnet 5 폴백은 기본으로 켜져 있나?

API에서는 아니다. Anthropic의 Claude 앱은 차단된 사이버 요청을 Sonnet 5로 자동 재시도하지만, API 개발자는 폴백을 직접 켜야 하고 서드파티 플랫폼은 또 다르게 동작할 수 있다. 꺼둔 상태에서는 차단된 요청이 우회되지 않고 그대로 실패한다.

일반 코딩 작업도 이 안전장치에 걸리나?

Anthropic은 대부분 걸리지 않으며 일상적인 소프트웨어 개발은 영향을 받지 않는다고 밝혔다. 정책이 겨냥하는 대상은 침투 테스트나 익스플로잇 생성 같은 고위험 사이버보안 작업이다. 다만 회사는 정당한 보안 업무에서도 Sonnet 5보다 거부가 늘어날 수 있다고 경고한다.

Sonnet 5.5는 Sonnet 5보다 비싼가?

아니다. 가격은 100만 입력 토큰당 2달러, 100만 출력 토큰당 10달러로 동일하다. Anthropic은 과제당 필요한 토큰이 대체로 줄어 실질 비용이 이전 모델보다 최대 30% 낮아진다고 설명한다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

Claude Code Projects, 병렬 클라우드 스레드를 지휘하는 조정자로 돌아왔다
Developer Tools

Claude Code Projects, 병렬 클라우드 스레드를 지휘하는 조정자로 돌아왔다

새로 설계된 Claude Code Projects는 작업 스레드 위에 조정자를 둔다. 스레드는 저마다 자기 브랜치에서 도는 완전한 클라우드 세션이고, 메모리는 함께 쓴다.

Seung Jung12일 전
7개월 만에 에이전트 스킬 100만 개 — 그중 절반은 설치가 단 한 번뿐이었다
Developer Tools

7개월 만에 에이전트 스킬 100만 개 — 그중 절반은 설치가 단 한 번뿐이었다

Vercel의 skills.sh 레지스트리가 7개월 만에 에이전트 스킬 100만 개를 넘겼다. 절반 가까이는 설치가 한 번에 그쳤고, 375개 항목이 전체 설치의 62%를 가져갔다.

Seung Jung3일 전
포럼 이미지 버그로 OpenAI 내부 저장소가 뚫렸다
Developer Tools

포럼 이미지 버그로 OpenAI 내부 저장소가 뚫렸다

Hacktron AI가 libheif 힙 오버플로와 OpenAI SSO 결함을 엮어 직원 Codex 계정과 openai/openai 모노레포에 도달했다. 두 취약점은 모두 수정됐다.

Seung Jung11일 전
Claude Opus 5.5에서 400을 뱉는 Opus 5 요청 패턴 네 가지
Developer Tools

Claude Opus 5.5에서 400을 뱉는 Opus 5 요청 패턴 네 가지

Claude Opus 5.5는 Opus 5보다 20% 저렴하지만, Opus 5가 받아주던 요청 네 가지에 HTTP 400을 돌려준다. 다섯 번째 변경은 에이전트 진행 상황 스트림을 조용히 끊는다.

Seung Jung어제
머지 3,000건에 롤백 0건, Anthropic 2주 속도 스프린트의 내막
Developer Tools

머지 3,000건에 롤백 0건, Anthropic 2주 속도 스프린트의 내막

Anthropic은 8월 스프린트에서 claude.ai의 p75 입력 가능 시점을 3.1초에서 0.55초로 줄였다. CI를 명령어 수로 막는 방식으로 롤백 없이 3,000건을 머지했다.

Seung Jung5일 전
Bun의 Zig→Rust 포팅, 11일과 병렬 에이전트 64개가 들었다
Developer Tools

Bun의 Zig→Rust 포팅, 11일과 병렬 에이전트 64개가 들었다

Bun 런타임이 11일간의 에이전트 포팅으로 Zig에서 Rust로 옮겨 갔다. 메모리 안전성 버그는 사라졌지만 의미의 버그는 남았다.

Seung Jung9일 전