Claude Sonnet 5.5 출시 자료에서 가장 위험한 대목은 성능 점수가 아니라 라우팅 규칙이다. 분류기가 사이버보안 요청을 차단하면 플랫폼이 그 요청을 구형인 Sonnet 5에 넘겨 답하게 할 수 있는데, Anthropic 자체 프롬프트 인젝션 테스트에서 이렇게 우회된 트래픽이 훨씬 쉽게 뚫렸다. The New Stack가 Claude 앱과 API의 동작 차이를 먼저 정리했다.
핵심 요약
- Claude 앱은 차단된 사이버 요청을 Sonnet 5로 자동 재전송하지만, API 이용자는 폴백을 직접 켜야 한다. 꺼두면 차단된 요청은 답을 받지 못하고 그대로 실패한다.
- Anthropic의 코딩 환경 테스트에서 우회된 요청의 12.01%가 뚫렸다. Sonnet 5.5가 직접 처리한 5,901건 중에서는 4건에 그쳤다. 약 100배 규모의 격차다.
- Sonnet 5.5는 Anthropic이 그동안 Opus에만 적용하던 사이버 정책을 달고 나온 첫 Sonnet 등급 모델이다.
요청 경로에서 무엇이 달라졌나
새로 생긴 것은 두 가지인데, 모델 카드에 드러나는 것은 하나뿐이다. 첫째는 차단 자체다. 좁게 정의된 사이버 요청군과, 특정 ML 가속기용 커널 작업처럼 프런티어 모델 개발과 맞닿은 소수 범주가 아예 거부될 수 있다.
둘째는 그다음이다. Anthropic 앱에서는 거부된 사이버 요청이 Sonnet 5로 다시 넘어가고, 어느 모델이 답했는지 이용자에게 표시된다. API에서는 개발자가 켜기 전까지 이 재시도가 아예 없다. 이번 출시를 설정 파일의 버전 숫자만 바꾸면 되는 일로 여기는 쪽에는 여기가 함정이다. Sonnet 5에서 잘 돌던 파이프라인이 같은 보안 인접 프롬프트에 대해 그대로 실패를 뱉기 시작할 수 있다.
폴백은 가용성이 아니라 보안 결정이다
폴백을 켜는 일은 언뜻 가용성을 얻는 선택으로 보인다. Anthropic이 내놓은 수치는 다른 이야기를 한다. 코딩 환경 프롬프트 인젝션 테스트에서 Sonnet 5.5를 겨냥한 요청 가운데 4분의 1이 사이버 분류기에 걸려 Sonnet 5로 넘어갔다. 디스크를 지우거나 파일을 삭제하라는 주입 명령이 분류기가 막으려는 행동과 그대로 닮았기 때문이다.
그렇게 넘어간 요청 가운데 12.01%가 실제로 뚫렸다. Sonnet 5.5가 직접 처리했을 때는 5,901회 시도 중 4회, 약 0.07%였다. 정리하면 폴백을 켜는 순간 적대적 트래픽의 4분의 1이, 정작 개발자가 고른 모델보다 인젝션 테스트 실패율이 100배 넘게 높은 모델로 흘러갈 수 있다. 다만 가드레일 업체 Gray Swan의 간접 인젝션 벤치마크에서는 폴백을 켜도 점수가 떨어지지 않아, 효과가 모든 테스트 묶음에서 같게 나타나지는 않는다.
정책을 끌어낸 성능 도약
이 조치가 막연한 예방 차원에서 나온 것은 아니다. Anthropic이 공개한 수치를 보면 Sonnet 5.5는 에이전트 코딩 테스트인 Terminal-Bench 4.0에서 70.6%를 기록했다. Sonnet 5는 10.3%, 더 비싼 Opus 5.5는 66.4%였다. 가격은 100만 입력 토큰당 2달러, 100만 출력 토큰당 10달러로 그대로다.
공격 보안 쪽 향상은 더 가팔랐다. 안전장치를 끈 상태에서 시스템 카드는 ExploitBench 410회 중 178회에서 임의 코드 실행이 끝까지 성공했다고 적었다. Irregular의 CyScenarioBench에서는 Sonnet 5가 0.7%에 그친 과제를 46.1% 완수했고, 구글 OSS-Fuzz 코퍼스를 바탕으로 만든 바이너리 익스플로잇 벤치마크에서는 제어 흐름 탈취를 50회 만들어냈다. Sonnet 5는 3회였다. Anthropic은 여전히 이 모델의 사이버 역량을 Opus 5.5보다 아래로 매긴다. 다만 이전 Sonnet과 벌어진 격차가 Opus 등급 정책을 한 단계 아래 가격대까지 끌어내릴 만큼 컸다.
차단은 어떻게 작동하나
세 구성 요소가 판단한다. 프로브가 모델 내부 활성값을 들여다보고, 가벼운 분류기가 Sonnet 5.5 위에서 돌며, 따로 학습시킨 LLM 분류기가 프로브의 판정을 저울질한 뒤 대화를 끊는다. Anthropic은 사이버 탐지 수준이 Opus 5와 비슷하되 탈옥 방어는 의도적으로 느슨하다고 설명한다. 또 정당한 보안 업무를 포함해 Sonnet 5보다 거부가 늘어날 것이라고 이용자에게 미리 일러둔다. 회사 관계자는 침투 테스트, 익스플로잇 생성, 바이너리 취약점 스캔을 적용 범위 예시로 들었다.
업그레이드 전에 정리할 것
- 폴백 설정을 재시도 정책이 아니라 보안 선택으로 보고 의식적으로 정한 뒤 문서로 남긴다.
- 요청마다 어느 모델이 답했는지 기록한다. Anthropic은 우회된 응답이 스스로를 밝힌다고 설명한다.
- 이름만 골라둔 모델이 아니라 Sonnet 5를 상대로도 인젝션 테스트를 다시 돌린다.
오탐을 줄이기 위한 분류기 조정은 계속되고, 검증된 방어자에게는 확대된 Cyber Verification Program을 통해 더 넓은 접근 권한이 주어질 예정이다. Sonnet 5.5는 출시 시점에 이 프로그램에 편입되지 않았다. 같은 출시의 벤치마크 측면은 앞선 기사에서 다뤘다.
FAQ 자주 묻는 질문
Sonnet 5 폴백은 기본으로 켜져 있나?
API에서는 아니다. Anthropic의 Claude 앱은 차단된 사이버 요청을 Sonnet 5로 자동 재시도하지만, API 개발자는 폴백을 직접 켜야 하고 서드파티 플랫폼은 또 다르게 동작할 수 있다. 꺼둔 상태에서는 차단된 요청이 우회되지 않고 그대로 실패한다.
일반 코딩 작업도 이 안전장치에 걸리나?
Anthropic은 대부분 걸리지 않으며 일상적인 소프트웨어 개발은 영향을 받지 않는다고 밝혔다. 정책이 겨냥하는 대상은 침투 테스트나 익스플로잇 생성 같은 고위험 사이버보안 작업이다. 다만 회사는 정당한 보안 업무에서도 Sonnet 5보다 거부가 늘어날 수 있다고 경고한다.
Sonnet 5.5는 Sonnet 5보다 비싼가?
아니다. 가격은 100만 입력 토큰당 2달러, 100만 출력 토큰당 10달러로 동일하다. Anthropic은 과제당 필요한 토큰이 대체로 줄어 실질 비용이 이전 모델보다 최대 30% 낮아진다고 설명한다.






