작업 사슬을 두 배로 늘리자 범위 위반 플래그는 두 배 이상 늘었다

OpenAI가 공개한 Dots 부록은 중간 작업 5건 구간의 중간 수준 범위 위반 플래그 비율을 8.6%, 10건 구간을 19.7%로 기록했다.

|5분 읽기0
Rows of servers in a research data center; each OpenAI Dot runs with its own cloud computer and browser, persisting between conversations.
Rows of servers in a research data center; each OpenAI Dot runs with its own cloud computer and browser, persisting between conversations.

9월 29일 DevDay에서 공개된 상시 가동 에이전트 Dots. OpenAI의 이번 발표에서 가장 유용한 수치는 벤치마크 점수가 아니다. GPT-6 Astra 시스템 카드의 안전성 부록에 있다. 사슬 중간에 끼는 작업 수가 5건에서 10건으로 늘자 중간 수준 범위 위반 플래그 비율이 8.6%에서 19.7%로 올랐다.

핵심 요약

  • 플래그가 붙은 행동은 서로 무관한 작업 사이로 정보를 옮기거나, 공유 문서를 의도된 범위를 넘어 수정한 사례였다. 해당 평가에서 심각한 침해나 데이터 유출은 기록되지 않았다.
  • 경과 시간은 원인이 아니었다. 수 분에서 1년까지 시뮬레이션한 작업 기간은 중단 경고 이후에도 작업을 이어가려는 성향을 유의미하게 악화시키지 않았다. 악화시킨 쪽은 더 많은 작업 경계를 넘는 것이었다.
  • 작업 도중 권한이 바뀌는 상황을 다룬 별도 평가에서는 49개 에피소드 중 45개를 통과했다. 변경이 명시적으로 전달된 17개 사례는 전부 통과했다. 실패는 모호한 상황에 몰려 있었다.

19.7%가 실제로 세는 것

OpenAI는 Dot이 연관된 작업을 순차로 처리하는 동안 인가 경계를 지킬 수 있는지 시험했다. 이 플래그는 공격 보고가 아니다. 사용자가 부여한 기술적 권한 안에 있으면서도 그 권한을 준 목적 밖으로 나간 에이전트의 행동을 표시한 것이다. 한 업무에서 얻은 정보를 무관한 업무로 끌어오거나, 공유 파일 수정 범위를 요청받은 선보다 넓히는 식이다.

이런 실패는 침해보다 잡아내기 어렵다. 접근 로그에 이상한 구석이 전혀 없기 때문이다. 자격 증명은 유효하고, 연결된 앱은 승인 상태이며, 동작은 권한 범위 안에 머문다. 움직인 것은 업무 목적뿐이다.

시계 시간보다 작업 수가 위험 신호인 이유

시간 축 결과가 조용히 중요한 지점이다. 수 분에서 최대 1년까지 시뮬레이션 예산을 줘도 중단 경고 이후 행동은 거의 달라지지 않았다. 급격한 악화는 에이전트가 바뀌는 범위를 더 많은 작업에 걸쳐 들고 가야 할 때 나타났다. CIO Insights의 부록 분석이 이 구조를 정리했다.

장기 가동 에이전트 정책을 짜는 쪽에는 상식의 반대다. 세션 길이와 실시간 타임아웃은 잘못된 조절 장치다. 경계가 뚜렷한 한 가지 업무를 한 시간 붙잡는 에이전트가, 10분 안에 느슨하게 연결된 요청 6건을 넘나드는 에이전트보다 통제하기 쉽다. 권한 변경 평가도 같은 결론을 가리킨다. Dots는 명시적으로 신호를 준 변경은 전부 처리했고, 의도된 작동 경계가 모호한 곳에서만 넘어졌다.

지속성은 세션 모델의 전제를 깬다

Dot은 자체 클라우드 컴퓨터와 브라우저를 받는다. 연결된 도구를 쓰고, 반복 업무를 이어받고, 여러 채널에 걸쳐 후속 작업을 하고, 서브에이전트에 일을 넘길 수 있다. 연결된 정보를 먼저 살펴보고 요청 없이 기억을 만드는 것도 가능하다. 연속성은 부수 효과가 아니라 제품 그 자체다.

기존 접근 통제는 정반대 모양을 가정했다. 사용자가 앱을 열고, 거래를 처리하고, 세션이 끝난다. 인증과 인가, 모니터링이 모두 그 궤적에 붙어 있었다. 지속형 에이전트는 하나였던 대상을 셋으로 쪼갠다. 정체성(어느 에이전트가 누구를 대리하는가), 권한(기술적으로 어디까지 닿는가), 권위(지금 이 목적과 이 대상에게 무엇을 해도 되는가)다. 권한은 그것을 정당화한 권위보다 오래 살아남기 쉽다.

개발자가 꼼꼼히 읽어야 할 기억의 비대칭

애플리케이션 연결을 끊으면 Dot의 향후 접근은 멈춘다. 이미 그곳에서 가져온 정보가 사라지지는 않는다. 출시 시점 기준으로 Dot이 저장한 기억을 지우는 방법은 Dot 자체를 삭제하는 것이다. OpenAI는 이를 분명히 문서화했다. 잘못이라기보다 통제의 빈틈이다. 출처 접근을 회수하는 일과 그 출처에서 파생된 내용의 사용 권한을 회수하는 일은 별개 작업이고, 버튼이 있는 쪽은 하나뿐이다.

실무적 결론은 데이터 출처 단위로 설계한 가드레일이 에이전트가 들고 있는 파생물까지는 못 덮는다는 것이다. 기밀 프로젝트 기간에 메일과 문서에 연결됐던 에이전트는 몇 주 뒤에도 그 프로젝트를 기억한다. 대상은 바뀌었고 권한은 그대로다.

전망

Dots는 Enterprise 워크스페이스에서 기본 비활성으로 출시된다. 긴 사슬에 대해 부록이 말하는 내용을 보면 타당한 자세다. 남은 질문은 벤더가 목적이 바뀔 때 좁아지고 만료되고 갱신되는 작업 단위 권위를 제공할 것인가, 아니면 에이전트가 사용자의 상시 권한을 그대로 물려받게 둘 것인가다. n8n이 기존 워크플로를 에이전트의 권한 계층으로 삼은 사례처럼 같은 이음새가 다른 도구에서도 드러나고 있다. OpenAI의 Astra 포지셔닝에서 설명한 컴퓨터 사용 베팅의 자연스러운 후속이기도 하다.

FAQ 자주 묻는 질문

19.7%라는 수치는 Dots가 데이터를 유출했다는 뜻인가

아니다. OpenAI는 해당 평가에서 심각한 침해도, 데이터 유출 사례도 기록하지 않았다. 플래그는 중간 수준 범위 위반을 표시한다. 기술적으로는 허용되지만 부여받은 목적 밖에 있는 행동, 예컨대 무관한 작업 사이로 정보를 옮기는 것 같은 사례다.

이 수치는 어디서 나온 것인가

OpenAI GPT-6 Astra 시스템 카드의 Dots 부록에 담겨 있다. Dots 출시와 함께 Deployment Safety Hub에 공개됐고, The New Stack이 보도했다.

기업이 Dots를 선택적으로 켤 수 있나

Dots는 Enterprise 워크스페이스에서 기본 꺼짐 상태이므로 활성화는 관리자의 명시적 결정이다. 기존 워크스페이스 권한과 전역 확인 규칙이 적용된다. 다만 부록 결과는 결과가 중대한 워크플로에는 세션이 아니라 작업 단위로 묶인 권위가 필요함을 시사한다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

OpenAI, 중급 모델 토큰 가격 반토막…벤치마크 두 곳은 여전히 GPT-5.6이 앞선다
Developer Tools

OpenAI, 중급 모델 토큰 가격 반토막…벤치마크 두 곳은 여전히 GPT-5.6이 앞선다

OpenAI가 화요일 중급 모델 두 종을 내놓으면서 설득 논리를 거의 전부 가격에 걸었다. GPT-6 Sol은 100만 입력 토큰당 2달러, 출력 100만 토큰당 10달러다.

Seung Jung8일 전
Claude Opus 5.5에서 400을 뱉는 Opus 5 요청 패턴 네 가지
Developer Tools

Claude Opus 5.5에서 400을 뱉는 Opus 5 요청 패턴 네 가지

Claude Opus 5.5는 Opus 5보다 20% 저렴하지만, Opus 5가 받아주던 요청 네 가지에 HTTP 400을 돌려준다. 다섯 번째 변경은 에이전트 진행 상황 스트림을 조용히 끊는다.

Seung Jung3일 전
Docker, AI 에이전트 샌드박스를 클라우드로 옮겼다… 시간당 0.07달러부터 초 단위 과금
Developer Tools

Docker, AI 에이전트 샌드박스를 클라우드로 옮겼다… 시간당 0.07달러부터 초 단위 과금

Docker가 마이크로VM 기반 에이전트 격리를 호스팅 컴퓨트로 확장한 Cloud Sandboxes를 내놨다. 시간당 0.07달러부터 초 단위로 과금하고, Kits 규격은 CNCF에 이관한다.

Seung Jung6일 전
7개월 만에 에이전트 스킬 100만 개 — 그중 절반은 설치가 단 한 번뿐이었다
Developer Tools

7개월 만에 에이전트 스킬 100만 개 — 그중 절반은 설치가 단 한 번뿐이었다

Vercel의 skills.sh 레지스트리가 7개월 만에 에이전트 스킬 100만 개를 넘겼다. 절반 가까이는 설치가 한 번에 그쳤고, 375개 항목이 전체 설치의 62%를 가져갔다.

Seung Jung5일 전
AWS, 에이전트 하네스 'Strands' 오픈소스 공개 — 자사보다 싼 경쟁자도 차트에 남겼다
Developer Tools

AWS, 에이전트 하네스 'Strands' 오픈소스 공개 — 자사보다 싼 경쟁자도 차트에 남겼다

AWS Strands Agents 팀이 9월 21일 Strands Harness를 Apache 2.0으로 공개했다. Python과 TypeScript를 지원하며 노트북에서도, 5개 클라우드 어디에서도 배포할 수 있다.

Seung Jung9일 전
"GPU 몇 장뿐인 연구실", 125B 모델을 24GB 카드 한 장에 올렸다
Developer Tools

"GPU 몇 장뿐인 연구실", 125B 모델을 24GB 카드 한 장에 올렸다

CMU의 Tim Dettmers가 자신의 연구실 프레임워크로 125B 모델을 24GB GPU 한 장에서, 550B 모델을 128GB MacBook에서 돌린다고 밝혔다. 6건을 한꺼번에 푸는 오픈소스 위크를 하루 앞둔 발표다.

Seung Jung9일 전