이름은 그대로, 가중치만 바뀐다 — API 모델명은 무엇을 보장하나

9월 14일부터 deepseek-v4-pro 엔드포인트는 V4.1 Flash 가중치로 응답한다. 옵트아웃도, 병행 기간도, 후속 Pro 발표도 없다

|5분 읽기0
A GPU cluster inside a research data centre, the kind of serving capacity DeepSeek frees up by collapsing its Pro and Flash tiers into a single model.
A GPU cluster inside a research data centre, the kind of serving capacity DeepSeek frees up by collapsing its Pro and Flash tiers into a single model.

모델 이름은 약속이어야 한다. 이번 주 DeepSeek은 그 약속이 얼마짜리인지 시험했다. 2026년 9월 14일 04:00 UTC부터 deepseek-v4-pro 엔드포인트는 이름이 가리키는 가중치 제공을 멈추고 대신 V4.1 Flash로 응답한다. 옵트아웃도, 병행 기간도, 후속 Pro 등급 발표도 없다. 구형 Flash 별칭 3개는 이미 같은 방식으로 교체됐다. 뒤이은 엔지니어들의 반발은 품질 문제가 아니었다. API 식별자가 대체 무엇을 뜻하느냐는 문제였다.

핵심 요약

  • DeepSeek은 공개된 일정에 따라 엔드포인트를 폐기하는 대신, 이름은 그대로 둔 채 그 뒤의 가중치를 바꾸고 있다.
  • 개발자들이 찾아낸 현실적 방어책은 오픈 가중치다. 1차 제공사의 API가 멈춰도 서드파티 호스트는 퇴역한 체크포인트를 계속 서빙할 수 있다.
  • 전환 이후에는 비교할 기준선이 남지 않는다. 남은 며칠 안에 프롬프트와 툴 버전, 승인된 출력을 확보해둬야 한다.

고정한 이름을 계약으로 보는 이유

400점과 댓글 200개를 넘긴 해커뉴스 토론을 지배한 논리는 평범한 의존성 관리에서 나왔다. 소프트웨어 팀이 버전을 고정하는 이유는 업그레이드를 자기가 통제하는 일정에 맞춰, 회귀 테스트를 붙여서 진행하기 위해서다. 고정한 식별자 밑의 산출물을 바꿔치우면 그 일정과 테스트 기간이 한꺼번에 사라진다. 게다가 그 과정이 조용하다. 요청은 성공하고 응답은 그럴듯해 보이며, 평가 대상 시스템이 바뀌었다는 신호는 어디에도 없다.

교육청 학생용 챗봇을 운영한다는 한 댓글 작성자는 그 대가를 구체적으로 설명했다. 이곳에서는 모델을 업그레이드할 때마다 콘텐츠 안전성 검토가 걸리는데, 매번 성·마약·정신건강 관련 질문에서 같은 시스템 프롬프트를 지키는 정도가 눈에 띄게 달라졌다. 전에는 관료적 신중함으로 보이던 절차가 실제로는 구조를 떠받치고 있었던 셈이다. 강제 교체는 이 검토를 통째로 건너뛰고 그 차이를 그대로 사용자에게 내보낸다.

반론, 그리고 그 반론이 무너진 이유

가장 흔한 반박은 이런 시스템이 애초에 결정론적이었던 적이 없으니 버전 고정도 절반은 연출이었다는 주장이다. 이 틀은 따져보면 금방 무너진다. 토큰 단위의 비결정성은 어떤 분포에서 표본을 뽑든 상관없다는 뜻이 전혀 아니다. 육면체 주사위와 팔면체 주사위는 둘 다 무작위지만, 게임 도중에 하나를 다른 하나로 바꾸는 것은 여전히 변경이다. 팀은 평가를 거쳐 출력 분포를 규정한다. 가중치를 교체하면 개별 생성이 아무리 들쭉날쭉했든 그 규정 자체가 무효가 된다.

시점이 논점을 더 날카롭게 만들었다. 결정론적 추론은 V4 계열의 명시적 엔지니어링 목표였고, 이 연구소는 자체 연구에서 비트 단위로 배치 불변인 커널을 문서화했다. 재현성을 설계 목표로 내걸면서 엔드포인트는 얼마든지 갈아끼울 수 있는 운영상의 편의로 다루는 제공사는, 서로 반대로 당기는 두 입장을 동시에 쥐고 있는 셈이다.

오픈 가중치가 실제로 사주는 것

개발자들이 수렴한 우회책은 이 상황이 폐쇄형 연구소의 같은 사태보다 나은 유일한 지점이다. 체크포인트가 공개돼 있으므로 1차 엔드포인트가 넘어가도 서드파티 추론 호스트는 그것을 계속 서빙할 수 있다. 모델이 사라지는 것이 아니라 편한 경로가 사라질 뿐이다. 이는 성격이 다른 차이지만 공짜는 아니다. 다른 호스트로 옮기면 새로운 요청 한도와 새로운 지연 특성을 받아들여야 하고, 재현성 요구가 엄격하다면 그 호스트가 같은 양자화와 하네스를 쓰는지 검증해야 한다.

셀프 호스팅은 같은 답의 더 강한 버전이자 여러 댓글 작성자가 이미 도달한 결론이다. 제공사가 관리하는 엔드포인트라면 무엇이든 자원 할당과 서빙 설정, 모델 버전을 예고 없이 바꿀 수 있다고 본 것이다. 규제를 받는 배포라면 방어할 만한 입장이다. 동시에 비싼 선택이며, 이것만이 유일하게 받아들일 만한 답이라고 한다면 호스팅형 에이전트 인프라는 믿을 수 없다고 인정하는 꼴이 된다.

실제로 위험에 놓인 쪽

위험은 고르게 퍼져 있지 않고, 그 이유는 공급사 자체 평가표에 드러난다. 실행 계열 작업은 교체로 오히려 나아진다. 터미널 작업과 자동화, 저장소 단위 코딩이 모두 두 자릿수 상승폭을 기록했다. 지식 회상과 어려운 추론은 그렇지 않다. 대학원 수준 질의응답에서는 물러나는 모델이 여전히 앞선다. 결국 타격을 입을 가능성이 가장 큰 쪽은 1차 제공사 안에 이전 경로가 남아 있지 않은 팀이고, 이들은 그 사실을 벤치마크 하네스가 아니라 운영 환경에서 알게 된다.

전망

남은 시간은 며칠 단위다. Pro를 운영에 쓰고 있다면 원래 서비스가 아직 응답하는 지금 프롬프트와 설정, 툴 버전, 요청 타임스탬프, 승인된 출력을 기록해둬야 한다. 그 기록이 나중에 무엇이 달라졌는지 판단할 유일한 증거다. 이번 전환을 넘어 이 사건은 업계가 두고두고 다툴 기준점을 남겼다. 엔드포인트 식별자에 암묵적인 교체 권한이 딸려 있는가, 그리고 에이전트 인프라를 내놓는 연구소들이 플랫폼 업체들이 오래 그래왔듯 폐기 일정을 공개해야 한다고 느끼게 될 것인가. 같은 질문은 에이전트에 상시 권한이 주어지는 곳마다 이미 떠오르고 있으며, 벤더 중립 에이전트 확장 표준을 향한 움직임이 그 흐름을 보여준다.

FAQ

9월 14일 이후 deepseek-v4-pro 요청은 어떻게 되나

04:00 UTC, 베이징 시각으로 정오부터 V4.1 Flash가 응답하고 요금도 Flash 기준으로 청구된다. 호출은 실패하지 않고 엔드포인트 이름도 그대로여서, 클라이언트 쪽에서는 교체를 알아챌 신호가 없다. DeepSeek은 V4.1 Pro 출시 일정을 아직 발표하지 않았다.

기존 V4 Pro 가중치를 계속 쓸 수 있나

DeepSeek 자체 API로는 불가능하다. 다만 체크포인트가 오픈 가중치로 공개돼 있어 서드파티 추론 호스트가 원하는 기간만큼 제공할 수 있고, 셀프 호스팅을 택하면 의존 관계 자체가 사라진다. 두 경로 모두 지연 시간과 양자화, 요청 한도를 다시 검증해야 한다.

어떤 작업이 가장 위험한가

추론과 지식 회상 작업이다. 이 영역에서는 V4 Pro가 V4.1 Flash보다 여전히 높은 점수를 낸다. 반대로 에이전트형 코딩과 터미널 자동화는 교체로 개선될 여지가 크다. Flash가 Pro를 가장 크게 앞서는 구간이 바로 그쪽이다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다
LLM & Chatbots

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다

OpenAI의 GPT-6 Astra가 컴퓨터 사용 기능과 100만 토큰 컨텍스트, 10/50달러 가격으로 기업 사용자에게 풀린다. 대표 점수에는 하네스 단서가 붙는다.

Seung Jung7일 전
Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다
LLM & Chatbots

Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다

Anthropic이 Claude의 18세 이상 정책 집행 방식을 공개했다. 분류기가 미성년자 의심 계정을 비활성화하고, 잘못 걸린 성인은 Yoti 검증으로 계정을 되찾는다.

Seung Jung5일 전
ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다
LLM & Chatbots

ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다

OpenAI가 ChatGPT Images 2.5를 내놨다. 지연 시간을 최대 50% 줄이고 Sketch 캔버스와 템플릿, 고정 댓글, API 모델 두 종을 함께 공개했다.

Seung Jung6일 전
OpenAI, 데이터 에이전트와 월스트리트용 ChatGPT를 하루에 함께 내놨다
LLM & Chatbots

OpenAI, 데이터 에이전트와 월스트리트용 ChatGPT를 하루에 함께 내놨다

OpenAI가 같은 목요일에 ChatGPT Work용 Data 에이전트와 Morgan Stanley·Evercore가 함께 만든 ChatGPT for Financial Services를 공개했다.

Seung Jung6일 전
Gemini가 윈도우에 상륙했다, Alt+Space 한 번으로 뜨는 데스크톱 비서
LLM & Chatbots

Gemini가 윈도우에 상륙했다, Alt+Space 한 번으로 뜨는 데스크톱 비서

Google의 윈도우용 Gemini 네이티브 앱이 Alt+Space로 어떤 프로그램 위에든 뜬다. Gmail·Google Drive에 연결되며 Windows 10·11에서 전 세계 이용이 가능하다.

Seung Jung6일 전
Anthropic, 인포스틸러 악성코드가 유료 Claude 계정 사용량을 빼간다 경고
LLM & Chatbots

Anthropic, 인포스틸러 악성코드가 유료 Claude 계정 사용량을 빼간다 경고

Anthropic이 인포스틸러 악성코드에 로그인 세션을 도난당한 Claude 이용자들에게 경고 메일을 보내고 있다. 공격자는 비밀번호 없이 유료 사용량을 태운다.

Seung Jung7일 전