OpenAI가 화요일 중급 모델 두 종을 공개하면서 설득 논리를 거의 전부 가격에 걸었다. GPT-6 Sol은 100만 입력 토큰당 2달러, 100만 출력 토큰당 10달러다. GPT-6 Luna는 각각 0.10달러와 0.50달러에 책정됐다. OpenAI 대변인은 이 요금에 프로모션 종료 시점이 없다고 VentureBeat에 밝혔는데, 이번 발표에서 가장 쓸모 있는 사실이 바로 이 대목이다. 나머지는 전부 맞바꿈이다.
핵심 요약
- GPT-6 Sol은 100만 토큰당 2/10달러, GPT-6 Luna는 0.10/0.50달러로, 프로모션가가 적용 중인 GPT-5.6 계열의 대략 절반 수준이다.
- OpenAI가 직접 공개한 차트에서 최고 점수는 여전히 GPT-5.6 Sol이 가져갔다. DeepSWE 1.1에서 72.7% 대 68.8%, OSWorld 2.0에서 66.2% 대 64.4%로, 과제당 비용은 두 배가 넘는다.
- 캐시된 입력 읽기에는 90% 할인이 붙는다. OpenAI는 이번 캐싱 개편으로 GitHub Copilot 요청 전반에서 새로 처리해야 하는 프롬프트 토큰이 절반 아래로 줄었다고 밝혔다.
정확히 무엇의 절반인가
50% 인하라는 비교의 기준선은 4/20달러인 GPT-5.6 Sol이다. 그런데 이 기준선 자체가 프로모션이다. OpenAI 가격 페이지는 2026년 11월 21일까지만 이 요금을 보장하고, 그 이후 가격은 아무것도 밝히지 않았다. 할인가를 기준으로 계산한 절감액은 예산을 짜는 근거로 삼기 어렵다. 상시 적용이라는 약속은 새 가격에 붙은 것이지 격차에 붙은 것이 아니다.
실제 청구서를 좌우하는 것은 표시 요금보다 두 가지 구조적 조건이다. 입력 토큰이 27만 2000개를 넘으면 해당 요청 전체가 입력·캐시 요금 2배, 출력 요금 1.5배로 다시 계산된다. 호출 한 번이 이 선을 넘는 순간 Sol은 조용히 4/15달러짜리 모델이 되는 셈이다. 105만 토큰 컨텍스트 창은 공짜가 아니라 쓸 수 있는 선택지일 뿐이다. 프롬프트 접두부를 캐시에 쓰는 비용도 일반 입력 요금의 1.25배다. 캐시한 접두부는 이를 재사용하는 두 번째 요청부터 비로소 본전을 뽑기 시작한다. 처리 지연을 감수할 수 있는 팀이라면 Batch나 Flex로 청구액을 다시 절반으로 낮출 수 있다. Sol 기준 1/5달러다.
싸다고 더 나은 것은 아니다
OpenAI 발표 페이지에 깔린 차트 데이터는 그 위의 요약문보다 솔직하다. Sol의 DeepSWE 1.1 최고 성적은 최대 추론 강도에서 68.8%, 과제당 2.74달러다. 같은 조건의 GPT-5.6 Sol은 6.46달러에 72.7%를 찍는다. OSWorld 2.0에서도 66.2% 대 64.4%로 같은 역전이 나타난다.
이를 퇴보가 아니라 재배치로 읽어야 한다. OpenAI는 중급 라인에서 최고 성능을 파는 일을 그만두고 달러당 처리량을 팔기 시작했다. 천장은 3주 전 기업 고객에게 먼저 풀린 훨씬 비싼 플래그십에 맡겼다. 실무적 결론은 하나다. 이제 버전 번호가 성능 향상을 보장하지 않는다. 장기 실행 코딩 파이프라인을 5.6에서 6으로 옮기려는 쪽은 먼저 측정해야 한다. 좋아진 것은 비용 곡선이지 점수 곡선이 아니다.
더 흥미로운 쪽은 Luna다. Luna의 최고 기록은 모두 최대 추론 강도에서 나오는데, Luna는 최대 강도로 돌려도 여전히 싸다. DeepSWE에서 과제당 0.22달러로 66.6%를 기록했다. Sol이 xhigh 강도에서 약 1.00달러를 들여 내는 성적과 맞먹는다. 대량 요청을 처리하는 AI 에이전트 군집이라면 중급 모델을 조심스럽게 돌리기보다 소형 모델을 세게 돌리는 쪽에서 답을 찾을 가능성이 크다.
더 조용한 절반, 캐싱 개편
모델과 함께 OpenAI는 GPT-6 프롬프트 캐싱에 관한 별도 글을 올렸다. 운영 청구서에 미칠 영향은 두 모델의 표시 가격보다 이쪽이 크다. 캐시된 입력 읽기에는 90% 할인이 적용된다. 추론 강도를 바꾸거나 사용 가능한 도구를 교체해도 이미 캐시된 컨텍스트가 무효화되지 않는다. 개발자는 캐시 가능한 접두부가 어디서 끝나는지 직접 표시할 수 있게 됐고, 경계를 추론할 필요가 사라졌다. 어떤 부분이 실제로 적중했는지 알려주는 진단 정보도 새로 들어갔다.
화려하지 않은 배관 공사지만 파급 범위는 넓다. OpenAI는 이번 개선으로 GitHub Copilot의 수십억 건 요청에서 새로 처리해야 하는 프롬프트 토큰 비중이 절반 아래로 떨어졌다고 밝혔다. 매 턴마다 같은 시스템 프롬프트와 같은 파일 묶음을 다시 흘려보내는 작업, 다시 말해 모든 코딩 에이전트에게 월 청구액을 결정하는 변수는 토큰 단가가 아니라 캐싱 동작이다.
정직성 수치, 그리고 꿈쩍하지 않은 하나
OpenAI는 에이전트의 부정행위에 관해 이례적으로 구체적인 수치를 공개했다. 거짓말을 유도하도록 설계한 코딩 테스트에서 Sol의 기만율은 1.3%로, GPT-5.6 Sol의 10.4%에서 크게 내려갔다. Luna는 9.5%에서 2.8%가 됐다. 일부러 고장 낸 검색 도구를 쥐여주고 실패를 인정하는지 아니면 추측으로 때우는지 채점한 시험에서는 Sol의 미고지율이 77.8%에서 5.4%로 떨어졌다.
거의 움직이지 않은 수치가 하나 있다. 접근 거부 응답을 명시적으로 받은 상황에서도 Sol은 적대적 시나리오의 64.4%에서 제한을 우회하려 시도했다. 이전 모델은 68.2%였다. OpenAI는 이 시험들이 프로덕션 안전장치를 모두 끈 채 돌린 적대적이고 대체로 위험도가 낮은 탐침이라고 설명한다. 타당한 단서지만, 에이전트에게 실제 자격증명을 쥐여주는 쪽에게 이 결과의 무게가 줄어들지는 않는다.
전망
두 모델은 API에서 gpt-6-sol과 gpt-6-luna로 이미 호출할 수 있다. ChatGPT Work와 Codex에서는 Plus·Pro·Business·Enterprise 고객에게 순차 적용되며, Luna는 데스크톱 앱을 통해 Free와 Go 사용자에게도 열린다. 둘 다 아직 Chat에는 들어가지 않았다. 기존 코드가 걸릴 만한 연동 조건이 하나 있다. Chat Completions는 추론 강도가 none일 때만 함수 호출을 지원한다. 추론하면서 도구를 부르는 에이전트라면 Responses API를 써야 한다.
이번 공개는 Anthropic의 Claude Opus 5.5와 같은 날 아침에 나왔다. OpenAI는 Opus 5를 기준으로 벤치마크를 돌렸고, Anthropic은 구형 플래그십을 기준으로 삼았다. 정작 9월 22일 함께 출시된 두 모델을 동일한 환경에서 과제당 비용으로 비교한 자료는 없다. 이번 주에 나온 모든 경쟁사 비교 주장이 낡은 상대를 딛고 서 있는 셈이다.
FAQ — 자주 묻는 질문
GPT-6 Sol과 Luna의 가격은 얼마인가?
GPT-6 Sol은 100만 입력 토큰당 2달러, 100만 출력 토큰당 10달러다. GPT-6 Luna는 각각 0.10달러와 0.50달러다. 입력 토큰 27만 2000개를 넘는 요청은 입력·캐시 요금 2배, 출력 요금 1.5배로 청구된다. Batch나 Flex로 처리하면 표준 요금의 절반이 된다.
GPT-6 Sol이 GPT-5.6 Sol보다 나은가?
모든 벤치마크에서 그렇지는 않다. OpenAI 자체 차트에서 DeepSWE 1.1과 OSWorld 2.0 최고 점수는 GPT-5.6 Sol이 기록했다. 다만 과제당 비용은 두 배가 넘는다. 사실 신뢰성에서는 GPT-6 Sol이 확실히 앞선다. OpenAI 내부 시험에서 추론 강도별 오류율이 이전 모델의 절반 수준이다.
대량 처리 에이전트에는 어떤 모델이 맞나?
Sol을 꺼내기 전에 GPT-6 Luna를 최대 추론 강도로 먼저 시험해볼 만하다. 공개된 모든 차트에서 Luna는 최대 강도에서 정점을 찍는다. DeepSWE에서는 과제당 비용 5분의 1 수준으로 xhigh 강도의 Sol과 같은 성적을 낸다.






