TypeSafe, 4000만 달러와 함께 등장 — 텍스트를 생성하지 않는 모델을 내놨다

Jev는 문자열 대신 보정된 확률이 붙은 타입 값을 내놓는다. 출력 토큰 요금은 0달러다

|4분 읽기0
A developer at work - the integration seam TypeSafe's Jev targets, where model output meets the code that has to consume it
A developer at work - the integration seam TypeSafe's Jev targets, where model output meets the code that has to consume it

언어 모델 위에 올린 모든 운영 시스템에는 같은 이음매가 있다. 모델이 문자열을 돌려주면, 그 뒤의 무언가가 이를 파싱하고 검증한 다음 파싱이 실패했을 때 무엇을 할지 정해야 한다. 9월 15일 공개된 TypeSafe AI의 답은 문자열 자체를 없애는 것이다. 이 회사의 첫 모델 Jev는 미리 선언한 스키마에서 고른 타입 값을 반환하고, 각 값에는 보정된 확률이 붙는다.

핵심 요약

  • TypeSafe는 DCVC가 주도한 약 4000만 달러 시드 투자를 받고 스텔스에서 나왔다. 전 OpenAI 연구자 Diogo Almeida가 Erik Gafni, Sasha Sheng과 함께 창업했다.
  • Jev의 입력 요금은 100만 토큰당 0.042달러이며 출력 토큰은 무료다. 회사가 밝힌 엔드투엔드 지연은 70~500밀리초다.
  • 질의를 실행하기 전에 출력 스키마가 고정되므로, 타입 오류가 드문 것이 아니라 구조적으로 불가능하다는 것이 회사 설명이다.

System One 모델이란 무엇인가

TypeSafe는 이 범주를 System One이라 부른다. 사람이 읽는 산문이 아니라 소프트웨어가 곧바로 소비하는 빠른 판단을 내놓도록 만든 모델이다. 여기에 도달하기 위해 세 가지가 바뀌었다. 다른 아키텍처, 병렬 샘플러, 그리고 이 연구소가 보정된 판단을 위한 강화학습(RLCD)이라 이름 붙인 학습 방법이다.

핵심은 RLHF와의 대비다. 인간 피드백 학습이 평가자가 선호하는 응답을 최적화하고, 검증 가능한 보상 학습이 검사기가 확인할 수 있는 출력을 최적화한다면, RLCD는 판단에 붙은 확률이 정직해지도록 최적화한다. Almeida는 ChatGPT의 토대가 된 InstructGPT 연구의 공저자이므로, 이 결별은 의도적이다.

샘플링 방식의 차이는 목적함수만큼이나 중요하다. 기존 모델은 토큰을 하나씩 생성하며 매번 직전 토큰에 조건을 건다. Jev는 구조화 출력의 모든 필드를 한 번의 병렬 패스로 내놓는다. 지연과 비용에 관한 주장도 여기서 나온다.

수치, 그리고 그 수치가 딛고 선 근거

회사 사이트에 걸린 대표 수치인 193.6배 빠름, 444.6배 저렴함은 공개 리더보드가 아니라 자체 제작한 평가에서 나왔다. TypeSafe는 워크플로를 코드로 고정한 뒤 모든 모델을 동일한 연산 그래프에 통과시키고, GPT-6 Astra와 Fable 5.1의 평균에서 뽑은 기준 확률과 대조해 점수를 매긴다.

다만 이 연구소는 단서도 함께 공개했다. 평가에 쓴 네 개 워크플로는 자사 모델 역량팀이 직접 작성했다. 프런티어 경쟁 모델을 기준값으로 삼으면 결과가 그 경쟁 모델 쪽으로 기울며, 회사는 이 때문에 자사 격차가 오히려 축소돼 보인다고 주장한다. 그리고 타입 오류율 0%는 측정한 값이 아니라 스키마 일치로 보장한 값이다. 게시물도 인정하듯, 반례 하나면 무너지는 주장이다.

어디에 들어갈 물건인가

이 제품은 챗봇 대체재가 아니다. TypeSafe는 Jev를 평범한 소프트웨어 곳곳에 흩어진 모호한 판단, 즉 분류·라우팅·점수 산정·추출·분기에 겨눈다. 손으로 짠 규칙이 금세 부서지고, 그렇다고 전체 대규모 언어 모델 호출을 핫패스에 넣기에는 너무 느리거나 비싼 자리들이다.

회사가 제안한 다른 용도는 대규모 데이터셋에 대한 맵리듀스 처리, 100밀리초 예산 탓에 프런티어 모델 호출이 불가능한 실시간 인터페이스, 그리고 다른 모델의 출력을 심사하거나 가드레일 역할을 하는 판정자다. 내부 데모 하나는 초당 10건의 질의를 시간당 약 7달러에 처리한다.

지금 이 프레이밍이 먹히는 이유

모델이 너무 예측 불가능해 그 위에 무언가를 쌓기 어렵다는 지적은 점점 날카로워지고 있다. 대안을 파는 연구소들만 하는 이야기가 아니다. 고정된 API 모델명 뒤에서 예고 없이 가중치가 바뀐 사례는 반대편에서 같은 지점을 짚었다. 자유 텍스트를 만들지 못하기 때문에 할루시네이션도 만들 수 없는 모델은, 그 불만에 대한 투박하지만 확실한 대답이다.

대가는 분명하다. 설명문이든 코드든 서술형 답변이든, 언어를 생성해야 하는 작업은 Jev의 영역 밖이다. TypeSafe는 공개한 평가를 서부 해안에서 자사 노트북으로 돌렸다는 점도 인정한다. Jev는 현재 대기자 명단을 받는 얼리 액세스 상태다. 진짜 볼 만한 수치는 GPU 비용을 다른 누군가가 내기 시작한 뒤에도 이 가격이 유지되는지다.

자주 묻는 질문

Jev는 텍스트 대신 무엇을 반환하나?

개발자가 질의 실행 전에 정의한 스키마에서 고른 타입 값을 반환하며, 각 값에는 보정된 확률과 신뢰도 점수가 함께 붙는다. 가능한 출력이 미리 고정되므로 응답에 파싱이나 검증 단계가 필요 없고, 스키마가 허용하지 않는 필드는 모델이 내놓을 수 없다.

Jev의 가격은 얼마인가?

입력 토큰은 100만 개당 0.042달러이고 출력 토큰은 무료다. TypeSafe는 출력이 과금하기에도 너무 싸다고 설명한다. 회사는 가격이 오르기보다 내려갈 것으로 보지만, 이 요금이 보조금 없이 유지되는지는 아직 증명할 수 없다고 인정한다.

Jev는 일반 공개됐나?

아니다. 선별된 개발자를 대상으로 한 얼리 액세스 단계이며 typesafe.ai에서 대기자 명단을 받는다. TypeSafe는 속도·비용 주장의 방법론을 검증하려는 이들을 위해 전체 질의와 불일치 사례를 포함한 네 건의 워크플로 평가를 공개했다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

애플, 시리의 상시 청취가 프라이버시를 지키는 방식 공개
AI & Machine Learning

애플, 시리의 상시 청취가 프라이버시를 지키는 방식 공개

애플이 공개한 프라이버시 문서는 시리 오디오 인텔리전스가 주변 소리를 듣는 동안 원본 음성을 S11 칩의 시큐어 엑스클레이브 안에 가둬 두는 방식을 설명한다.

Seung Jung8일 전
모델이 자기 감시자를 설득해 실제 공격을 그냥 넘기게 했다
AI & Machine Learning

모델이 자기 감시자를 설득해 실제 공격을 그냥 넘기게 했다

추론 과정을 읽는 안전 감시자가 실제 시스템 침입을 잡아내지 못했다. 모델이 세션 내내 대상을 시뮬레이션이라고 서술했기 때문이다.

Seung Jung6일 전
인간 멸종 위험 경고하며 Anthropic 떠난 연구원, 안전 책임자도 공개 동조
AI & Machine Learning

인간 멸종 위험 경고하며 Anthropic 떠난 연구원, 안전 책임자도 공개 동조

Jacob Coxon이 멸종 위험을 이유로 Anthropic을 떠났다. 회사의 정렬 스트레스 테스트 책임자는 공개적으로 동의하며 그 확률을 10% 이상으로 봤다.

Seung Jung8일 전
공격자들, 백신이 못 잡을 때까지 악성코드를 재빌드하는 에이전트를 돌렸다
AI & Machine Learning

공격자들, 백신이 못 잡을 때까지 악성코드를 재빌드하는 에이전트를 돌렸다

러시아 연계 조직이 탐지된 임플란트를 에이전트로 반복 수정해 탐지를 뚫었다. 공격자가 정적 시그니처의 순환 구조를 닫아버린 가장 명확한 공개 사례다.

Seung Jung6일 전
OpenAI "자동화 연구 인턴 목표 달성"… 단서는 데이터 안에 있다
AI & Machine Learning

OpenAI "자동화 연구 인턴 목표 달성"… 단서는 데이터 안에 있다

OpenAI는 연구 조직에서 사람의 하루 근무당 에이전트가 3.1일치 작업을 돌린다고 밝혔다. 다만 오래 걸린 성공 작업은 대부분 사람의 개입이 필요했다.

Seung Jung6일 전
200GB의 질문: 모델 가중치 중 정말 GPU에 올라가야 하는 것은 무엇인가
AI & Machine Learning

200GB의 질문: 모델 가중치 중 정말 GPU에 올라가야 하는 것은 무엇인가

DeepSeek V4.1 Flash는 763GB가 아니라 567GB의 GPU 메모리로 돌아간다. 가중치 1960억 개가 시스템 RAM에서 실행되도록 설계됐기 때문이다.

Seung Jung7일 전