Cloudflare가 Workers AI 팀이 자체 학습한 첫 모델 두 개를 10월 1일 공개했다. 둘 다 글은 한 줄도 쓰지 않는다. Clef와 Clef-flash는 입력 상태와 타입이 정해진 질문 스키마를 받아, 허용된 답마다 보정된 확률을 돌려준다. 가중치도 Apache 2.0 라이선스로 Hugging Face에 함께 올라갔다.
핵심 정리
- 의사결정 벤치마크 10개 가운데 7개에서 Clef 계열 모델이 최고 점수를 냈다. Typesafe의 Jev와 다른 오픈 의사결정 모델을 앞섰다는 것이 Cloudflare 자체 측정 결과다.
- 벤치마크 43회 실행에서 Cloudflare는 Clef가 Jev 중간값 속도의 2.5배, Clef-flash는 13배를 기록했다고 측정했다. 두 모델 모두 엣지 네트워크 전역의 GPU에서 서비스된다.
- Clef는 동결된 Qwen3.8-27B 백본, Clef-flash는 Qwen3.5-9B를 후속 학습해 만들었다. 둘 다 Hugging Face에 Apache 2.0으로 올라갔다.
Clef에 실제로 무엇을 보내는가
요청에는 상태 — 고객 문의 메시지, URL, 사용자 제출물 — 와 질문 최대 64개가 담긴다. 질문은 세 가지 유형 중 하나다. noul은 예/아니오 질문으로 '예'일 확률이 돌아온다. choice는 개발자가 정의한 보기 중 하나를 고르고, 선택된 답과 보기별 확률, 신뢰도 값을 함께 반환한다. score는 순서가 있는 평가 기준에 상태를 매겨 확률 가중 점수와 등급별 확률을 돌려준다.
출력 형태가 고정이라 파싱할 것도 없고 추론 토큰을 기다릴 일도 없다. 에이전트가 요청 경로에 이 모델을 바로 끼워 넣어 "이 동작을 실행해야 하는가"를 수십 밀리초 안에 확인하고, 실제 작업은 Workers AI의 언어 모델에 넘기면 된다는 것이 Cloudflare의 설명이다.
Jev와 무엇이 다른가
Clef는 Typesafe의 Jev와 같은 System One API를 따른다. 기존 연동이 있다면 엔드포인트와 모델 이름만 바꿔 옮길 수 있다고 Cloudflare는 말한다. 기능 차이는 두 군데서 Clef에 유리하다. Clef는 비전 인코더를 품어 상태와 함께 이미지를 최대 4장까지 받지만 Jev는 현재 텍스트만 처리한다. 컨텍스트 창도 Jev의 32k에 비해 64k다.
Cloudflare가 내놓은 가장 날카로운 수치는 자사 위협 인텔리전스 팀에서 나왔다. Browser Run과 묶었을 때 Clef는 웹사이트 도메인을 가져와 렌더링하고 분류하는 데 2.2초를 썼다. 같은 워크플로에서 자사에서 가장 빠른 범용 모델인 gpt-oss-120b는 4.7초가 걸렸고 분류도 두 개만 돌려줬다. Typesafe 자체 워크플로 평가에서는 Clef가 네 영역 중 세 곳 — 인보이스 처리, 고객 서비스, 보안 사고 — 에서 이겼다고 Cloudflare는 전한다. 남은 한 영역은 여전히 Jev 몫이라는 뜻이다. 여기 나온 수치는 모두 벤더가 직접 측정한 것이고, 출시 포스트는 제3자 검증 대신 라이브 데모 사이트와 함께 수치를 공개했다.
지연 격차는 어디서 생기는가
Clef는 토큰을 하나씩 생성하지 않는다. 동결된 Qwen 백본에 프리필만 한 번 돌린 뒤 두 단계 어텐션 라우팅으로 유효한 스키마 선택지 전체를 병렬로 채점한다. 중간 텍스트를 내놓지 않고 내부 표현에서 답을 끌어낸다. 속도는 모델이 작아서가 아니라 이 비자기회귀 의사결정 단계에서 나온다.
학습은 백본을 동결한 채 라우팅 헤드와 rank-256 LoRA 어댑터를 함께 최적화하는 방식이었다. 유효 출력에는 레이블 스무딩 교차 엔트로피를, 확률 보정에는 Brier 손실을 썼다. Cloudflare는 'Reinforcement Learning for Calibrated Decisions'라고 이름 붙인 보조 목적 함수도 만들었다. 인접한 순서형 선택지에 부분 점수를 주고, 분포 이동을 억제하는 참조 페널티를 적용한다. 데이터셋은 내부에서 만든 합성 데이터로, 필드 순서와 프롬프트, 스키마 구조를 뒤섞어 생성했다.
그 아래 깔린 파인튜닝 제품
출시의 나머지 절반은 Clef를 고객 워크로드에 맞춰 조정하는 강화학습 서비스다. 처음에는 Cloudflare의 포워드 디플로이드 엔지니어링 팀이 직접 붙어 작업하고, 이후 셀프서비스 플랫폼으로 전환한다. 회사가 이미 출시한 조각들을 꿰어 만들었다. AI Gateway가 요청 트래픽을 데이터셋으로 모으고, Workers AI가 기본 Clef로 롤아웃을 생성하고, Containers가 채점 샌드박스 역할을 하고, 새로 만든 Trainer가 가중치를 갱신한다. 결과물은 Workers AI의 자체 모델 반입 경로로 재배포되는데, 이 경로는 Cloudflare가 Replicate를 인수하며 들여온 Cog 작업 위에 올라가 있다.
Cloudflare 자신이 첫 고객이다. 신뢰·안전 제출물 점수화, 고객 지원 분류, 크롤러가 좋은 봇인지 나쁜 봇인지 판별하는 작업을 사례로 들며 15년간 쌓인 레이블링된 네트워크 데이터가 튜닝된 분류기를 범용 모델보다 낫게 만드는 자산이라고 주장한다. 회사는 이 모든 것을 "에이전트 클라우드"라는 목표 아래 묶는다. 에이전트를 위해 웹을 다시 짜겠다는 기존 베팅의 연장선이다. 이 분야 자체는 생긴 지 겨우 한 달이다. Typesafe가 스텔스를 벗은 것이 9월이다.
FAQ 자주 묻는 질문
Clef는 오픈소스인가
가중치는 공개됐다. Cloudflare는 Clef와 Clef-flash를 Hugging Face에 Apache 2.0 라이선스로 올렸고, 상업적 이용과 로컬 배포가 허용된다. 호스팅 버전은 Workers AI에서 @cf/cloudflare/clef와 @cf/cloudflare/clef-flash로 돌아간다. 고객이 파인튜닝을 선택하지 않는 한 호스팅 요청을 읽거나 저장하거나 학습에 쓰지 않는다고 회사는 밝혔다. 리포지터리는 Hugging Face의 Cloudflare/clef와 Cloudflare/clef-flash다.
기존 Jev 연동을 Clef로 옮길 수 있는가
가능하다는 것이 Cloudflare의 설명이다. Clef가 엄격한 타입 출력을 쓰는 같은 System One API를 구현하기 때문이다. 실무에서는 엔드포인트와 모델 식별자만 바꾸면 된다. 개발자는 Workers AI 바인딩이나 REST /ai/run 경로로 접근하며, 둘 앞단에 모두 AI Gateway를 둘 수 있다.
Clef는 무엇을 기반으로 만들었는가
두 모델 모두 Alibaba의 Qwen 계열을 후속 학습해 만들었고, 학습 중 백본은 동결했다. Clef는 Qwen3.8-27B, Clef-flash는 Qwen3.5-9B다. 이 분야에서 Cloudflare가 앞서 공개한 실험은 다른 기반을 썼다. DiffusionGemma를 변형해 logprob을 결정적 확률로 노출시키는 방식으로, vLLM 프로젝트에서 Matt Mastracci가 수행한 독립 작업 위에 올린 것이었다.






