- Clef와 Clef-flash는 문장을 생성하는 대신 선택지·점수·참일 확률을 반환하는 의사결정 모델로, 고객 문의 분류나 에이전트의 다음 행동 선택에 활용
- 이미지 입력과 64K 컨텍스트를 지원하며 Jev API와 호환됨. Clef는 정확도에, Clef-flash는 빠른 응답에 초점을 맞춤
- Qwen 기반 모델이 질문의 선택지를 병렬로 평가해, 답변 문장을 토큰별로 생성하는 과정을 생략함
- Cloudflare 자체 평가에서 Clef-flash의 응답 시간 중앙값은 38.8ms로 Jev의 524.1ms보다 짧았으며, 여러 도구 선택·분류 평가에서도 높은 성능을 기록
- Apache-2.0으로 가중치를 공개해 로컬이나 Workers AI에서 실행 가능. 업무 데이터에 맞춘 RL 미세조정은 현재 전담 엔지니어가 지원하며, 향후 셀프서비스 플랫폼으로 확대할 계획
- Clef는 긴 답변을 생성하는 대신 선택지·점수·참일 확률을 반환해, 프로그램이나 에이전트가 다음 행동을 결정하도록 돕는 모델임
- 고객 지원 메시지를 보고 긴급 여부, 담당 팀, 고객 영향도를 함께 판단할 수 있음
- 프로그램은 결과에 따라 티켓을 전달하거나 대응 단계를 높이고, 필요한 경우 사람에게 판단을 넘김
- Jev System One과 같은 의사결정 모델은 새로운 분류 항목마다 재학습하지 않고, 입력과 선택지를 바꿔 여러 업무에 활용할 수 있음
- 개방형 추론과 콘텐츠 생성은 일반 LLM에 맡기고, 빠르고 구조화된 판단은 의사결정 모델에 맡기는 구성이 가능함
- Clef라는 이름은 악보의 음높이를 정하는 ‘음자리표’에서 가져왔으며, 이름에 들어간 CF는 Cloudflare를 가리킴
- Cloudflare는 Clef와 Clef-flash를 Workers AI에 제공하고, Clef와 Clef-flash의 가중치를 Apache-2.0으로 공개함
- Clef는 정확도가 중요한 판단에, Clef-flash는 응답 시간이 중요한 판단에 초점을 맞춤
- 공개 가중치로 로컬 실행과 실험도 가능함
- 이미지 입력과 64K 컨텍스트를 지원해 텍스트뿐 아니라 시각 콘텐츠도 분류할 수 있음
- 비교 대상인 Jev는 현재 텍스트 입력과 32K 컨텍스트를 지원함
- Jev API와 호환되며, 선택형·점수형·예/아니요 질문을 함께 처리함
- “한 시간 동안 모든 고객의 결제가 실패했다”는 상황에서 긴급 여부, 담당 팀, 고객 영향도를 한 요청으로 물을 수 있음
- Cloudflare는 미세조정 제품을 이용하는 경우를 제외하고 요청과 응답을 읽거나 저장하거나 학습에 사용하지 않는다고 밝힘
- 엣지 GPU에서 실행하며, Clef가 판단하고 Workers AI의 LLM이 후속 작업을 수행하는 흐름을 구성할 수 있음
- Cloudflare 위협 인텔리전스팀은 Browser Run으로 웹사이트를 불러오고 Clef로 분류하는 실험을 진행함
- 한 사이트에 대해 패션 95%, 전자상거래 85%, 피싱 1% 미만처럼 여러 범주의 확률을 반환함
- 사이트 가져오기부터 렌더링과 분류까지 2.2초가 걸렸으며, 같은 흐름에서 gpt-oss-120b는 4.7초가 걸림
- 이 수치는 모델 추론만이 아니라 웹사이트 처리 과정 전체의 소요 시간임
- Cloudflare가 공개한 평가에서 Clef 계열은 도구 선택과 고객 문의 분류 등 여러 항목에서 Jev보다 높은 점수를 기록함
| 평가 | Clef | Clef-flash | Jev |
|---|---|---|---|
| BFCL 도구 호출 정확 일치율 | 98.47 | 98.76 | 95.75 |
| API-Bank 정확도 | 91.93 | 93.11 | 88.19 |
| BANKING77 문의 분류 macro-F1 | 94.20 | — | 79.74 |
| When2Call 정확도 | 72.37 | 65.58 | 80.97 |
- 모든 과제에서 같은 모델이 앞서는 것은 아님
- When2Call과 BRIGHT에서는 Jev가, 피싱 판별 평가 PhishNChips에서는 DiffusionGemma Jev가 가장 높은 점수를 기록함
- Typesafe의 업무 흐름 평가에서는 Clef 계열이 청구서 처리, 고객 서비스, 보안 사고의 세 영역에서 Jev를 앞섰으며, 에이전트 실행 추적 관측성에서는 Jev가 앞섬
- 43개 벤치마크의 응답 시간에서도 Clef 계열은 Jev보다 짧은 지연 시간을 기록함
| 모델 | 중앙값 | p95 |
|---|---|---|
| Clef | 209.3ms | 238.6ms |
| Clef-flash | 38.8ms | 122.4ms |
| Jev | 524.1ms | 536.0ms |
- Laya는 중앙값이 5.8ms로 더 빨랐으며, Clef-flash는 비교 모델 가운데 p95 지연 시간이 가장 낮았음
- 전체 품질·속도 비교는 공개 벤치마크에서 확인할 수 있음
- Clef는 Qwen을 의사결정 용도로 후속 학습한 모델임
- Clef는 Qwen3.8-27B, Clef-flash는 Qwen3.5-9B를 기반으로 함
- 입력을 읽는 프리필 이후, 모델의 내부 표현에서 유효한 선택지를 병렬로 평가함
- 중간 설명이나 답변 문장을 토큰별로 생성하지 않는 비자기회귀 방식임
- 2단계 어텐션 구조로 각 선택지에 필요한 근거와 질문 간 관계를 반영함
- 먼저 선택지마다 입력의 관련 부분을 읽고, 이후 다른 질문과 원래 입력을 함께 참고해 점수를 계산함
- 기반 모델은 고정하고 라우팅 헤드와 저랭크 어댑터를 학습함
- 내부 합성 데이터에서 질문 순서, 프롬프트, 선택지 구성을 다양하게 바꿔 학습함
- 정답 정확도뿐 아니라 반환한 확률이 실제 정답률에 맞도록 보정하는 데도 초점을 맞춤
- RLCD(Reinforcement Learning for Calibrated Decisions) 를 보조 학습 목표로 사용함
- 순서가 있는 선택지에서는 정답에 가까운 답에도 부분 점수를 주고, 여러 필드를 모두 정확하게 반환한 결과에 보상함
- Cloudflare 내부에서는 Trust & Safety 신고 평가, 지원 요청 분류, 정상·악성 봇 판별에 특화한 Clef를 개발하고 있음
- 특정 업무의 데이터로 미세조정하면 일부 범용 성능을 포기하는 대신 해당 업무의 정확도와 속도를 높일 수 있음
- Cloudflare는 15년 이상 축적한 네트워크 데이터와 여러 해의 판단 기록을 활용하고 있음
- 내부 팀과 진행한 후속 학습 경험을 외부 고객용 미세조정 서비스로 확장하려 함
- 현재는 전담 엔지니어팀(FDE) 이 고객과 직접 협력해 업무에 맞는 Clef를 미세조정하는 방식으로 시작함
- 향후에는 고객이 Cloudflare 안에서 데이터 수집 → 학습 → 평가 → 재배포를 수행하는 셀프서비스 플랫폼을 구축할 계획임
- AI Gateway로 업무에 사용한 요청·응답 데이터를 수집함
- Workers AI에서 모델을 실행해 학습용 실행 기록을 생성함
- Containers를 에이전트 행동을 평가하고 재현하는 샌드박스로 사용함
- 새로운 Trainer로 모델을 학습하고, 자체 모델 배포 기능을 통해 Workers AI에 다시 배포함
- 셀프서비스 플랫폼과 일부 배포 기능은 아직 개발 중이며, 현재 제공되는 모델과 구분해야 함
- Clef는 지금 Workers AI나 공개 가중치로 사용할 수 있으며, 업무별 미세조정에 관심 있는 기존 제품 고객은 설계 파트너 참여를 신청할 수 있음