Cloudflare가 2026년 10월 1일 Workers AI에 의사결정 모델 Clef와 Clef-flash를 공개했다. 두 모델의 가중치는 Hugging Face에서 Apache 2.0 라이선스로 내려받을 수 있다. 일반 대규모 언어 모델(LLM)이 문장이나 도구 호출을 자유롭게 생성한다면, Clef는 미리 정한 형식의 선택지와 각각의 확률을 반환하도록 설계됐다. 출처
생성보다 분류·경로 결정이 필요할 때
고객 문의를 넣고 긴급 여부, 담당 팀, 심각도를 질문하면 코드가 바로 처리할 수 있는 형식으로 답을 받는 방식이다. 문의를 특정 부서로 보내거나, 기준에 따라 상향 처리하거나, 확신이 낮을 때 사람에게 넘기는 작업에 맞는다. 새로운 설명문을 만드는 작업보다 정해진 선택지 안에서 반복적으로 분류해야 할 때 LLM과 구분해 검토할 수 있다. 출처
텍스트뿐 아니라 이미지도 입력할 수 있고 문맥 길이는 6만4천 토큰이다. Jev API와 호환돼 기존 Jev 호출을 바꾸기 쉽다고 Cloudflare는 설명한다. 정확도와 지연시간 수치는 Cloudflare가 실시한 벤치마크 결과이므로, 실제 도입 판단에는 자신의 데이터와 오류 비용을 기준으로 다시 시험할 필요가 있다. 출처
Clef와 Clef-flash, 현재와 예정 기능
Cloudflare는 Clef를 더 높은 정밀도가 필요한 작업, Clef-flash를 지연시간이 중요한 판단 작업에 제시한다. 두 모델은 Workers AI에서 바로 호출할 수 있고, 로컬 환경에서는 공개 가중치를 시험할 수 있다. 어느 쪽을 고를지는 응답 속도뿐 아니라 잘못 분류했을 때의 영향과 사람이 재검토할 기준까지 함께 정하는 것이 판단 기준이다. 출처
Cloudflare는 미세조정을 사용하지 않는 호스팅 요청과 응답을 읽거나 저장하거나 학습에 사용하지 않는다고 밝혔다. 특정 업무에 맞춘 미세조정은 현재 전담 엔지니어가 함께하는 서비스로 제공하며, 고객이 직접 학습하고 다시 배포하는 셀프서비스 플랫폼은 이후 제공할 계획이다. 발표에는 셀프서비스 출시일이나 가격이 제시되지 않았다. 출처