원문 소식, 쉽게 읽기
Cloudflare는 2026년 10월 10일 한국시간으로 텍스트·이미지·음성·영상을 한 번에 처리하는 의사결정 모델 Clef-omni를 출시했다. 의사결정 모델은 긴 답변을 자유롭게 만드는 일반 대규모 언어 모델과 달리, 미리 정한 선택지마다 점수를 계산해 분류나 경로 결정에 쓰는 모델이다. 예를 들어 영상과 음성이 함께 담긴 고객 문의를 긴급도와 담당 부서 같은 정해진 항목으로 나누는 방식이다. 출처
Clef-omni는 WAV·MP3 음성과 MP4·WebM 영상을 텍스트·이미지와 함께 한 번의 호출로 받을 수 있다. 음성을 먼저 글로 바꾸거나 영상의 소리와 화면을 따로 분석한 뒤 결과를 합치는 여러 단계 대신, 동기화된 영상·음성 정보를 같은 흐름에서 판정한다. 모델 가중치도 Hugging Face에 공개됐다. 출처
Cloudflare는 Qwen3-Omni-30B-A3B-Instruct의 이해 기능을 바탕으로 Clef-omni를 만들고 음성 출력 기능은 제외했다고 설명했다. 모델이 문장을 생성하지 않고 정해진 후보의 점수를 계산하도록 구성했으며, 발표 시점의 Workers AI 입력 요금은 100만 토큰당 0.15달러다. 회사가 공개한 중앙값은 텍스트 약 130밀리초, 이미지 약 150밀리초, 음성 수백 밀리초, 소리가 포함된 21초 영상 약 1.5초다. 이 수치는 Cloudflare의 호스팅 환경과 측정 결과다. 출처
기존 모델도 바뀌었다. Clef-flash의 호스팅 입력 요금은 100만 토큰당 0.09달러에서 0.038달러로 내려갔다. 대신 한 요청에서 처리할 수 있는 호스팅 문맥 길이는 6만4천 토큰에서 2만4천 토큰으로 줄었다. 공개 가중치는 바뀌지 않았고 자체 호스팅용으로 25만6천 토큰 문맥을 지원하도록 학습됐다고 Cloudflare는 밝혔다. 일반 Clef는 100만 입력 토큰당 0.24달러와 6만4천 토큰 문맥을 유지한다. 출처
Workers AI에서 제공하는 Clef의 속도도 개선됐다. Cloudflare가 제시한 세 입력 크기에서 중앙 처리 시간은 약 1.7배에서 2배 빨라졌다. 모델 가중치를 새로 바꾼 결과가 아니라 제공 인프라를 SGLang으로 옮기는 등 서버 실행 방식을 최적화한 결과다. 공개 벤치마크에서는 Clef-omni·Clef·Clef-flash가 작업별로 서로 다른 점수를 기록했으며, 한 모델이 모든 항목에서 가장 높지는 않았다. 출처
OYOPICK의 시선
이번 업데이트는 모델 선택을 ‘가장 새 모델 하나’로 단순화하기보다 입력 형태, 처리 길이, 오류 비용으로 나눠 보게 한다. 영상과 음성을 별도 전사 과정 없이 분류해야 한다면 Clef-omni가 연결 단계를 줄일 수 있다. 텍스트 중심이고 입력이 2만4천 토큰 안에 머문다면 낮아진 Clef-flash 요금이 유리할 수 있으며, 더 긴 호스팅 문맥이 필요하면 Clef를 비교해야 한다.
가격 인하와 함께 문맥 길이를 줄인 사실을 공개한 점은 비용과 기능의 교환 관계를 판단하는 데 도움이 된다. 다만 Cloudflare의 사용량에서는 2만4천 토큰을 넘는 요청이 0.24%였다는 설명이 다른 서비스의 입력 분포를 보장하지 않는다. 도입 전에는 실제 요청 길이와 영상·음성 크기, 잘못 분류했을 때의 영향을 측정해 모델별 기준을 정하는 편이 합리적이다.
멀티모달 입력을 한 모델이 함께 판단하는 방식은 AI가 더 다양한 현실 신호를 다루는 방향을 보여준다. 이 가능성이 사람의 검토를 밀어내는 자동화보다, 낮은 확신이나 큰 피해 가능성이 있는 결정을 사람에게 넘기는 체계와 함께 발전하기를 바란다. 발표에 나온 속도와 벤치마크는 공급업체 측정치이므로 실제 업무 데이터에서 정확도·지연시간·비용을 다시 확인해야 한다.