【Clef】Cloudflare初の判断モデルとは?Jevとの違い・性能・料金・使い方を徹底解説

- Clefは、Cloudflareが2026年10月に公開した判断専用のオープンソースモデル
- 文章を生成せず選択肢ごとの確率を一度に返すため、Clef-flashの応答時間は中央値38.8ミリ秒
- Jev互換のAPIに加え、画像入力と64Kトークンに対応し、Apache 2.0で商用利用も可能
2026年10月2日、Cloudflareが自社で学習させた判断モデル「Clef」と軽量版の「Clef-flash」を公開しました!Clefは文章を書く代わりに、「この問い合わせは緊急か」「どのチームが担当すべきか」といった問いへの答えを、選択肢ごとの確率として一瞬で返すAIモデルです。

とはいえ、「LLMと何が違うの?」「Jevから乗り換える価値はある?」と気になっている方も多いのではないでしょうか。
この記事では、Clefの概要や仕組み・Jevとの違い・ベンチマーク性能・料金・ライセンス・具体的な使い方まで詳しく解説します。最後まで読めば、AIエージェントの判断処理を速く安く置き換えるヒントがきっと見つかるはず。
\生成AIを活用して業務プロセスを自動化/
Clefとは?

Clefは、Cloudflareが2026年10月2日に公開した判断(ディシジョン)専用のAIモデルファミリーです。
ClefはCloudflareのWorkers AIチームが初めて自社で学習させたモデルで、大型の「Clef」(270億パラメータ)と高速な「Clef-flash」(90億パラメータ)の2種類が用意されています。
LLMのように文章を1文字ずつ組み立てるのではなく、「状態(state)」と「型付きの質問(questions)」を受け取り、許可された選択肢すべてに確率を割り振って返すのが基本の動きです。返ってくる答えは、はい・いいえの確率を返す「noul」、選択肢から1つを選ぶ「choice」、順序付きの段階で評価する「score」の3つの型のいずれかとなります。
出力がスキーマの外にはみ出さないため、後ろに続くプログラムは結果をそのまま分岐処理に使えるのが強み。自由文をパースして値を取り出す手間が要らないのは、エージェント開発ではかなり大きなメリットでしょう。
Jevとの違い
Clefは、TypeSafe AIが2026年9月に公開した判断モデル「Jev」とAPIの互換性を持つモデルです。そのうえで性能や提供形態にはいくつか明確な違いがあるため、ここで整理しておきます。

Jevは、元OpenAIの研究者ディオゴ・アルメイダ氏が立ち上げたTypeSafe AIが「System Oneモデル」として打ち出した判断モデルで、早期アクセス形式のAPIとして提供されています。ClefはこのJevのAPIと完全な互換性を持ち、接続先とモデル名を差し替えるだけで乗り換えられる設計です。
大きな違いは3つあります。1つ目は画像入力への対応で、Cloudflareによると2026年10月時点のJevはテキスト分類のみ。Clefはビジョンエンコーダーを備えており、画像の中身を見て判断できます。
2つ目はコンテキストウィンドウの広さです。Jevの32Kに対してClefは64Kと、2倍の情報を一度に渡せるようになりました。3つ目は重みの公開で、ClefはApache 2.0のオープンウェイトとして配布されているため、社外にデータを出せない環境でもセルフホストできるのが強みとなります。
一方、料金面ではJevが入力100万トークンあたり0.042ドルなのに対し、Clef-flashは0.09ドル、Clefは0.24ドルとやや割高な設定。速度と精度を取るか、単価を取るかで選び分けるのが現実的でしょう。
| 項目 | Clef | Clef-flash | Jev |
|---|---|---|---|
| 開発元 | Cloudflare | Cloudflare | TypeSafe AI |
| 公開日 | 2026年10月1日 | 2026年10月1日 | 2026年9月15日 |
| 入力 | テキスト・JSON・画像 | テキスト・JSON・画像 | テキスト |
| コンテキスト長 | 64K | 64K | 32K |
| 応答時間の中央値(Cloudflare計測) | 209.3ミリ秒 | 38.8ミリ秒 | 524.1ミリ秒 |
| 入力料金(100万トークンあたり) | 0.24ドル | 0.09ドル | 0.042ドル |
| 出力料金 | 料金表記なし(入力のみ) | 料金表記なし(入力のみ) | 無料 |
| 重みの公開 | あり(Apache 2.0) | あり(Apache 2.0) | なし(API提供) |
Clefの仕組み

Clefは、Qwenをベースにした「読み込み部分」と、独自の「採点ヘッド」を組み合わせた構造です。文章を生成しないのに賢く判断できる理由を、順を追って見ていきましょう。
プレフィル1回で選択肢をまとめて採点
ClefはQwen3.8-27B(Clef-flashはQwen3.5-9B)を土台にしており、この本体の重みは固定したまま使われています。
推論時には、入力された状態と質問をQwenが一度だけ読み込む「プレフィル」のみを実行し、その後は有効な選択肢を並列に採点するだけ。トークンを1つずつ生成する自己回帰の工程がないため、通常のLLMより大幅に速く判断を下せるのです。
途中で文章を書かせてから構造化する方式とも違い、Qwen内部の表現から直接スキーマの選択肢を導き出している点がポイントになります。
共同スキーマヘッドが質問ごとに根拠を集める
採点を担うのは、本体の最終隠れ状態を読み取る小さなTransformerのヘッドです。
Hugging Faceのモデルカードでは「Joint schema head」と呼ばれており、状態の中から各質問に関係する根拠を拾い出して、すべての質問の選択肢を同時にスコアリングします。
Cloudflareのブログによると、内部は2段階のアテンションルーティングという構成。まず各選択肢がプロンプトから関連する文脈を抜き出し、続いて質問同士や元の入力と相互に参照し合ってから採点される流れです。
出力は選択肢ごとに1つのロジットで、質問単位でソフトマックスをかけると確率に変わります。
キャリブレーションを重視した学習方法
学習では、Qwen本体を凍結したまま、ルーティングヘッドとランク256のLoRAアダプターを同時に最適化しています。
損失関数は、ラベル平滑化付きの交差エントロピーに、確率の当てはまりを整えるBrier損失を組み合わせたもの。学習データには、フィールドの順序やプロンプト、スキーマ構造を入れ替えた社内の合成データセットが使われました。
さらに2次的な最適化目標として「RLCD(Reinforcement Learning for Calibrated Decisions)」も導入しています。隣り合う順序の選択肢には部分点を与え、完全に正確な回答には報酬を与えつつ、分布のずれを防ぐ参照ペナルティを課す仕組みです。
Clefの特徴
Clefの特徴は、判断系のベンチマークで高いスコアを出しながら、レイテンシも短く抑えている点にあります。ここからはCloudflareが公開した評価結果を中心に、具体的な数字を見ていきましょう。
判断系のベンチマークでJevを上回るスコア
Cloudflareは、Jev Decision Indexで定義された評価のうち、判断に重要な10項目を抜き出して比較しています。
結果は以下のとおりで、10項目中7項目でClefかClef-flashが最高スコアを記録しました。特に家電操作のシミュレーションでは、Clef-flashが97.73とJevの52.27を大きく引き離しています。


| ベンチマーク | Clef | Clef-flash | Jev |
|---|---|---|---|
| BFCL(case exact) | 98.47 | 98.76 | 95.75 |
| ToolRet(nDCG@10) | 69.19 | 66.43 | 65.28 |
| API-Bank(accuracy) | 91.93 | 93.11 | 88.19 |
| Home appliances(case exact) | 82.95 | 97.73 | 52.27 |
| When2Call(accuracy) | 72.37 | 65.58 | 80.97 |
| BANKING77(macro-F1) | 94.20 | 90.93 | 79.74 |
| CLINC150+OOS(macro-F1) | 97.43 | 66.77 | 89.27 |
| BRIGHT(nDCG@10) | 45.91 | 39.26 | 47.52 |
| Amazon ESCI(macro-F1) | 57.48 | 57.39 | 55.21 |
| PhishNChips(accuracy) | 79.60 | 75.05 | 62.55 |
PhishNChipsではDiffusionGemma Jevの85.35が最高値となっていますが、Clefも79.60とJevを17ポイント以上上回りました。
業務ワークフロー評価でも4分野中3分野でJev超え
TypeSafe AI自身が公開している業務ワークフロー評価でも、Clefは健闘しています。
請求書処理・カスタマーサービス・セキュリティインシデントの3分野でClefまたはClef-flashがJevを上回り、Jevが勝ったのはエージェントのトレース監視のみでした。
| ワークフロー | Clef | Clef-flash | Jev |
|---|---|---|---|
| 請求書処理 | 64.7 | 57.1 | 61.8 |
| カスタマーサービス | 76.3 | 77.0 | 76.0 |
| セキュリティインシデント | 62.9 | 61.7 | 61.7 |
| エージェントのトレース監視 | 68.5 | 69.8 | 71.6 |
Cloudflareは、速度の割にClef-flashの成績がとても良い点を強調しています。軽量モデルでも実務レベルの判断精度が出ているのは、心強いポイントですね。
43種類の評価でレイテンシを比較
Cloudflareが実施した43種類の評価では、Clefシリーズは他の判断モデルよりも短いレイテンシを記録しています。
唯一の例外は5.8ミリ秒のLayaですが、Layaは前述の品質評価で大きくスコアを落としているため、速さと精度のバランスではClef-flashが頭ひとつ抜けている印象です。
| 指標 | Clef | Clef-flash | Jev | Laya |
|---|---|---|---|---|
| レイテンシ中央値 | 209.3ミリ秒 | 38.8ミリ秒 | 524.1ミリ秒 | 5.8ミリ秒 |
| p95レイテンシ | 238.6ミリ秒 | 122.4ミリ秒 | 536.0ミリ秒 | 222.5ミリ秒 |
加えて、Workers AIはCloudflareのエッジにあるGPUで動くため、ネットワーク遅延も小さく抑えられます。Cloudflareの脅威インテリジェンスチームでの検証では、Webサイトの取得・描画・分類までをClefが2.2秒でこなしたのに対し、汎用LLMのgpt-oss-120bは4.7秒かかり、返した分類も2つだけだったそうです。
自社データで強化学習ファインチューニングできる
Clefの発表とあわせて、CloudflareはClefを顧客の用途に合わせて鍛え直す強化学習サービスもスタートさせました。
まずはFDE(Forward Deployed Engineer)チームが伴走する形で提供し、そこで得た知見をもとに、データ収集から学習、再デプロイまでをCloudflare上で完結できるセルフサービス版を作る計画です。
構成としては、AI Gatewayでリクエストを蓄積してデータセット化し、Workers AIで基盤モデルの試行(ロールアウト)を生成、Cloudflare Containersを採点用のサンドボックスにする流れ。新たに用意されるTrainerで重みを更新し、Workers AIの独自モデル持ち込み機能で再デプロイする仕組みとなっています。
Clefの安全性・制約
Clefは企業利用を想定したデータの取り扱い方針を打ち出している一方で、入力サイズや得意分野にはいくつか制約があります。

リクエストとレスポンスは学習に使われない
Cloudflareは、Workers AI上のClefについて、リクエストやレスポンスを読んだり保存したり学習に使ったりしないと明言しています。
ただし、前述のファインチューニングサービスを利用する場合は、その目的に限ってデータが扱われる点は押さえておきましょう。さらに厳密な管理が必要なら、Apache 2.0で公開された重みを自社環境で動かす選択肢もあります。
出力は定義した選択肢の範囲に限られるため、型の崩れた回答が返ってくる心配はありません。その反面、リストにない答えはそもそも検討されないので、選択肢の設計がそのまま判断の質を左右します。
入力サイズと質問数には上限がある
Workers AIのAPIでは、1回のリクエストで送れる質問は1〜64個までです。
choice型の選択肢は2〜255個、score型の段階は2〜10段階と決まっています。画像はPNG・JPEG・WebPを最大4枚まで埋め込めますが、1枚あたり4MiBかつ1,600万画素以下、デコード後の合計8MiB、リクエスト全体で13MiBという上限付き。画像のURL指定は受け付けていないため、Base64で埋め込む必要があります。
また、長いテキストの状態はモデルのトークン上限に収まるよう切り詰められる仕様です。動画の入力はHugging Faceの重みをローカルで動かす場合に使えるもので、2026年10月時点のWorkers AIのスキーマには含まれていません。
推論の深さが問われるタスクは苦手
Hugging Faceのモデルカードに掲載された全ベンチマークを見ると、深い推論を要するタスクではJevに大きく差をつけられていることが分かります。
例えば、GPQA DiamondではClefの48.0に対しJevは78.3、BBHでは73.7対92.9、MMLU-Proでも65.9対82.7という結果でした。分類やルーティングには強い一方、難問を考え抜くような使い方には向かないと考えておくのが無難です。
また、掲載されているスコアはいずれもCloudflareの社内実行によるもの。Cloudflare自身も「まだ初期段階」と述べているので、本番投入の前には自社データでの検証をおすすめします。
Clefの料金
Clefは、Workers AIで使うなら入力トークン単位の従量課金、重みをダウンロードして動かすなら無料という料金体系です。
Workers AIでの料金は、Clefが入力100万トークンあたり0.24ドル、Clef-flashが0.09ドルとなっています。2026年10月時点の公式料金表には出力トークンの料金が記載されておらず、課金対象は入力トークンのみです。
| 利用方法 | 料金 | 備考 |
|---|---|---|
| Clef(Workers AI) | 入力100万トークンあたり0.24ドル | 21,818ニューロン相当、出力の料金表記なし |
| Clef-flash(Workers AI) | 入力100万トークンあたり0.09ドル | 8,182ニューロン相当、出力の料金表記なし |
| Workers AIの無料枠 | 1日10,000ニューロンまで無料 | Workers Free・Workers Paidの両方が対象、毎日0時(UTC)にリセット |
| 無料枠を超えた分 | 1,000ニューロンあたり0.011ドル | Workers Paidプランへの加入が必要 |
| セルフホスト(Hugging Face・Ollama) | 無料 | GPUなどの実行環境は自前で用意 |
| 強化学習ファインチューニング | 要問い合わせ | FDEチームによる伴走支援から提供開始 |
Clefのライセンス
ClefとClef-flashは、どちらもApache 2.0ライセンスで公開されています。ベースモデルであるQwenのライセンスに沿った形での配布です。
| 利用用途 | 可否 | 備考 |
|---|---|---|
| 商用利用 | ⭕️ | 社内システムや自社サービスへの組み込みも可能 |
| 改変 | ⭕️ | 改変したファイルには変更した旨の記載が必要 |
| 配布 | ⭕️ | ライセンス文の同梱と著作権表示の保持が必要 |
| 特許使用 | ⭕️ | |
| 私的使用 | ⭕️ |
Clefの使い方
Clefは、Workers AIのAPIから呼び出す方法と、公開された重みを手元で動かす方法の2系統で使えます。今回は代表的な6つの使い方を、コマンドやコード付きで紹介していきます。
Workers AIのREST API(curl)で使う
いちばん手軽なのは、Workers AIのREST APIをcurlで叩く方法です。
APIキー取得
まずはCloudflareのダッシュボードにログインし、Workers AIの画面からREST APIの利用を選んで、アカウントIDの確認とAPIトークンの作成を済ませます。

取得した値は、以下のように環境変数へ設定します。
export CLOUDFLARE_ACCOUNT_ID="あなたのアカウントID"
export CLOUDFLARE_AUTH_TOKEN="作成したAPIトークン"モデル呼び出し
続いて、以下のコマンドでClefを呼び出してみましょう。公式ドキュメントのサンプルをもとに、問い合わせ文と質問を日本語にしてみました。
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
-X POST \
-H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
-d '{
"model": "clef",
"state": "1時間前から、すべてのお客様の決済処理が失敗しています。",
"questions": {
"urgent": { "type": "noul", "instructions": "この問い合わせは緊急ですか?" },
"team": {
"type": "choice",
"instructions": "どのチームが対応すべきですか?",
"criteria": {
"billing": "支払い・請求書・返金",
"technical": "障害・エラー・設定",
"sales": "プランやアップグレード"
}
},
"severity": {
"type": "score",
"instructions": "顧客への影響はどの程度深刻ですか?",
"criteria": ["影響なし", "軽微", "重大", "致命的"]
}
}
}'
レスポンスのanswersには、質問IDごとの回答が入っています。noulは「はい」の確率、choiceは選ばれた選択肢と各選択肢の確率・確信度、scoreは確率で重み付けした期待スコアが返ってくる仕様です。Clef-flashを使う場合は、URLの@cf/cloudflare/clefと"model"の値を両方ともclef-flashに書き換えてください。
Cloudflare WorkersのAIバインディングで使う
Cloudflare Workersのアプリに組み込むなら、AIバインディング経由で呼び出すのが便利です。
まずはWorkersのプロジェクトを作成します。
npm create cloudflare@latest -- clef-worker
cd clef-workerwrangler.jsoncにAIバインディングを追加しましょう。
{
"ai": {
"binding": "AI"
}
}src/index.tsを以下のように書き換えます。公式ドキュメントのコードをベースにしたものです。
export interface Env {
AI: Ai;
}
export default {
async fetch(request, env): Promise<Response> {
const response = await env.AI.run("@cf/cloudflare/clef-flash", {
model: "clef-flash",
state: "1時間前から、すべてのお客様の決済処理が失敗しています。",
questions: {
urgent: { type: "noul", instructions: "この問い合わせは緊急ですか?" },
team: {
type: "choice",
instructions: "どのチームが対応すべきですか?",
criteria: {
billing: "支払い・請求書・返金",
technical: "障害・エラー・設定",
sales: "プランやアップグレード",
},
},
},
});
return Response.json(response);
},
} satisfies ExportedHandler<Env>;最後にデプロイすれば、発行されたURLにアクセスするだけで判定結果がJSONで返ってきます。
npx wrangler deployエッジ上のWorkerから同じくエッジのGPUで動くClefを呼ぶ構成のため、ネットワークの往復を最小限に抑えられるのがこの方法の魅力です。
Pythonから画像付きで判定する
Clefならではの使い方が、画像を添えた判定です。Workers AIではimagesフィールドに、Base64のデータURLを最大4枚まで渡せます。
以下は、領収書の画像を読み込んで「合計金額が読み取れるか」と「経費の種類」を同時に判定させるコード例。経費精算の一次チェックをイメージしてみました。
import base64
import os
import requests
ACCOUNT_ID = os.environ["CLOUDFLARE_ACCOUNT_ID"]
AUTH_TOKEN = os.environ["CLOUDFLARE_AUTH_TOKEN"]
with open("receipt.jpg", "rb") as f:
image_b64 = base64.b64encode(f.read()).decode()
response = requests.post(
f"https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/cloudflare/clef",
headers={"Authorization": f"Bearer {AUTH_TOKEN}"},
json={
"model": "clef",
"state": "添付の領収書を確認してください。",
"images": [f"data:image/jpeg;base64,{image_b64}"],
"questions": {
"legible": {"type": "noul", "instructions": "領収書の合計金額は読み取れますか?"},
"category": {
"type": "choice",
"instructions": "経費の種類はどれですか?",
"criteria": {"travel": "交通費", "meal": "飲食費", "supplies": "消耗品費"},
},
},
},
)
print(response.json())画像のURLは指定できないため、ローカルのファイルを読み込んでエンコードする点に気をつけてください。REST API経由の場合、モデルの回答はresultの中に格納されて返ってきます。
Hugging Faceの重みをダウンロードしてローカルで動かす
自社のGPUサーバーで動かしたい場合は、Hugging Faceから重みを取得します。
モデルカードによると、動作確認はtorch 2.11とtransformers 5.10.2を使い、H200を1枚積んだ環境で行われたとのこと。重みはBF16で配布されているため、単純計算でもClefは約54GB、Clef-flashは約18GBのメモリを重みだけで使う点は覚悟しておきましょう。
必要なライブラリをインストールします。
pip install -U torch transformers huggingface_hub pillowあとは、モデルカードに掲載されているコードで推論を実行するだけ。systemone関数を使えば、Jev形式のリクエストボディをそのまま渡せます。
import sys
from huggingface_hub import snapshot_download
path = snapshot_download("Cloudflare/clef-flash")
sys.path.insert(0, path)
from joint_schema_model import load_release_model, systemone
model, processor = load_release_model(path, device="cuda")
response = systemone(model, processor, {
"model": "clef-flash",
"state": "決済画面でエラーが出て、注文できない状態です。",
"questions": {
"department": {
"type": "choice",
"instructions": "どの部署が対応すべきですか?",
"criteria": {"billing": "支払いや請求書", "technical": "不具合や障害"},
},
"urgency": {"type": "score", "criteria": ["急ぎではない", "今週中", "今日中"]},
"outage": {"type": "noul", "instructions": "サービスが停止していますか?"},
},
})
print(response["answers"])ローカル版では、imagesに加えて動画のフレーム配列を渡すことも可能です。入力の長さはencode_recordのmax_length(初期値16,384トークン)で制御できます。
Ollamaで手軽にローカル実行する
もっと気軽にローカルで試したいなら、Ollamaを使う方法がおすすめです。
Ollamaの公式Xアカウントによると、2026年10月時点でClefとClef-flashの両方がOllamaに対応しました。インストール済みのOllamaで、以下のコマンドを実行するだけでモデルを取得できます。
ollama pull clef軽量版を使う場合は、こちらのコマンドです。
ollama pull clef-flash27BのClefはそれなりのマシンスペックを求められるので、まずはClef-flashから試すのが無難でしょう。具体的な呼び出し方は、Ollamaのモデルページで確認するのが確実です。
Jevのコードから乗り換える
すでにJevで判断処理を組んでいる方は、ほとんどコードを書き換えずにClefへ移行できます。
ClefはJevのSystemOne API(POST /v1/systemone)と同じリクエスト・レスポンスの形式を採用しており、変更が必要なのは主に接続先のURL・認証ヘッダー・modelの値の3点です。
# 変更前(Jev):TypeSafe AIのSystemOne APIへ送信
# 変更後(Clef):以下のエンドポイントへ同じボディを送信
https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/cloudflare/clef-flash
# model の値は "clef" または "clef-flash" を指定ただし、REST APIのレスポンスはresultで包まれて返ってくるため、受け取り側の処理だけは調整しなければなりません。画像を渡すimagesフィールドはClef独自の拡張であるため、Jevとの併用時には注意しておきましょう。
【業界別】Clefの活用シーン
Clefは、決まった選択肢の中から素早く答えを選ぶ処理が多い業界ほど効果を発揮します。ここでは、とりわけ相性が良さそうな業界ごとに、具体的な使い方を見ていきましょう。
カスタマーサポート・SaaS業界
問い合わせの多いSaaS企業では、チケットの一次振り分けにClefがぴったりです。
1回のリクエストで「緊急かどうか」「担当チーム」「深刻度」をまとめて判定でき、確率が低いものだけを人の確認に回すといった運用も組みやすくなります。TypeSafe AIのワークフロー評価では、カスタマーサービス分野でClef-flashが77.0とJevの76.0を上回っていました。
SLAの短い窓口でも、数十ミリ秒の判定なら待ち時間の心配はほとんどないでしょう。画像付きのエラー報告をそのまま分類できる点も、サポート現場ではうれしいポイントです。
生成AIを搭載したSaaSについて、詳しく知りたい方は以下の記事も参考にしてみてください。

金融・保険業界
金融分野では、顧客の問い合わせ意図の分類や、請求書・領収書の処理に活用できます。
銀行の問い合わせ意図を77種類に分けるBANKING77では、ClefがJevの79.74を大きく上回る94.20を記録しました。請求書処理のワークフロー評価でもClefが64.7と最も高いスコアだったことから、経理部門の定型チェックにはとりわけ向いていると考えられます。
重みを自社環境に置けるので、顧客データを社外に出しにくい金融機関でも検討しやすいはず。不正の疑いがある取引だけを抽出して担当者に回すといった、一次スクリーニングにも使えるでしょう。
金融業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

EC・小売業界
ECサイトでは、検索クエリと商品の関連度判定や、出品画像のチェックに活用できます。
Amazonの商品検索データを使ったAmazon ESCIで、ClefはJevを上回る57.48を記録しました。画像入力にも対応しているので、商品画像がカテゴリに合っているか、禁止商材が写り込んでいないかといった審査を自動化することも可能です。
大量の商品データを相手にする業界だからこそ、入力トークン単価の安いClef-flashとの組み合わせが活きてきます。レビュー文を読んで返品理由を分類するといった使い方も考えられますね。
小売業における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

【課題別】Clefが解決できること
Clefは、LLMに判断を任せたときに起こりがちな「遅い」「高い」「出力が不安定」といった悩みをまとめて解消してくれます。課題ごとに、Clefで何が変わるのかを見ていきましょう。
問い合わせチケットの振り分けを自動化できる
問い合わせの振り分けを人手で行っていると、担当者の負担が大きく、対応の遅れにもつながります。
Clefなら、問い合わせ文を渡すだけで担当チーム・緊急度・深刻度を一度に判定でき、確率のしきい値を決めて自動処理と人の確認を切り分けることも簡単です。Cloudflareも、人が常にループに入っていなくてもエージェントが判断を下し、必要なときだけ人に委ねられるようになると説明しています。
結果として、担当者は本当に判断が難しい案件にだけ集中できるようになるでしょう。
LLMの出力パースに悩まされなくなる
LLMに分類をさせると、指定した形式から外れた回答が返ってきて、パース処理でエラーになるケースが少なくありません。
Clefは自由文を一切生成せず、定義した選択肢の中から確率付きで答えるため、型の崩れた出力がそもそも起こらない仕組みです。JSONの修復処理やリトライのロジックを書く手間が省け、コードもシンプルに保てます。
エージェントの処理が何層にも連なるシステムほど、この安定性のありがたみを実感できるはずです。
エージェントの判断を数十ミリ秒で下せる
LLMで分岐判断をすると、1回の判断に数秒かかることも珍しくなく、エージェント全体の処理が遅くなりがちです。
Clef-flashの応答時間は中央値38.8ミリ秒のため、エージェントのホットパスに判断処理を置いても待ち時間がほぼ気になりません。Cloudflareも、判断はClefに任せて、実際のアクションはWorkers AI上のLLMに担わせる構成を提案しています。
ツール選択やルーティングのように頻繁に発生する判断ほど、この速さが全体の体感速度を大きく押し上げてくれるでしょう。
画像を含む審査・チェック業務を自動化できる
領収書や商品画像、スクリーンショットの確認といった業務は、テキストだけの判断モデルでは自動化できませんでした。
Clefはビジョンエンコーダーを備えているため、画像とテキストを組み合わせて判定できます。「領収書の金額は読み取れるか」「この画面はフィッシングサイトに見えるか」といった問いに、画像を見たうえで確率付きの答えを返してくれるのです。
目視チェックに追われていた業務を、判断の難しいものだけ人に回す形へと変えられるでしょう。
Clefを使ってみた
ここからは、実際にClefとClef-flashをWorkers AI上で動かして、その実力を確かめていきます。日本語での判定精度と画像判定の2つの観点で検証してみましょう。
検証には、Workers AIを呼び出す共通の処理を1つのモジュールにまとめて使います。
# clef_client.py
import os
import time
import requests
ACCOUNT_ID = os.environ["CLOUDFLARE_ACCOUNT_ID"]
AUTH_TOKEN = os.environ["CLOUDFLARE_AUTH_TOKEN"]
def run_clef(model: str, state, questions: dict, images=None) -> tuple[dict, float]:
url = f"https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/cloudflare/{model}"
body = {"model": model, "state": state, "questions": questions}
if images:
body["images"] = images
start = time.perf_counter()
res = requests.post(url, headers={"Authorization": f"Bearer {AUTH_TOKEN}"}, json=body)
elapsed_ms = (time.perf_counter() - start) * 1000
return res.json()["result"], elapsed_ms
検証1:日本語の問い合わせ10件を一括でトリアージ
1つ目は、日本語の問い合わせ文をどこまで正しく振り分けられるかの検証です。
決済障害・請求書の再発行依頼・料金プランの相談・ログインできないといった、架空の問い合わせを10件用意しました。それぞれに正解ラベルを付けたうえで、ClefとClef-flashに「緊急かどうか」「担当チーム」「深刻度」の3問を同時に投げ、正解率と1件あたりの応答時間を比較します。
コードはこちら
# verify_triage.py
from clef_client import run_clef
questions = {
"urgent": {"type": "noul", "instructions": "この問い合わせは緊急ですか?"},
"team": {
"type": "choice",
"instructions": "どのチームが対応すべきですか?",
"criteria": {
"billing": "支払い・請求書・返金",
"technical": "障害・エラー・ログイン・設定",
"sales": "料金プランの相談やアップグレード",
},
},
"severity": {
"type": "score",
"instructions": "顧客への影響はどの程度深刻ですか?",
"criteria": ["影響なし", "軽微", "重大", "致命的"],
},
}
tickets = [
("1時間前から全ユーザーが決済できません。売上が止まっています。", "technical"),
("先月分の請求書を再発行していただけますか。", "billing"),
("年間プランに切り替えると、いくら安くなりますか?", "sales"),
# ……残り7件も同様に用意
]
for model in ["clef", "clef-flash"]:
for text, label in tickets:
result, ms = run_clef(model, text, questions)
print(model, label, result["answers"]["team"]["choice"],
f"{ms:.0f}ms", result["usage"]["input_tokens"], "tokens")出力結果はこちら

| 問い合わせ | 正解 | Clefの判定 | Clef-flashの判定 |
|---|---|---|---|
| 1時間前から全ユーザーが決済できません。売上が止まっています。 | technical | billing(不正解) | technical(正解) |
| 先月分の請求書を再発行していただけますか。 | billing | billing(正解) | billing(正解) |
| 年間プランに切り替えると、いくら安くなりますか? | sales | sales(正解) | sales(正解) |
| モデル | 正解数 | 応答時間の中央値 | 1件あたりの入力トークン |
|---|---|---|---|
| Clef | 3件中2件 | 1,687ミリ秒 | 353〜357トークン |
| Clef-flash | 3件中3件 | 856ミリ秒 | 353〜357トークン |
意外なことに、今回の検証では3件すべてを正しく振り分けたのは軽量版のClef-flashのほうでした。
Clefは決済障害の問い合わせを、支払い・請求書・返金を扱うbillingチームに回しています。「決済」という言葉が、支払い系の選択肢の説明に引っ張られた可能性がありそうです。
検証2:レシート1枚から経費精算の一次チェックができるか
2つ目は、Clefの目玉機能である画像入力の検証です。
用意したのは、ChatGPTで生成した架空のカフェのレシート画像1枚だけです。正解が分かっている画像のため、判定の当たり外れをはっきり確かめられるのがポイントです。
経費精算の一次チェックを想定し、「合計金額は読み取れるか」「経費の種類」「インボイスの登録番号が記載されているか」「画像の状態」の4問を同時に投げて、ClefとClef-flashの判定を比べます。
コードと入力画像はこちら
# verify_receipt.py
import base64
import io
from PIL import Image
from clef_client import run_clef
def to_data_url(path: str, max_side: int = 1600) -> str:
img = Image.open(path).convert("RGB")
img.thumbnail((max_side, max_side))
buf = io.BytesIO()
img.save(buf, format="JPEG", quality=90)
return "data:image/jpeg;base64," + base64.b64encode(buf.getvalue()).decode()
questions_img = {
"legible": {"type": "noul", "instructions": "レシートの合計金額ははっきり読み取れますか?"},
"category": {
"type": "choice",
"instructions": "このレシートの経費の種類はどれですか?",
"criteria": {
"meal": "飲食費(会議費・交際費を含む)",
"travel": "交通費",
"supplies": "消耗品費",
"books": "書籍・資料費",
"other": "その他",
},
},
"invoice_number": {
"type": "noul",
"instructions": "適格請求書発行事業者の登録番号(Tから始まる13桁の番号)は記載されていますか?",
},
"condition": {
"type": "score",
"instructions": "経費精算の証憑として、画像の状態はどの程度良好ですか?",
"criteria": ["読み取れない", "一部が不鮮明", "おおむね読み取れる", "鮮明"],
},
}
image = to_data_url("receipt.png")
for model in ["clef", "clef-flash"]:
result, ms = run_clef(model, "添付したレシートの写真を、経費精算の一次チェックとして確認してください。",
questions_img, images=[image])
print(model, result["answers"], f"{ms:.0f}ms", result["usage"]["input_tokens"], "tokens")
出力結果はこちら

| 質問 | 正解 | Clefの判定 | Clef-flashの判定 |
|---|---|---|---|
| 合計金額は読み取れるか | はい | はい(確率0.98) | はい(確率0.93) |
| 経費の種類 | 飲食費 | 飲食費(確率0.90) | 飲食費(確率0.95) |
| 登録番号の記載があるか | はい | はい(確率0.78) | いいえ(確率0.07) |
| 画像の状態(0〜3) | 鮮明〜おおむね読み取れる | 2.74(「鮮明」が0.79) | 2.53(「鮮明」0.55・「おおむね読み取れる」0.44) |
| モデル | 正解数 | 応答時間 | 入力トークン |
|---|---|---|---|
| Clef | 4問中4問 | 1,218ミリ秒 | 1,498トークン |
| Clef-flash | 4問中3問 | 1,223ミリ秒 | 1,498トークン |
合計金額の読み取りと経費の種類は、どちらのモデルも高い確率で正解しました。飲食費の判定ではClef-flashのほうが自信を持っており、確率は0.95に達しています。
差がはっきり出たのは、インボイスの登録番号の有無です。Clefが「記載あり」を0.78と判定したのに対し、Clef-flashは0.07と、登録番号をほぼ見落とす結果に。レシートの隅に小さく印字された13桁の番号のような細かい文字を拾うには、パラメータ数の大きいClefに分がありそうです。
画像の状態については、両モデルとも「鮮明」寄りの判定となりました。Clef-flashは「鮮明」と「おおむね読み取れる」で確率が割れており、確信度も0.32と低めです。
ClefをはじめとしたAIモデルのご相談はWEELへ!
Clefは、文章を生成せずに選択肢ごとの確率を一度に返す、Cloudflare初の判断モデルです。Jev互換のAPIはそのままに、画像入力と64Kトークンのコンテキストに対応し、Apache 2.0の重みまで公開されました。
Clef-flashなら中央値38.8ミリ秒で判断できるため、エージェントの分岐やチケットの振り分けといった処理を、LLMよりも速く安定して自動化できます。
弊社では、AI導入を検討中の企業向けに、業務効率化や新しい価値創出を支援する情報提供・導入支援を行っています。最新のAIを活用し、効率的な業務改善や高度な分析が可能です。
「生成AIで新しいプロダクトを作りたい」「もっと本格的に生成AIを業務に組み込みたい」とお考えの方は、ぜひ株式会社WEELにご相談ください。
開発実績として、
・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント
などの開発実績がございます。
生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。
アイデア段階でも構いません。まずは無料相談でお気軽にご相談ください。
➡︎生成AIを活用したプロダクト開発・業務効率化について相談する

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、生成AI社内セミナー・勉強会をさせていただいております。
セミナー内容や料金については、ご相談ください。
また、大規模言語モデル(LLM)を対象に、言語理解能力、生成能力、応答速度の各側面について比較・検証した資料も配布しております。この機会にぜひご活用ください。

