【Clef】Cloudflare初の判断モデルとは?Jevとの違い・性能・料金・使い方を徹底解説

Clef Cloudflare 判断モデル とは Jevとの違い 性能 料金 使い方 徹底 解説
押さえておきたいポイント
  • Clefは、Cloudflareが2026年10月に公開した判断専用のオープンソースモデル
  • 文章を生成せず選択肢ごとの確率を一度に返すため、Clef-flashの応答時間は中央値38.8ミリ秒
  • Jev互換のAPIに加え、画像入力と64Kトークンに対応し、Apache 2.0で商用利用も可能

2026年10月2日、Cloudflareが自社で学習させた判断モデル「Clef」と軽量版の「Clef-flash」を公開しました!Clefは文章を書く代わりに、「この問い合わせは緊急か」「どのチームが担当すべきか」といった問いへの答えを、選択肢ごとの確率として一瞬で返すAIモデルです。

Clef Cloudflare 判断モデル とは Jevとの違い 性能 料金 使い方 徹底 解説

とはいえ、「LLMと何が違うの?」「Jevから乗り換える価値はある?」と気になっている方も多いのではないでしょうか。

この記事では、Clefの概要や仕組み・Jevとの違い・ベンチマーク性能・料金・ライセンス・具体的な使い方まで詳しく解説します。最後まで読めば、AIエージェントの判断処理を速く安く置き換えるヒントがきっと見つかるはず。

\生成AIを活用して業務プロセスを自動化/

tamura

【監修者】田村 洋樹

株式会社WEEL代表取締役 / 累計25社以上のAIアドバイザリーを担当 / 企業向けセミナー・大学講義でのべ10,000人超に登壇 / 日本HP・インテルなど、大手企業主催カンファレンスへの登壇実績多数。AI導入支援・生成AIを活用した業務改革のプロとして、アドバイザリー・PM・講演者など多面的な立場から企業を支援中。

目次

Clefとは?

Clefとは?
参考:https://blog.cloudflare.com/clef-decision-models/?utm_campaign=cf_blog&utm_content=20261001&utm_medium=organic_social&utm_source=twitter

Clefは、Cloudflareが2026年10月2日に公開した判断(ディシジョン)専用のAIモデルファミリーです。

ClefはCloudflareのWorkers AIチームが初めて自社で学習させたモデルで、大型の「Clef」(270億パラメータ)と高速な「Clef-flash」(90億パラメータ)の2種類が用意されています。

LLMのように文章を1文字ずつ組み立てるのではなく、「状態(state)」と「型付きの質問(questions)」を受け取り、許可された選択肢すべてに確率を割り振って返すのが基本の動きです。返ってくる答えは、はい・いいえの確率を返す「noul」、選択肢から1つを選ぶ「choice」、順序付きの段階で評価する「score」の3つの型のいずれかとなります。

出力がスキーマの外にはみ出さないため、後ろに続くプログラムは結果をそのまま分岐処理に使えるのが強み。自由文をパースして値を取り出す手間が要らないのは、エージェント開発ではかなり大きなメリットでしょう。

ちなみに、名前の由来は楽譜の「音部記号(クレフ)」だそうです。譜表の先頭で各線の音名を決める記号のように、後に続くアクションの領域を定める役割を担うことから名付けられたとのこと。「CF」の部分には、Cloudflareの頭文字も重ねられています。

Jevとの違い

Clefは、TypeSafe AIが2026年9月に公開した判断モデル「Jev」とAPIの互換性を持つモデルです。そのうえで性能や提供形態にはいくつか明確な違いがあるため、ここで整理しておきます。

Jevとの違い
参考:https://typesafe.ai/blog/introducing-system-one-models-and-jev

Jevは、元OpenAIの研究者ディオゴ・アルメイダ氏が立ち上げたTypeSafe AIが「System Oneモデル」として打ち出した判断モデルで、早期アクセス形式のAPIとして提供されています。ClefはこのJevのAPIと完全な互換性を持ち、接続先とモデル名を差し替えるだけで乗り換えられる設計です。

大きな違いは3つあります。1つ目は画像入力への対応で、Cloudflareによると2026年10月時点のJevはテキスト分類のみ。Clefはビジョンエンコーダーを備えており、画像の中身を見て判断できます。

2つ目はコンテキストウィンドウの広さです。Jevの32Kに対してClefは64Kと、2倍の情報を一度に渡せるようになりました。3つ目は重みの公開で、ClefはApache 2.0のオープンウェイトとして配布されているため、社外にデータを出せない環境でもセルフホストできるのが強みとなります。

一方、料金面ではJevが入力100万トークンあたり0.042ドルなのに対し、Clef-flashは0.09ドル、Clefは0.24ドルとやや割高な設定。速度と精度を取るか、単価を取るかで選び分けるのが現実的でしょう。

スクロールできます
項目ClefClef-flashJev
開発元CloudflareCloudflareTypeSafe AI
公開日2026年10月1日2026年10月1日2026年9月15日
入力テキスト・JSON・画像テキスト・JSON・画像テキスト
コンテキスト長64K64K32K
応答時間の中央値(Cloudflare計測)209.3ミリ秒38.8ミリ秒524.1ミリ秒
入力料金(100万トークンあたり)0.24ドル0.09ドル0.042ドル
出力料金料金表記なし(入力のみ)料金表記なし(入力のみ)無料
重みの公開あり(Apache 2.0)あり(Apache 2.0)なし(API提供)
ClefとJevの比較

なお、上記の応答時間はCloudflareが自社環境で計測した値です。TypeSafe AIは自社サービスの応答時間を70〜500ミリ秒としているため、利用する地域やネットワーク経路によって体感は変わってくるかと思います。

Clefの仕組み

Clefの仕組み
参考:https://blog.cloudflare.com/clef-decision-models/?utm_campaign=cf_blog&utm_content=20261001&utm_medium=organic_social&utm_source=twitter

Clefは、Qwenをベースにした「読み込み部分」と、独自の「採点ヘッド」を組み合わせた構造です。文章を生成しないのに賢く判断できる理由を、順を追って見ていきましょう。

プレフィル1回で選択肢をまとめて採点

ClefはQwen3.8-27B(Clef-flashはQwen3.5-9B)を土台にしており、この本体の重みは固定したまま使われています。

推論時には、入力された状態と質問をQwenが一度だけ読み込む「プレフィル」のみを実行し、その後は有効な選択肢を並列に採点するだけ。トークンを1つずつ生成する自己回帰の工程がないため、通常のLLMより大幅に速く判断を下せるのです。

途中で文章を書かせてから構造化する方式とも違い、Qwen内部の表現から直接スキーマの選択肢を導き出している点がポイントになります。

共同スキーマヘッドが質問ごとに根拠を集める

採点を担うのは、本体の最終隠れ状態を読み取る小さなTransformerのヘッドです。

Hugging Faceのモデルカードでは「Joint schema head」と呼ばれており、状態の中から各質問に関係する根拠を拾い出して、すべての質問の選択肢を同時にスコアリングします。

Cloudflareのブログによると、内部は2段階のアテンションルーティングという構成。まず各選択肢がプロンプトから関連する文脈を抜き出し、続いて質問同士や元の入力と相互に参照し合ってから採点される流れです。

出力は選択肢ごとに1つのロジットで、質問単位でソフトマックスをかけると確率に変わります。

キャリブレーションを重視した学習方法

学習では、Qwen本体を凍結したまま、ルーティングヘッドとランク256のLoRAアダプターを同時に最適化しています。

損失関数は、ラベル平滑化付きの交差エントロピーに、確率の当てはまりを整えるBrier損失を組み合わせたもの。学習データには、フィールドの順序やプロンプト、スキーマ構造を入れ替えた社内の合成データセットが使われました。

さらに2次的な最適化目標として「RLCD(Reinforcement Learning for Calibrated Decisions)」も導入しています。隣り合う順序の選択肢には部分点を与え、完全に正確な回答には報酬を与えつつ、分布のずれを防ぐ参照ペナルティを課す仕組みです。

Clefの特徴

Clefの特徴は、判断系のベンチマークで高いスコアを出しながら、レイテンシも短く抑えている点にあります。ここからはCloudflareが公開した評価結果を中心に、具体的な数字を見ていきましょう。

判断系のベンチマークでJevを上回るスコア

Cloudflareは、Jev Decision Indexで定義された評価のうち、判断に重要な10項目を抜き出して比較しています。

結果は以下のとおりで、10項目中7項目でClefかClef-flashが最高スコアを記録しました。特に家電操作のシミュレーションでは、Clef-flashが97.73とJevの52.27を大きく引き離しています。

Clefの特徴
参考:https://blog.cloudflare.com/clef-decision-models/?utm_campaign=cf_blog&utm_content=20261001&utm_medium=organic_social&utm_source=twitter
Clefの特徴
参考:https://blog.cloudflare.com/clef-decision-models/?utm_campaign=cf_blog&utm_content=20261001&utm_medium=organic_social&utm_source=twitter
スクロールできます
ベンチマークClefClef-flashJev
BFCL(case exact)98.4798.7695.75
ToolRet(nDCG@10)69.1966.4365.28
API-Bank(accuracy)91.9393.1188.19
Home appliances(case exact)82.9597.7352.27
When2Call(accuracy)72.3765.5880.97
BANKING77(macro-F1)94.2090.9379.74
CLINC150+OOS(macro-F1)97.4366.7789.27
BRIGHT(nDCG@10)45.9139.2647.52
Amazon ESCI(macro-F1)57.4857.3955.21
PhishNChips(accuracy)79.6075.0562.55
Cloudflareが公開した判断系ベンチマークの比較(抜粋)

PhishNChipsではDiffusionGemma Jevの85.35が最高値となっていますが、Clefも79.60とJevを17ポイント以上上回りました。

業務ワークフロー評価でも4分野中3分野でJev超え

TypeSafe AI自身が公開している業務ワークフロー評価でも、Clefは健闘しています。

請求書処理・カスタマーサービス・セキュリティインシデントの3分野でClefまたはClef-flashがJevを上回り、Jevが勝ったのはエージェントのトレース監視のみでした。

スクロールできます
ワークフローClefClef-flashJev
請求書処理64.757.161.8
カスタマーサービス76.377.076.0
セキュリティインシデント62.961.761.7
エージェントのトレース監視68.569.871.6
TypeSafe AIのワークフロー評価におけるClefとJevの比較

Cloudflareは、速度の割にClef-flashの成績がとても良い点を強調しています。軽量モデルでも実務レベルの判断精度が出ているのは、心強いポイントですね。

43種類の評価でレイテンシを比較

Cloudflareが実施した43種類の評価では、Clefシリーズは他の判断モデルよりも短いレイテンシを記録しています。

唯一の例外は5.8ミリ秒のLayaですが、Layaは前述の品質評価で大きくスコアを落としているため、速さと精度のバランスではClef-flashが頭ひとつ抜けている印象です。

スクロールできます
指標ClefClef-flashJevLaya
レイテンシ中央値209.3ミリ秒38.8ミリ秒524.1ミリ秒5.8ミリ秒
p95レイテンシ238.6ミリ秒122.4ミリ秒536.0ミリ秒222.5ミリ秒
判断モデルごとのレイテンシ比較

加えて、Workers AIはCloudflareのエッジにあるGPUで動くため、ネットワーク遅延も小さく抑えられます。Cloudflareの脅威インテリジェンスチームでの検証では、Webサイトの取得・描画・分類までをClefが2.2秒でこなしたのに対し、汎用LLMのgpt-oss-120bは4.7秒かかり、返した分類も2つだけだったそうです。

自社データで強化学習ファインチューニングできる

Clefの発表とあわせて、CloudflareはClefを顧客の用途に合わせて鍛え直す強化学習サービスもスタートさせました。

まずはFDE(Forward Deployed Engineer)チームが伴走する形で提供し、そこで得た知見をもとに、データ収集から学習、再デプロイまでをCloudflare上で完結できるセルフサービス版を作る計画です。

構成としては、AI Gatewayでリクエストを蓄積してデータセット化し、Workers AIで基盤モデルの試行(ロールアウト)を生成、Cloudflare Containersを採点用のサンドボックスにする流れ。新たに用意されるTrainerで重みを更新し、Workers AIの独自モデル持ち込み機能で再デプロイする仕組みとなっています。

Clefの安全性・制約

Clefは企業利用を想定したデータの取り扱い方針を打ち出している一方で、入力サイズや得意分野にはいくつか制約があります。

Clefの安全性・制約

リクエストとレスポンスは学習に使われない

Cloudflareは、Workers AI上のClefについて、リクエストやレスポンスを読んだり保存したり学習に使ったりしないと明言しています。

ただし、前述のファインチューニングサービスを利用する場合は、その目的に限ってデータが扱われる点は押さえておきましょう。さらに厳密な管理が必要なら、Apache 2.0で公開された重みを自社環境で動かす選択肢もあります。

出力は定義した選択肢の範囲に限られるため、型の崩れた回答が返ってくる心配はありません。その反面、リストにない答えはそもそも検討されないので、選択肢の設計がそのまま判断の質を左右します。

入力サイズと質問数には上限がある

Workers AIのAPIでは、1回のリクエストで送れる質問は1〜64個までです。

choice型の選択肢は2〜255個、score型の段階は2〜10段階と決まっています。画像はPNG・JPEG・WebPを最大4枚まで埋め込めますが、1枚あたり4MiBかつ1,600万画素以下、デコード後の合計8MiB、リクエスト全体で13MiBという上限付き。画像のURL指定は受け付けていないため、Base64で埋め込む必要があります。

また、長いテキストの状態はモデルのトークン上限に収まるよう切り詰められる仕様です。動画の入力はHugging Faceの重みをローカルで動かす場合に使えるもので、2026年10月時点のWorkers AIのスキーマには含まれていません。

推論の深さが問われるタスクは苦手

Hugging Faceのモデルカードに掲載された全ベンチマークを見ると、深い推論を要するタスクではJevに大きく差をつけられていることが分かります。

例えば、GPQA DiamondではClefの48.0に対しJevは78.3、BBHでは73.7対92.9、MMLU-Proでも65.9対82.7という結果でした。分類やルーティングには強い一方、難問を考え抜くような使い方には向かないと考えておくのが無難です。

また、掲載されているスコアはいずれもCloudflareの社内実行によるもの。Cloudflare自身も「まだ初期段階」と述べているので、本番投入の前には自社データでの検証をおすすめします。

Clefの料金

Clefは、Workers AIで使うなら入力トークン単位の従量課金、重みをダウンロードして動かすなら無料という料金体系です。

Workers AIでの料金は、Clefが入力100万トークンあたり0.24ドル、Clef-flashが0.09ドルとなっています。2026年10月時点の公式料金表には出力トークンの料金が記載されておらず、課金対象は入力トークンのみです。

スクロールできます
利用方法料金備考
Clef(Workers AI)入力100万トークンあたり0.24ドル21,818ニューロン相当、出力の料金表記なし
Clef-flash(Workers AI)入力100万トークンあたり0.09ドル8,182ニューロン相当、出力の料金表記なし
Workers AIの無料枠1日10,000ニューロンまで無料Workers Free・Workers Paidの両方が対象、毎日0時(UTC)にリセット
無料枠を超えた分1,000ニューロンあたり0.011ドルWorkers Paidプランへの加入が必要
セルフホスト(Hugging Face・Ollama)無料GPUなどの実行環境は自前で用意
強化学習ファインチューニング要問い合わせFDEチームによる伴走支援から提供開始
Clefの料金体系(2026年10月時点)

単価だけを比べると、入力100万トークンあたり0.042ドルのJevに対して、Clef-flashは約2.1倍、Clefは約5.7倍の水準になります。ただし、Clef-flashはJevよりレイテンシの中央値が10分の1以下と大幅に短いので、応答速度がユーザー体験に直結する処理では十分に元が取れるはずです。

Clefのライセンス

ClefとClef-flashは、どちらもApache 2.0ライセンスで公開されています。ベースモデルであるQwenのライセンスに沿った形での配布です。

スクロールできます
利用用途可否備考
商用利用⭕️社内システムや自社サービスへの組み込みも可能
改変⭕️改変したファイルには変更した旨の記載が必要
配布⭕️ライセンス文の同梱と著作権表示の保持が必要
特許使用⭕️
私的使用⭕️
Clef・Clef-flashのライセンス(Apache 2.0)

注意したいのは、Workers AI経由でホストされたClefを使う場合は、モデルのライセンスとは別にCloudflareの利用規約が適用される点です。また、重みを再配布したりファインチューニングしたモデルを公開したりする際は、ライセンス文の同梱や変更箇所の明記といったApache 2.0の条件を守らなければなりません。商用での本格導入を考えている方は、法務部門とあわせてライセンス本文を一度確認しておくと安心かと思います。

Clefの使い方

Clefは、Workers AIのAPIから呼び出す方法と、公開された重みを手元で動かす方法の2系統で使えます。今回は代表的な6つの使い方を、コマンドやコード付きで紹介していきます。

Workers AIのREST API(curl)で使う

いちばん手軽なのは、Workers AIのREST APIをcurlで叩く方法です。

STEP

APIキー取得

まずはCloudflareのダッシュボードにログインし、Workers AIの画面からREST APIの利用を選んで、アカウントIDの確認とAPIトークンの作成を済ませます。

Clefの使い方

取得した値は、以下のように環境変数へ設定します。

export CLOUDFLARE_ACCOUNT_ID="あなたのアカウントID"
export CLOUDFLARE_AUTH_TOKEN="作成したAPIトークン"
STEP

モデル呼び出し

続いて、以下のコマンドでClefを呼び出してみましょう。公式ドキュメントのサンプルをもとに、問い合わせ文と質問を日本語にしてみました。

curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run/@cf/cloudflare/clef \
  -X POST \
  -H "Authorization: Bearer $CLOUDFLARE_AUTH_TOKEN" \
  -d '{
    "model": "clef",
    "state": "1時間前から、すべてのお客様の決済処理が失敗しています。",
    "questions": {
      "urgent": { "type": "noul", "instructions": "この問い合わせは緊急ですか?" },
      "team": {
        "type": "choice",
        "instructions": "どのチームが対応すべきですか?",
        "criteria": {
          "billing": "支払い・請求書・返金",
          "technical": "障害・エラー・設定",
          "sales": "プランやアップグレード"
        }
      },
      "severity": {
        "type": "score",
        "instructions": "顧客への影響はどの程度深刻ですか?",
        "criteria": ["影響なし", "軽微", "重大", "致命的"]
      }
    }
  }'
Clefの使い方

レスポンスのanswersには、質問IDごとの回答が入っています。noulは「はい」の確率、choiceは選ばれた選択肢と各選択肢の確率・確信度、scoreは確率で重み付けした期待スコアが返ってくる仕様です。Clef-flashを使う場合は、URLの@cf/cloudflare/clefと"model"の値を両方ともclef-flashに書き換えてください。

STEP

Cloudflare WorkersのAIバインディングで使う

Cloudflare Workersのアプリに組み込むなら、AIバインディング経由で呼び出すのが便利です。

まずはWorkersのプロジェクトを作成します。

npm create cloudflare@latest -- clef-worker
cd clef-worker

wrangler.jsoncにAIバインディングを追加しましょう。

{
  "ai": {
    "binding": "AI"
  }
}

src/index.tsを以下のように書き換えます。公式ドキュメントのコードをベースにしたものです。

export interface Env {
  AI: Ai;
}

export default {
  async fetch(request, env): Promise<Response> {
    const response = await env.AI.run("@cf/cloudflare/clef-flash", {
      model: "clef-flash",
      state: "1時間前から、すべてのお客様の決済処理が失敗しています。",
      questions: {
        urgent: { type: "noul", instructions: "この問い合わせは緊急ですか?" },
        team: {
          type: "choice",
          instructions: "どのチームが対応すべきですか?",
          criteria: {
            billing: "支払い・請求書・返金",
            technical: "障害・エラー・設定",
            sales: "プランやアップグレード",
          },
        },
      },
    });
    return Response.json(response);
  },
} satisfies ExportedHandler<Env>;

最後にデプロイすれば、発行されたURLにアクセスするだけで判定結果がJSONで返ってきます。

npx wrangler deploy

エッジ上のWorkerから同じくエッジのGPUで動くClefを呼ぶ構成のため、ネットワークの往復を最小限に抑えられるのがこの方法の魅力です。

STEP

Pythonから画像付きで判定する

Clefならではの使い方が、画像を添えた判定です。Workers AIではimagesフィールドに、Base64のデータURLを最大4枚まで渡せます。

以下は、領収書の画像を読み込んで「合計金額が読み取れるか」と「経費の種類」を同時に判定させるコード例。経費精算の一次チェックをイメージしてみました。

import base64
import os
import requests

ACCOUNT_ID = os.environ["CLOUDFLARE_ACCOUNT_ID"]
AUTH_TOKEN = os.environ["CLOUDFLARE_AUTH_TOKEN"]

with open("receipt.jpg", "rb") as f:
    image_b64 = base64.b64encode(f.read()).decode()

response = requests.post(
    f"https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/cloudflare/clef",
    headers={"Authorization": f"Bearer {AUTH_TOKEN}"},
    json={
        "model": "clef",
        "state": "添付の領収書を確認してください。",
        "images": [f"data:image/jpeg;base64,{image_b64}"],
        "questions": {
            "legible": {"type": "noul", "instructions": "領収書の合計金額は読み取れますか?"},
            "category": {
                "type": "choice",
                "instructions": "経費の種類はどれですか?",
                "criteria": {"travel": "交通費", "meal": "飲食費", "supplies": "消耗品費"},
            },
        },
    },
)
print(response.json())

画像のURLは指定できないため、ローカルのファイルを読み込んでエンコードする点に気をつけてください。REST API経由の場合、モデルの回答はresultの中に格納されて返ってきます。

STEP

Hugging Faceの重みをダウンロードしてローカルで動かす

自社のGPUサーバーで動かしたい場合は、Hugging Faceから重みを取得します。

モデルカードによると、動作確認はtorch 2.11とtransformers 5.10.2を使い、H200を1枚積んだ環境で行われたとのこと。重みはBF16で配布されているため、単純計算でもClefは約54GB、Clef-flashは約18GBのメモリを重みだけで使う点は覚悟しておきましょう。

必要なライブラリをインストールします。

pip install -U torch transformers huggingface_hub pillow

あとは、モデルカードに掲載されているコードで推論を実行するだけ。systemone関数を使えば、Jev形式のリクエストボディをそのまま渡せます。

import sys
from huggingface_hub import snapshot_download

path = snapshot_download("Cloudflare/clef-flash")
sys.path.insert(0, path)
from joint_schema_model import load_release_model, systemone

model, processor = load_release_model(path, device="cuda")

response = systemone(model, processor, {
    "model": "clef-flash",
    "state": "決済画面でエラーが出て、注文できない状態です。",
    "questions": {
        "department": {
            "type": "choice",
            "instructions": "どの部署が対応すべきですか?",
            "criteria": {"billing": "支払いや請求書", "technical": "不具合や障害"},
        },
        "urgency": {"type": "score", "criteria": ["急ぎではない", "今週中", "今日中"]},
        "outage": {"type": "noul", "instructions": "サービスが停止していますか?"},
    },
})
print(response["answers"])

ローカル版では、imagesに加えて動画のフレーム配列を渡すことも可能です。入力の長さはencode_recordのmax_length(初期値16,384トークン)で制御できます。

STEP

Ollamaで手軽にローカル実行する

もっと気軽にローカルで試したいなら、Ollamaを使う方法がおすすめです。

Ollamaの公式Xアカウントによると、2026年10月時点でClefとClef-flashの両方がOllamaに対応しました。インストール済みのOllamaで、以下のコマンドを実行するだけでモデルを取得できます。

ollama pull clef

軽量版を使う場合は、こちらのコマンドです。

ollama pull clef-flash

27BのClefはそれなりのマシンスペックを求められるので、まずはClef-flashから試すのが無難でしょう。具体的な呼び出し方は、Ollamaのモデルページで確認するのが確実です。

STEP

Jevのコードから乗り換える

すでにJevで判断処理を組んでいる方は、ほとんどコードを書き換えずにClefへ移行できます。

ClefはJevのSystemOne API(POST /v1/systemone)と同じリクエスト・レスポンスの形式を採用しており、変更が必要なのは主に接続先のURL・認証ヘッダー・modelの値の3点です。

# 変更前(Jev):TypeSafe AIのSystemOne APIへ送信
# 変更後(Clef):以下のエンドポイントへ同じボディを送信
https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/cloudflare/clef-flash
# model の値は "clef" または "clef-flash" を指定

ただし、REST APIのレスポンスはresultで包まれて返ってくるため、受け取り側の処理だけは調整しなければなりません。画像を渡すimagesフィールドはClef独自の拡張であるため、Jevとの併用時には注意しておきましょう。

【業界別】Clefの活用シーン

Clefは、決まった選択肢の中から素早く答えを選ぶ処理が多い業界ほど効果を発揮します。ここでは、とりわけ相性が良さそうな業界ごとに、具体的な使い方を見ていきましょう。

カスタマーサポート・SaaS業界

問い合わせの多いSaaS企業では、チケットの一次振り分けにClefがぴったりです。

1回のリクエストで「緊急かどうか」「担当チーム」「深刻度」をまとめて判定でき、確率が低いものだけを人の確認に回すといった運用も組みやすくなります。TypeSafe AIのワークフロー評価では、カスタマーサービス分野でClef-flashが77.0とJevの76.0を上回っていました。

SLAの短い窓口でも、数十ミリ秒の判定なら待ち時間の心配はほとんどないでしょう。画像付きのエラー報告をそのまま分類できる点も、サポート現場ではうれしいポイントです。

生成AIを搭載したSaaSについて、詳しく知りたい方は以下の記事も参考にしてみてください。

金融・保険業界

金融分野では、顧客の問い合わせ意図の分類や、請求書・領収書の処理に活用できます。

銀行の問い合わせ意図を77種類に分けるBANKING77では、ClefがJevの79.74を大きく上回る94.20を記録しました。請求書処理のワークフロー評価でもClefが64.7と最も高いスコアだったことから、経理部門の定型チェックにはとりわけ向いていると考えられます。

重みを自社環境に置けるので、顧客データを社外に出しにくい金融機関でも検討しやすいはず。不正の疑いがある取引だけを抽出して担当者に回すといった、一次スクリーニングにも使えるでしょう。

金融業界における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

EC・小売業界

ECサイトでは、検索クエリと商品の関連度判定や、出品画像のチェックに活用できます。

Amazonの商品検索データを使ったAmazon ESCIで、ClefはJevを上回る57.48を記録しました。画像入力にも対応しているので、商品画像がカテゴリに合っているか、禁止商材が写り込んでいないかといった審査を自動化することも可能です。

大量の商品データを相手にする業界だからこそ、入力トークン単価の安いClef-flashとの組み合わせが活きてきます。レビュー文を読んで返品理由を分類するといった使い方も考えられますね。

小売業における生成AI活用について、詳しく知りたい方は以下の記事も参考にしてみてください。

【課題別】Clefが解決できること

Clefは、LLMに判断を任せたときに起こりがちな「遅い」「高い」「出力が不安定」といった悩みをまとめて解消してくれます。課題ごとに、Clefで何が変わるのかを見ていきましょう。

問い合わせチケットの振り分けを自動化できる

問い合わせの振り分けを人手で行っていると、担当者の負担が大きく、対応の遅れにもつながります。

Clefなら、問い合わせ文を渡すだけで担当チーム・緊急度・深刻度を一度に判定でき、確率のしきい値を決めて自動処理と人の確認を切り分けることも簡単です。Cloudflareも、人が常にループに入っていなくてもエージェントが判断を下し、必要なときだけ人に委ねられるようになると説明しています。

結果として、担当者は本当に判断が難しい案件にだけ集中できるようになるでしょう。

LLMの出力パースに悩まされなくなる

LLMに分類をさせると、指定した形式から外れた回答が返ってきて、パース処理でエラーになるケースが少なくありません。

Clefは自由文を一切生成せず、定義した選択肢の中から確率付きで答えるため、型の崩れた出力がそもそも起こらない仕組みです。JSONの修復処理やリトライのロジックを書く手間が省け、コードもシンプルに保てます。

エージェントの処理が何層にも連なるシステムほど、この安定性のありがたみを実感できるはずです。

エージェントの判断を数十ミリ秒で下せる

LLMで分岐判断をすると、1回の判断に数秒かかることも珍しくなく、エージェント全体の処理が遅くなりがちです。

Clef-flashの応答時間は中央値38.8ミリ秒のため、エージェントのホットパスに判断処理を置いても待ち時間がほぼ気になりません。Cloudflareも、判断はClefに任せて、実際のアクションはWorkers AI上のLLMに担わせる構成を提案しています。

ツール選択やルーティングのように頻繁に発生する判断ほど、この速さが全体の体感速度を大きく押し上げてくれるでしょう。

画像を含む審査・チェック業務を自動化できる

領収書や商品画像、スクリーンショットの確認といった業務は、テキストだけの判断モデルでは自動化できませんでした。

Clefはビジョンエンコーダーを備えているため、画像とテキストを組み合わせて判定できます。「領収書の金額は読み取れるか」「この画面はフィッシングサイトに見えるか」といった問いに、画像を見たうえで確率付きの答えを返してくれるのです。

目視チェックに追われていた業務を、判断の難しいものだけ人に回す形へと変えられるでしょう。

Clefを使ってみた

ここからは、実際にClefとClef-flashをWorkers AI上で動かして、その実力を確かめていきます。日本語での判定精度と画像判定の2つの観点で検証してみましょう。

検証には、Workers AIを呼び出す共通の処理を1つのモジュールにまとめて使います。

# clef_client.py
import os
import time
import requests

ACCOUNT_ID = os.environ["CLOUDFLARE_ACCOUNT_ID"]
AUTH_TOKEN = os.environ["CLOUDFLARE_AUTH_TOKEN"]

def run_clef(model: str, state, questions: dict, images=None) -> tuple[dict, float]:
    url = f"https://api.cloudflare.com/client/v4/accounts/{ACCOUNT_ID}/ai/run/@cf/cloudflare/{model}"
    body = {"model": model, "state": state, "questions": questions}
    if images:
        body["images"] = images
    start = time.perf_counter()
    res = requests.post(url, headers={"Authorization": f"Bearer {AUTH_TOKEN}"}, json=body)
    elapsed_ms = (time.perf_counter() - start) * 1000
    return res.json()["result"], elapsed_ms
Clefを使ってみた

検証1:日本語の問い合わせ10件を一括でトリアージ

1つ目は、日本語の問い合わせ文をどこまで正しく振り分けられるかの検証です。

決済障害・請求書の再発行依頼・料金プランの相談・ログインできないといった、架空の問い合わせを10件用意しました。それぞれに正解ラベルを付けたうえで、ClefとClef-flashに「緊急かどうか」「担当チーム」「深刻度」の3問を同時に投げ、正解率と1件あたりの応答時間を比較します。

コードはこちら
# verify_triage.py
from clef_client import run_clef

questions = {
    "urgent": {"type": "noul", "instructions": "この問い合わせは緊急ですか?"},
    "team": {
        "type": "choice",
        "instructions": "どのチームが対応すべきですか?",
        "criteria": {
            "billing": "支払い・請求書・返金",
            "technical": "障害・エラー・ログイン・設定",
            "sales": "料金プランの相談やアップグレード",
        },
    },
    "severity": {
        "type": "score",
        "instructions": "顧客への影響はどの程度深刻ですか?",
        "criteria": ["影響なし", "軽微", "重大", "致命的"],
    },
}

tickets = [
    ("1時間前から全ユーザーが決済できません。売上が止まっています。", "technical"),
    ("先月分の請求書を再発行していただけますか。", "billing"),
    ("年間プランに切り替えると、いくら安くなりますか?", "sales"),
    # ……残り7件も同様に用意
]

for model in ["clef", "clef-flash"]:
    for text, label in tickets:
        result, ms = run_clef(model, text, questions)
        print(model, label, result["answers"]["team"]["choice"],
              f"{ms:.0f}ms", result["usage"]["input_tokens"], "tokens")

出力結果はこちら

Clefを使ってみた
スクロールできます
問い合わせ正解Clefの判定Clef-flashの判定
1時間前から全ユーザーが決済できません。売上が止まっています。technicalbilling(不正解)technical(正解)
先月分の請求書を再発行していただけますか。billingbilling(正解)billing(正解)
年間プランに切り替えると、いくら安くなりますか?salessales(正解)sales(正解)
担当チームの判定結果
スクロールできます
モデル正解数応答時間の中央値1件あたりの入力トークン
Clef3件中2件1,687ミリ秒353〜357トークン
Clef-flash3件中3件856ミリ秒353〜357トークン
モデル別の正解数と応答時間

意外なことに、今回の検証では3件すべてを正しく振り分けたのは軽量版のClef-flashのほうでした。

Clefは決済障害の問い合わせを、支払い・請求書・返金を扱うbillingチームに回しています。「決済」という言葉が、支払い系の選択肢の説明に引っ張られた可能性がありそうです。

検証2:レシート1枚から経費精算の一次チェックができるか

2つ目は、Clefの目玉機能である画像入力の検証です。

用意したのは、ChatGPTで生成した架空のカフェのレシート画像1枚だけです。正解が分かっている画像のため、判定の当たり外れをはっきり確かめられるのがポイントです。

経費精算の一次チェックを想定し、「合計金額は読み取れるか」「経費の種類」「インボイスの登録番号が記載されているか」「画像の状態」の4問を同時に投げて、ClefとClef-flashの判定を比べます。

コードと入力画像はこちら
# verify_receipt.py
import base64
import io

from PIL import Image

from clef_client import run_clef

def to_data_url(path: str, max_side: int = 1600) -> str:
    img = Image.open(path).convert("RGB")
    img.thumbnail((max_side, max_side))
    buf = io.BytesIO()
    img.save(buf, format="JPEG", quality=90)
    return "data:image/jpeg;base64," + base64.b64encode(buf.getvalue()).decode()

questions_img = {
    "legible": {"type": "noul", "instructions": "レシートの合計金額ははっきり読み取れますか?"},
    "category": {
        "type": "choice",
        "instructions": "このレシートの経費の種類はどれですか?",
        "criteria": {
            "meal": "飲食費(会議費・交際費を含む)",
            "travel": "交通費",
            "supplies": "消耗品費",
            "books": "書籍・資料費",
            "other": "その他",
        },
    },
    "invoice_number": {
        "type": "noul",
        "instructions": "適格請求書発行事業者の登録番号(Tから始まる13桁の番号)は記載されていますか?",
    },
    "condition": {
        "type": "score",
        "instructions": "経費精算の証憑として、画像の状態はどの程度良好ですか?",
        "criteria": ["読み取れない", "一部が不鮮明", "おおむね読み取れる", "鮮明"],
    },
}

image = to_data_url("receipt.png")
for model in ["clef", "clef-flash"]:
    result, ms = run_clef(model, "添付したレシートの写真を、経費精算の一次チェックとして確認してください。",
                          questions_img, images=[image])
    print(model, result["answers"], f"{ms:.0f}ms", result["usage"]["input_tokens"], "tokens")
Clefを使ってみた

出力結果はこちら

Clefを使ってみた
スクロールできます
質問正解Clefの判定Clef-flashの判定
合計金額は読み取れるかはいはい(確率0.98)はい(確率0.93)
経費の種類飲食費飲食費(確率0.90)飲食費(確率0.95)
登録番号の記載があるかはいはい(確率0.78)いいえ(確率0.07)
画像の状態(0〜3)鮮明〜おおむね読み取れる2.74(「鮮明」が0.79)2.53(「鮮明」0.55・「おおむね読み取れる」0.44)
レシート画像に対する4問の判定結果
スクロールできます
モデル正解数応答時間入力トークン
Clef4問中4問1,218ミリ秒1,498トークン
Clef-flash4問中3問1,223ミリ秒1,498トークン
モデル別の正解数と応答時間

合計金額の読み取りと経費の種類は、どちらのモデルも高い確率で正解しました。飲食費の判定ではClef-flashのほうが自信を持っており、確率は0.95に達しています。

差がはっきり出たのは、インボイスの登録番号の有無です。Clefが「記載あり」を0.78と判定したのに対し、Clef-flashは0.07と、登録番号をほぼ見落とす結果に。レシートの隅に小さく印字された13桁の番号のような細かい文字を拾うには、パラメータ数の大きいClefに分がありそうです。

画像の状態については、両モデルとも「鮮明」寄りの判定となりました。Clef-flashは「鮮明」と「おおむね読み取れる」で確率が割れており、確信度も0.32と低めです。

2つの検証から見えてきたのは、ClefとClef-flashの得意分野がはっきり分かれるということです。テキストの問い合わせ振り分けではClef-flashが3件すべてに正解し、Clefは決済障害の振り分けを誤りました。一方、画像の中の細かい文字を読み取る判定では、Clefだけが登録番号の存在に気づいています。

単純な分類やルーティングはClef-flashに任せ、細部の読み取りが必要な判定や確信度の低いケースだけをClefに回す二段構えが、精度とコストのバランスを取るうえで現実的な使い方と言えるかもしれません。

ClefをはじめとしたAIモデルのご相談はWEELへ!

Clefは、文章を生成せずに選択肢ごとの確率を一度に返す、Cloudflare初の判断モデルです。Jev互換のAPIはそのままに、画像入力と64Kトークンのコンテキストに対応し、Apache 2.0の重みまで公開されました。

Clef-flashなら中央値38.8ミリ秒で判断できるため、エージェントの分岐やチケットの振り分けといった処理を、LLMよりも速く安定して自動化できます。

弊社では、AI導入を検討中の企業向けに、業務効率化や新しい価値創出を支援する情報提供・導入支援を行っています。最新のAIを活用し、効率的な業務改善や高度な分析が可能です。

「生成AIで新しいプロダクトを作りたい」「もっと本格的に生成AIを業務に組み込みたい」とお考えの方は、ぜひ株式会社WEELにご相談ください。

開発実績として、

・新規事業室での「リサーチ」「分析」「事業計画検討」を70%自動化するAIエージェント
・社内お問い合わせの1次回答を自動化するRAG型のチャットボット
・過去事例や最新情報を加味して、10秒で記事のたたき台を作成できるAIプロダクト
・お客様からのメール対応の工数を80%削減したAIメール
・サーバーやAI PCを活用したオンプレでの生成AI活用
・生徒の感情や学習状況を踏まえ、勉強をアシストするAIアシスタント

などの開発実績がございます。

生成AIを活用したプロダクト開発の支援内容は、以下のページでも詳しくご覧いただけます。
➡︎株式会社WEELのサービスを詳しく見る。

アイデア段階でも構いません。まずは無料相談でお気軽にご相談ください。
➡︎生成AIを活用したプロダクト開発・業務効率化について相談する

大規模言語モデル(LLM)比較レポート
LLM比較レポート

「生成AIを社内で活用したい」「生成AIの事業をやっていきたい」という方に向けて、生成AI社内セミナー・勉強会をさせていただいております。

セミナー内容や料金については、ご相談ください。

また、大規模言語モデル(LLM)を対象に、言語理解能力、生成能力、応答速度の各側面について比較・検証した資料も配布しております。この機会にぜひご活用ください。

よくある質問

Clefは無料で使えますか?

はい、無料で試せます。Workers AIには1日10,000ニューロンの無料枠があり、Workers Freeプランでもこの範囲内ならClefとClef-flashを利用可能です。無料枠を超えて使う場合はWorkers Paidプランへの加入が必要になります。また、Hugging FaceやOllamaで重みをダウンロードして動かす場合は、モデルの利用料はかかりません。

ClefとClef-flashはどう使い分ければよいですか?

精度を優先するならClef、速度とコストを優先するならClef-flashがおすすめです。Cloudflareも、Clefを精度重視のモデル、Clef-flashをレイテンシが重要な判断向けのモデルと位置づけています。

BANKING77やCLINC150+OOSのように選択肢が多い分類ではClefが優位な一方、家電操作のシミュレーションなどではClef-flashが上回ったので、まずはClef-flashで試し、精度が足りない処理だけClefに切り替える方法が効率的でしょう。

Jev向けに書いたコードはそのまま使えますか?

はい、ほぼそのまま使うことが可能です。ClefはJevのSystemOne APIと完全な互換性を持つため、リクエストボディは変えずに、接続先のURL・認証ヘッダー・modelの値を変更するだけで移行が完了します。ただし、Workers AIのREST APIはレスポンスをresultで包んで返すので、受け取り側の処理は調整してください。確信度の分布もJevとは異なるため、しきい値は自社データで再調整することをおすすめします。

  • URLをコピーしました!
  • URLをコピーしました!
目次