Cloudflareは、生成ではなく「選ぶ」ことに特化した小型の決定モデル「Clef」を、Jev API互換・Apache 2.0でHugging Faceに公開した。Jared Palmer氏の「Kev」(0.8B〜27Bの4モデル)もTypeSafeのJevとAPIを共有する。チケットの振り分け、ツール選択、エスカレーションの要否といった判断を、大きな汎用LLMに毎回生成させる必要がなくなる。開発者はその判断だけを小型モデルへ切り出し、ローカルで動かせる。しかも同じAPIで入れ替えられるので、判断層は「特定のモデルに縛られない部品」になる。エージェントの安全性やガードレールが問われる流れの中では、「誰(何)が判断するか」を人への委譲も含めて明示的な層として設計する動きが強まっている。ここから、判断の層を自前で持つのか、外部の汎用モデルに任せるのか、という問いが現実の設計判断になる。
何が起きたか
4者が、分類・ルーティング・スコアリングなどの判断に特化したオープンな決定モデルを公開した。
- Cloudflare「Clef / Clef-flash」: ブログで「fully Jev-API compatible」と明記し、Hugging FaceでApache 2.0ライセンスのもと公開した。Workers AI上のホスト提供もある。あわせて、Clefをファインチューニングできる強化学習(RL)製品も発表した。
- Jared Palmer氏「Kev」: 0.8Bから27Bまでの4モデル(Kev-27B/9B/4B/0.8B)で、TypeSafeのJevとAPIを共有する。重みはApache-2.0でHugging Face、コードとサーブ基盤はGitHubで公開されている。
- Perplexity「pplx-decider-v1-27b」: ベースモデルはQwen3.8-27Bで、ライセンスはapache-2.0。
- Strands Agents「Strands Decider 2B」: 高速な実験とローカル開発向けの小型オープンソース決定モデル。なお、本稿では公開主体をStrands Agentsとして扱う。Amazonの公開物かどうかは、取得した記事内では確認できていない。
仕組み・詳細
決定モデルは、与えられた選択肢の中から答えを選ぶ・採点するモデルだ。KevとStrands Deciderはpointer head構成(Strands DeciderはQwen3.5-2Bの胴体にpointer headを載せた構成)を採る。
Clefは確率付きの型付き回答を返す。Cloudflareは、コード側がその出力を使って「チケットのルーティング、エスカレーションの発動、人への委譲」を行えると説明している。判断の確からしさが数値で返るので、確信度が低いときだけ人に回す設計が組める。
得意・不得意も明示されている。Kevは与えられた選択肢をスコアリングするだけで、説明の生成や欠けた情報の取得はできない。Strands Deciderも、複雑な推論や生成には向かないとしている。用途は、モデルルーティング、ツール選択、評価、ガードレールなどだ。
数字で見る
以下はすべて各社の自己申告であり、第三者による検証は確認できていない。根拠強度は「弱〜中」。
- Clefの速度: Cloudflare社内テストで、Clef 2.2秒に対しgpt-oss-120bは4.7秒。
- pplx-decider-v1-27b: RAGTruthでJevの77.27%に対し88.80%、TabFactでJevの89.80%に対し90.60%。ただし11評価のうちWinoGrandeではJevの90.70%が本モデルの83.30%を上回る。「Jevを全面的に上回る」ではなく、複数のベンチで競合し一部で上回る、が正確な読みだ。
- Strands Decider 2B: 公開ベンチJevBenchで、2Bクラス33モデル中3位。
背景
TypeSafeのJevが先行した決定モデルの枠組みを、他の3者が追う形になった。API互換が確認できたのは、Clef(Jev-API互換と明記)とKev(Jevとの共有APIを確認)の2者だ。pplx-deciderとStrands Deciderについては、取得した範囲にJev API互換の記述はなく、同一APIで切り替えられるかは未検証である。pplx-deciderはPythonのpredictインターフェースを示し、Strands DeciderはJevBenchでの比較を示すにとどまる。
また、Jevの発表から各社の公開までの間隔も、Jev側の一次ソースを取得していないため未検証だ。本稿では時期の前後関係には踏み込まない。
そのほか、Kevについて「評価データの一部が非公開」とする報道があるが、一次ソースでは評価手法と結果は公開とされており、評価データが非公開という部分は確認できなかった。確認できたのは、27Bの学習コーパス全体が非公開(proprietary)という点だ。Strandsのライセンスは「open source」という表記のみで、具体的なライセンス名は確認できていない。
なぜ重要か
- 使う側: 判断を大型の汎用モデルから切り出せば、レイテンシとコストを下げやすい(Cloudflareの速度比較は自己申告)。ローカル実行も可能になる。
- 設計側: Jev互換のAPIが共通の接続口になれば、判断層をモデル単位で差し替えられる。ただし確認できたのはClefとKevのみだ。
- 本当の問い: エージェントの判断を誰が下し、どこで人に渡すのか。Clefのように確率と人への委譲を型として返す設計は、この問いを実装の中に置く。決定モデルが生成や説明を担えない以上、判断の根拠を後から検証する仕組みは別途必要になる。