この記事で分かること
- 2026年9月29日から10月10日の約2週間に出た3つの「決定専用」モデル・API(OpenAI Decisions API、Cloudflare Clef/Clef-flash、Microsoft-Decision-1)が、何を入れて何を返すのか
- 速さと精度の数字は、誰が、何と比べて、どの条件で出したものか
- 返ってくる確率がどれだけ当たるか(校正)と、選択肢の順番を入れ替えたときの安定性について、各社は何を書き、何を書いていないか
- LLMに文章で分類させる方法と比べて、速さ・費用・確率・説明のしやすさがどう変わるか
- 自社で導入する前に、ラベル付きデータで何を測るか
1. 2週間で3つ出た
OpenAIは9月29日のDevDayで「Decisions API」を発表し、10月6日にpublic betaとして全開発者に開きました[O1][O2]。Cloudflareは10月1日に「Clef」と「Clef-flash」を公開しました[C1]。Microsoftは10月9日に「Microsoft-Decision-1」をブログで発表し[M1]、翌10日に日本マイクロソフトの社員がZennで日本語の解説を出しています[M2]。
3つとも、文章を生成しません。開発者が質問と選択肢を決めて送ると、各選択肢の確率やスコアが返ってきます。下敷きには、TypeSafe AIの決定専用モデル「Jev」があります。Cloudflareは「fully Jev-API compatible」と明記し[C1]、Microsoftも状況(state)と質問(questions)、質問の型 noul・choice・score という同じ形を使います[M2]。OpenAIの型名は predicate・choice・score で少し違い[O1]、TechCrunchはDecisions APIを「Jevの追随」と書きました[O6]。
速さの順位は各社の表に出ています。本記事で比べるのは、返ってくる確率を、何を根拠に信じるかです。決定モデルの使い道は「確率が0.9を超えたら自動で処理し、下回ったら人に回す」という閾値の運用です。確率が当たらなければ、この運用は静かに壊れます。3社とも、何と比べたか・何を測ったかを文章で書いており、書いていないことも読み取れます。
2. 3つの顔ぶれ
Cloudflare Clef/Clef-flash(10月1日)。 重みをApache 2.0でHugging Faceに公開し、Workers AIでもAPIとして呼べます[C1]。Clefは Qwen3.8-27B、Clef-flash は Qwen3.5-9B を事後学習したものです[C1]。画像も入力でき、Clefは1リクエストに最大4枚、質問は1〜64問です[C2]。価格は入力100万トークンあたりClef 0.24ドル、Clef-flash 0.038ドルで、出力の課金はありません[C4]。
OpenAI Decisions API(9月29日発表、10月6日public beta)。 エンドポイント POST /v1/decisions で、モデルは gpt-6-luna だけです[O1]。汎用の軽量モデルの上に、答えを選択肢に閉じるインターフェースを載せた形です。テキストと画像を受け付け、入力100万トークンあたり0.10ドル、出力とキャッシュの課金はありません[O1]。
Microsoft-Decision-1(10月9日)。 Qwen3.5-9B をMicrosoftが事後学習したモデルで、Microsoft Foundryで提供されます[M1][M3]。モデルカード上の状態はGA(一般提供)です[M3]。入力はテキストのみで、コンテキストは32,768トークン[M3]。価格は入力100万トークンあたり0.042ドル、出力は無料です[M1]。ブログは「近くMicrosoft AI(MAI)やOpenAIのモデルにも載せ替える」と書いています[M1]。
Clef-flashとDecision-1は、どちらもQwen3.5-9Bの事後学習です[C1][M1]。土台が同じ9Bで、差は学習のさせ方に出ます。
3. 何と比べたか
Microsoftは、36本のベンチマークで自社比較をしました。 ブログの文言は「36本・約15万問の比較で最高の精度。ベンチマークは学習から隠した」です[M1]。比較相手にはGPT-6 Sol、GPT-6 Luna、H2O-Lightning-4B v1.1、Quyet-1.0-Largeなどが並びます[M1]。速さは「P50レイテンシでGPT-6 Solの約35倍、2位のH2O-Lightning-4B v1.1の2.5倍」です[M1]。
ただし、ブログ本文のテキストには各モデルの正答率の数値がありません。Xで広まった「平均83.5%、2位Quyet 81.9%」「p50 85ミリ秒」は、二次記事には出ていますが[M7]、本文では確認できませんでした。また、発表直後の報道は2位を「Quyet-1.0-Largeの4.5倍」と引用しており[M5]、10月11日時点の本文(H2O-Lightning-4Bの2.5倍)と食い違います。ハードウェア、入力の長さ、GPT-6 Solの推論設定も書かれていません[M1]。
Cloudflareは、外部の指標を自分で走らせました。 使ったのは「Jev Decision Index」の10本と、TypeSafeのワークフロー評価4領域です[C1]。表には競合の数字も載っています。たとえば銀行問い合わせの意図分類(BANKING77)でClef 94.20、Jev 79.74。10本のうちClefが4本、Clef-flashが3本で首位、Jevが2本、別モデルが1本です[C1]。ワークフロー評価ではJevに3勝1敗で、エージェントのトレース監視はJevが上でした[C1]。
レイテンシの中央値はClef 209.3ミリ秒、Clef-flash 38.8ミリ秒、Jev 524.1ミリ秒[C1]。一方で同じ表のLayaは5.8ミリ秒で、Cloudflare自身が「とても速いが品質を犠牲にしている」と書いています[C1]。負けた項目も表に残しているのが特徴です。計測の場所・入力長・ハードウェアは書かれていません[C1]。
OpenAIは、精度のベンチマークを出していません。 公式の数字は「Responses APIの約10倍速い」だけで、ミリ秒の値もありません[O1]。Hacker Newsには利用者の実測でp50 160〜175ミリ秒という報告があり、タグ付けタスクで低いスコアが出たという報告に、OpenAIの社員が別の実験で反論しています[O5]。
3社とも、数字は自社による比較です。第三者が同じ条件で3つを並べた結果は、10月11日時点で見つかっていません。
4. 確率の校正について、何を書いたか
ここが3社の一番の分かれ目です。
Microsoftは、目標を文で書きました。 「確率はAPIの一部で、順位付けのためのスコアではない。アプリは信頼度で、実行するか、保留するか、レビューに回すかを決める。だから90%の予測は、代表的なケースで10回に9回当たるべきだ」[M1]。モデルカードも「calibrated probability scores」と書いています[M3]。ただし、その達成度を示す数値(ECEやBrierスコアなど)は本文に見当たりません。なお、まとめ記事などで校正の根拠のように引かれる「11ベンチ・5,250リクエスト」は、ブログでは安全性テスト(有害コンテンツ・脱獄・プロンプトインジェクション)の数字です[M1]。
Cloudflareは、学習方法を書きました。 「Reinforcement Learning for Calibrated Decisions(RLCD)」という強化学習で、Brier損失を使って確率の校正を詰めたと説明しています[C1]。こちらも校正の度合いを示す数値は出していません。
OpenAIは、何も書いていません。 confidenceの算出方法も未公開です[O1]。開発者コミュニティには、真の分布が50・30・20の課題で86・10・4を返したという実験報告があります[O4]。
5. 選択肢の順番を入れ替えたら
LLMの確率には、選択肢の並び順で値が動く性質があります。決定モデルでもこれが残るかは、閾値運用に直結します。
Microsoftは、自社テストの結果を出しました。 同じリクエストを8通りに変え、判断が変わった割合は平均1.3%。選択肢の説明を言い換えたとき、逆順にしたとき、シャッフルしたときは「判断が変わった件数ゼロ」です[M1]。
OpenAIは公式の記載がなく、利用者の報告があります。 並び順を変えると、ある選択肢の確率が86%から73%に動いたという実験です[O4]。
Cloudflareは、記載がありません[C1]。
6. 自分で確かめる手段はあるか
Cloudflareは、重みを公開しています。 Apache 2.0なので、手元や他のクラウドで同じ実験を再現できます[C1]。さらに、自社データで強化学習の微調整をするサービスを、当初はFDE(現場に入る技術者)チーム経由で始めるとしています。セルフサーブ化の時期は未定です[C1]。
MicrosoftとOpenAIは、APIだけです。 Decision-1はFoundryで呼べます[M3]。OpenRouterについては、本文は「OpenRouterでも利用可能」と書き[M1]、OpenRouterのMicrosoft一覧にも載っていますが[M4]、個別ページは取得時に404でした。初期の報道は「coming soon」でした[M5]。Decisions APIはOpenAIのAPIとPlaygroundで試せます[O1]。
7. 6つの問いで並べる
| 問い | Cloudflare Clef/Clef-flash(10/1) | OpenAI Decisions API(9/29発表、10/6 beta) | Microsoft-Decision-1(10/9) |
|---|---|---|---|
| (1) 土台と提供形態 | Qwen3.8-27B/Qwen3.5-9B。重み公開+Workers AI[C1] | gpt-6-luna。APIのみ[O1] | Qwen3.5-9B。Foundry(GA)[M1][M3] |
| (2) 入力 | テキスト・画像[C2][C3] | テキスト・画像[O1] | テキストのみ、32,768トークン[M3] |
| (3) 何と比べたか | Jev Decision Index 10本+ワークフロー4領域を自社で実行。負けも掲載[C1] | 精度の公式比較なし。速さは「Responses APIの約10倍」[O1] | 36本・約15万問の自社比較で最高精度。各モデルの数値は本文になし[M1] |
| (4) 確率の校正 | RLCD(Brier損失)で学習。数値なし[C1] | 公式説明なし。偏りの報告あり[O1][O4] | 「90%なら10回に9回」を目標と明記。数値なし[M1] |
| (5) 順番・言い換えへの安定性 | 記載なし[C1] | 公式記載なし。並び順で86%→73%の報告[O4] | 8種の摂動で平均1.3%、並べ替え・言い換えで0件(自社)[M1] |
| (6) 入力100万トークンの価格 | Clef $0.24、flash $0.038、出力無料[C4] | $0.10、出力無料[O1] | $0.042、出力無料[M1] |
8. LLMに文章で分類させる場合と、何が変わるか
これまでの分類は、汎用のLLMに「次のどれに当たるか答えて」と頼み、返ってきた文字列をプログラムで読み取る形が多かったはずです。決定モデルに替えると、4つの点が変わります。
速さ。 文章を1トークンずつ書かないので、待ち時間が短くなります。Cloudflareは決定の段階を「non-autoregressive」と説明しています[C1]。エージェントが1回の作業で何十回も「次に何をするか」を決める設計では、この差が積み上がります。
費用。 3社とも出力は無料で、入力だけの課金です[C4][O1][M1]。MicrosoftのXbox Researchは、1万件超の自由記述フィードバックの分類で「GPT-6 Solと品質で競り合い、14倍以上速く、200分の1の費用」だったと書いています[M1]。これは社内事例で、条件の詳細はありません。
確率。 文章で答えさせたLLMに「自信は何%か」と書かせても、その数字は生成された文字列です。決定モデルは各選択肢の確率を返すので、閾値を引けます。ただし、その確率が当たるかどうかは、前の節のとおり各社とも数値で示していません。
説明のしやすさ。 決定モデルは理由の文章を返しません。「なぜその判断か」を利用者や監査に説明する場面では、確率の分布と、入力・選択肢の定義を記録に残すことが説明の材料になります。理由文が要る場面では、決定モデルで振り分けたあとに、必要な件だけLLMに理由を書かせる組み合わせが考えられます。
9. 向いている仕事と、導入前に確かめること
各社が公式に挙げる用途は重なっています。問い合わせの振り分け、エージェントの次の操作の選択、優先順位付け、AIの出力の評価、コンテンツの分類です[C1][O1][M3]。私の仕事に引きつけると、広告の問い合わせを担当チームに振り分ける、レポート作成エージェントが「次にどのデータを取りに行くか」を選ぶ、改善施策の候補に緊急度をつける、といった場面です。
Microsoftのモデルカードは、信用・雇用・住宅・保険・教育・医療・法律で人に関わる重大な決定の「唯一の決定者」にしないよう書いています[M3]。閾値と人の確認をどう組むかは、使う側の責任だとも明記しています[M3]。
導入前に確かめることは3つです。
1. 自社のラベル付きデータで正答率を測る。 各社の数字は各社のベンチマークです。自分の問い合わせ・自分の選択肢で、200〜500件ほど正解を付け、正答率を出します。3つのうち複数を同じデータで比べられます。
2. 確率の校正を測る。 確率を0.1刻みの区間に分け、「0.9前後と答えた件のうち、実際に何割当たったか」を数えます。0.9の区間で9割当たっていれば校正が取れています。あわせて、選択肢の並び順を入れ替えて同じ答えが出るかも試します。
3. 閾値で人に回す。 確率が閾値を下回った件はレビューに回し、偽陽性と偽陰性のどちらが高くつくかで閾値を決めます。OpenAIの公式ガイドも、閾値は自社のラベル付きデータで決めるよう書いています[O1]。最初は閾値を高めにして、自動処理の割合を少しずつ増やすのが安全です。
10. 限界
- Decision-1の各モデル別の正答率とミリ秒単位のレイテンシは、ブログ本文のテキストで確認できませんでした(図にある可能性があります)。X上の「83.5%」「85ミリ秒」「2位Quyet 81.9%」は本文では未確認です[M1][M7]
- Decision-1ブログの「2位」の記述は、初期報道(Quyetの4.5倍)と10月11日時点の本文(H2O-Lightning-4Bの2.5倍)で食い違います。更新履歴は確認できていません[M1][M5]
- 3社とも、校正の度合いを示す数値(ECE、Brierスコアなど)を公表していません。速さ・精度の数字はすべて自社による比較で、第三者の再現は未確認です
- Clef/Clef-flashのレイテンシの計測条件、Clef-flashのコンテキスト長(docsは24,576トークン、ブログの文脈は64k)は未確認です[C1][C3]
- Decision-1の対応言語(日本語の精度)、提供リージョン、OpenRouterの個別ページは未確認です[M3][M4]
- OpenAI Decisions APIはpublic betaの仕様で、GA日、日本リージョン、上限値は未公表です[O1]
まとめ
- 約2週間で、文章を書かずに選択肢へ確率を返すモデル・APIが3社から出た。土台はJevの形式で、Clef-flashとDecision-1はどちらもQwen3.5-9Bの事後学習。価格は3社とも入力のみの課金で、100万トークンあたり0.038〜0.24ドル
- 「何と比べたか」の示し方が分かれる。Cloudflareは外部の指標を自分で走らせ、負けた項目も表に残した。Microsoftは36本の自社比較で最高精度と書いたが、各モデルの数値は本文にない。OpenAIは「10倍速い」だけ
- 確率の校正は、3社とも数値で示していない。Microsoftは「90%なら10回に9回」を目標と書き、並べ替えへの安定性の自社テストを出した。Cloudflareは学習方法を書いた。使う側は、自社のラベル付きデータで正答率と校正を測り、閾値を下回る件を人に回す設計から始める
出典
脚注
- https://commandline.microsoft.com/microsoft-decision-1-model-foundry/ ↩
- https://zenn.dev/microsoft/articles/ms-decision-1 ↩
- https://ai.azure.com/catalog/models/Microsoft-Decision-1 ↩
- https://openrouter.ai/microsoft ↩
- https://www.testingcatalog.com/microsoft-launches-decision-1-model-in-foundry/ ↩
- https://the-decoder.com/microsofts-decision-1-model-enters-the-fast-growing-ai-decision-model-race/ ↩
- https://blog.cloudflare.com/clef-decision-models/ ↩
- https://developers.cloudflare.com/workers-ai/models/clef/ ↩
- https://developers.cloudflare.com/workers-ai/models/clef-flash/ ↩
- https://developers.cloudflare.com/workers-ai/platform/pricing/ ↩
- https://developers.openai.com/api/docs/guides/decisions ↩
- https://developers.openai.com/api/docs/changelog ↩
- https://community.openai.com/t/results-from-toy-experiments-with-decisions-api/1404010 ↩
- https://news.ycombinator.com/item?id=49984025 ↩
- https://techcrunch.com/2026/09/30/openais-jev-clone-could-help-the-frontier-lab-stop-its-swarming-agents/ ↩
#PR / 楽天モバイル従業員紹介プログラム
🤖 生成AIのサブスク代、スマホ代から出せるかもしれません
楽天モバイルはデータ無制限で月3,278円、3GBまでなら月1,078円(税込)。乗り換えなら従業員紹介で14,000ポイント。
✓ このリンクは「楽天従業員紹介」経由:
- 乗り換え(MNP)で14,000ポイント、新規で11,000ポイント還元
- 楽天グループ従業員が運営する紹介ページ
- 申込み前の疑問はLINEで個別相談可能
※お申し込みには楽天IDでのログインが必要です(リンクを開く→ログイン→申込の順)
※ポイント付与条件・対象期間など詳細は遷移先キャンペーンページをご確認ください。
📩 LINE で深掘り配信中
AI / マーケ / 楽天モバの限定情報を 週1〜2回 お届け(無料)
興味のあるテーマだけ選んで受け取れます


コメント