AIエージェントの費用は約6割が「やり直し」に消える――トークン膨張を抑える設計・評価・KPIの新常識(2026年9月25日時点)

トピック解説
エージェント総原価を抑える4手(記事内容を表したイメージ図)
図:エージェント総原価を抑える4手

AIエージェントを業務に入れた企業の多くで、「思ったより高い」という声が出ています。モデルの利用単価は下がっているのに、請求額は増えている。その主な原因は、モデルの単価そのものより、エージェントが最終回答にたどり着くまでに繰り返す再試行・自己点検・検証・整形にあります。

この記事では、ここ数か月で実務家のあいだに広がった「エージェント運用の経済性」の考え方を、背景、何が変わるか、今後の見通しの順に整理します。


背景:なぜ今「エージェントの原価」が問題になったのか

チャットとエージェントではコストの構造が違う

チャット型AIは、1回の質問に1回答える使い方が中心でした。コストは「質問の回数×1回あたりの単価」でおおむね見積もれます。

エージェントは次のように動くため、1つのタスクでモデルを何度も呼び出します。

  • タスクを分解して計画を立てる
  • ツールを呼び、結果を読み、次の手を決める
  • 出力を自分で点検し、足りなければやり直す
  • 最後に体裁を整えて返す

この「ループ」の回数は入力によって変わり、事前に決まりません。そのため、見積もりと実際の請求額がずれやすくなります。

「原価の約60%が精緻化」という報告

2026年夏には、エージェント運用コストのおよそ60%が最終回答そのものではなく、再試行・自己批評・検証・整形に使われているという分析が報じられました。あわせて「ほとんどの企業がすでに想定予算を超えている」とも指摘されています。

経営側の圧力も強まっています。CFOの92%がAI投資の費用対効果を示すよう求められているという調査結果もあり、「とりあえず一番賢いモデルで回す」やり方は通りにくくなりました。

新語「Token Maxxing」

同じ時期に「Token Maxxing」(トークンの詰め込み)という言葉も広がりました。RAGやエージェント基盤が「精度のため」としてコンテキストに情報を詰め込み続け、1回の問い合わせで使うトークン量に上限がなくなる現象を指します。Anthropicの関係者も同じ概念を取り上げており、業界全体の課題として認識されています。


何が変わるか:5つの転換点

1. モデル選定は「単価」から「総原価」へ

これまでは「性能が高いモデルを、できるだけ安い単価で」が選び方の基本でした。これからは、1タスクを終えるまでの総コストで比べる考え方が主流になりつつあります。

比較軸 従来の考え方 これからの考え方
価格 100万トークンあたりの単価 単価 × 使用トークン数 × やり直し回数
性能 公開ベンチマークのスコア 自社タスクで「一発で通る率」
安定性 あまり問われない 長時間の自律実行で破綻しないか
リスク 別枠で管理 事故が起きたときの損失も原価に含める

たとえばAnthropicのClaude Opus 5は、実務エージェント向けのベンチマークで上位モデルのFable 5に迫りながら、料金は約半額と報じられています。ただ、総原価で効くのは単価の安さより、やり直しが減ることのほうです。60%を占める精緻化ループが半分になれば、単価を半分にしたのと同じくらいの効果があります。

2. 構成は「高性能な計画役+安価な実行役」の分業へ

コスト削減策としてもっとも具体的な成果が出ているのが、モデルの役割分担です。

  • 計画役(プランナー):タスクの分解や判断が必要な部分だけを高性能モデルに任せる
  • 実行役(エグゼキューター):決まった手順の実行や定型処理は安価なモデルが担う

AIコーディングツールのCursorは、大規模プロジェクトでこの構成を試し、コストを約8分の1に抑えたと報告しています。

さらに一歩進んだ考え方が動的ルーティングです。AIコーディングエージェントを手がけるFactoryのCEO、Matan Grinberg氏は、特定のモデルに合わせてハーネス(エージェントを動かす外側の仕組み)を作り込むと、そのモデルに過度に依存してしまうと指摘しています。そのうえで、複数のモデルに対応する汎用ハーネスを用意し、タスクごとに最適なモデルへ振り分ける方式が有利だと主張しています。

フードデリバリーのDoorDashも実例を公表しています。

  • 社内のコーディング関連のAI支出が、1月から6月で約20倍に増えた
  • 自社用のベンチマークを導入し、安価に済むタスクをオープンウェイトモデルに切り替えた
  • その結果、支出の伸びを横ばいに抑えた

3. 評価は「公開ベンチマーク」から「自社ベンチマーク」へ

モデルやリランカー(検索結果の並べ替え部品)を選ぶとき、公開リーダーボードの順位に頼る危うさも明らかになってきました。

  • 金融データを扱う9finは、公開リーダーボードで首位のリランカーを導入したところ、金融分野では検索品質がかえって下がったと報告しています
  • データ整備を手がけるSnorkel AIは「独自のベンチマークなしで本番に出すのは当て推量だ」と主張しています
  • 一方でGoogleの技術者からは、実際に触った手応え(いわゆる「バイブス評価」)も重要だという意見が出ています

実務では、この2つを組み合わせる二段構えに落ち着きつつあります。

段階 目的 評価方法
探索段階 使えそうな候補を絞る 実際に触った手応えなどの定性評価
本番投入の判定 事業で使えるかを決める 自社の業務データで作った評価セット

Anthropicは製品開発の方法として、要件定義書の代わりに評価セットそのものを仕様書として使う「評価駆動開発」を紹介しています。評価セットはコスト管理の土台でもあります。「どのモデルなら同じ精度をより少ないトークンで出せるか」を測れるのは、自社の評価セットがあるときだけです。

4. KPIは「使っているか」から「成果が出たか」へ

導入の広さでは、もう差がつかなくなっています。日本マイクロソフトの調査によると、日経225構成企業の87%がすでにAIエージェントを活用しています。そのため、何を指標にするかが変わってきました。

領域 これまでのKPI これからのKPI
顧客サポート 有人対応をどれだけ減らせたか(回避率) 問題が実際に解決したか(解決率)
社内活用 AIの利用率・利用者数 業務の成果物の量と質
開発 AIツールの導入率 マージされたプルリクエストの数など
  • General Motors(GM)は、ワークフローをエージェントの利用を前提に作り直し、マージ済みのプルリクエストを3倍に増やしたと報じられています
  • 顧客サポートの分野では、ZoomやNTTデータなどで、回避率から解決率へKPIを切り替える動きが同じ時期に出てきました
  • ビジネス職を対象にした調査では、エージェントとして使っている層で「生産性が上がった」と答えた割合は54%でした。チャットで質問するだけの層の約3.8倍です

一方で、Microsoftが顧客サポート担当の約1万人分の業務をAIエージェントに置き換えると報じられるなか、「経営層の55%がAIを理由にした人員削減を後悔している」という調査も出ています。回避率だけを追って人を減らすと、解決の質が落ちて結果的に高くつく場合があることを示すデータです。

5. 「増やせば速くなる」には限界がある

エージェントの数を増やして並列に動かせば処理は速くなりますが、その効果には上限があることもわかってきました。

  • ITサービス大手のCognizantは「企業のエージェントのPoC(試験導入)は、規模を広げる段階で失敗しやすい」と指摘しています
  • NTT ResearchとHarvardの研究では、エージェント同士の調整にかかるコストが精度の向上を打ち消してしまう転換点があることが示されています

小規模な試験でうまくいっても、そのまま規模を広げれば同じ効率が出るとは限りません。


コストが膨らむ主な原因と対策

原因 よくある症状 主な対策
精緻化ループの長期化 同じタスクで何度も自己点検をやり直す やり直し回数に上限を設ける/一発で通る率の高いモデルを選ぶ
コンテキストの詰め込み 1回の問い合わせのトークン数が増え続ける 「回答あたりのトークン数」を目標値として管理する
全工程で最上位モデルを使う 定型処理にも高額なモデルを使っている 計画役と実行役に分ける/動的ルーティング
公開ベンチマーク頼みの選定 導入後に精度が伸びず、やり直しが増える 自社データで評価セットを作る
エージェントの過剰な並列化 調整コストが増えて精度が頭打ちになる 段階的に規模を広げ、転換点を測る

導入・運用チェックリスト

  • [ ] タスク単位の総コスト(トークン数×単価×やり直し回数)を測れるようにしたか
  • [ ] 「回答あたりのトークン数」の目標値と上限を決めたか
  • [ ] 自社の業務データで評価セットを作り、モデルを変えるたびに測っているか
  • [ ] 判断が必要な工程と定型的な工程を分け、モデルを使い分けているか
  • [ ] 安価なモデルやオープンウェイトモデルに移せるタスクを洗い出したか
  • [ ] KPIを利用率や回避率から、解決率や成果物の量へ切り替えたか
  • [ ] エージェントの数を増やす前に、調整コストの影響を小さな規模で確かめたか

今後の見通し

オープンウェイトモデルの比率が上がる

FactoryのGrinberg氏は、企業のトークン消費に占めるオープンウェイトモデル(GLM 5.2など)の割合が、1桁台から2桁台へ急拡大していると述べています。DoorDashの例のように、「難しい部分は高性能モデル、それ以外はオープンウェイトモデル」という組み合わせが一般的になっていくとみられます。

人が見ていない「非同期エージェント」が消費の中心に

同氏は、12〜24か月でトークン消費の約90%が、人が画面の前で待たない非同期のエージェントによるものになるとも予測しています。人が見ていない場所で動くエージェントが増えれば、1タスクあたりのコストを監視して上限で止める仕組みが、今以上に欠かせなくなります。

長時間の自律実行が次の差別化軸に

Claude Codeの開発者であるBoris Cherny氏は、Opus 5を自動実行モードと組み合わせると、数日から数か月単位で走り続けられると述べています。実行時間が長くなるほど、途中のやり直しは複利のように積み上がります。今後のモデル比較では、「長時間動かしても破綻しないか」「同じ精度をどれだけ少ないトークンで出せるか」が主要な比較項目になるとみられます。

推論の需要は「試行錯誤の回数」で決まる

NVIDIAがエージェントの隔離実行環境(サンドボックス)に力を入れている背景には、推論の需要は回答の数ではなく試行錯誤の回数で決まるという読みがあるといわれます。これは利用企業から見れば、試行錯誤を減らす設計がそのまま費用の削減になるということです。

料金体系も「成果」寄りへ

KPIが解決率や成果物へ移るにつれて、ベンダーの課金も、使ったトークン量に応じた従量課金から、解決した件数や達成したタスクに応じた課金へ移る動きが出てくる可能性があります。ただし、まだ業界の標準といえる段階ではありません。


まとめ

  • エージェントのコストは、モデルの単価よりやり直しの回数で決まる。原価の約6割が精緻化に使われているという報告もある
  • モデルは単価ではなく、自社タスクで一発で通る率を含めた総原価で選ぶ
  • 構成は計画役と実行役の分業、さらに動的ルーティングが主流になりつつある
  • 評価は自社ベンチマークを土台にし、公開ランキングは参考にとどめる
  • KPIは利用率から成果へ。導入の広さでは、もう差がつかない
  • 規模を広げるときは、エージェント同士の調整コストという壁を前提に計画する

AIエージェントの競争は、「どのモデルが一番賢いか」から「同じ成果をどれだけ無駄なく出せるか」へ移り始めています。

#PR / 楽天モバイル従業員紹介プログラム

🤖 AI機能を使い倒すなら、通信環境も見直しを

画像生成もリアルタイム相談も、Wi-Fiなしでいつでも快適に。
楽天モバイルは 使った分だけの段階制プラン・SPUでポイント+4倍。

✓ このリンクは「楽天従業員紹介」経由:

  • 乗り換え(MNP)で14,000ポイント、新規で13,000ポイント還元
  • 楽天グループ従業員が運営する紹介ページ
  • 移動先で楽天会員ログインが必要です(リンクを開く→ログイン→申込の順でないと特典対象外になります)
  • リンク先は条件をまとめた案内ページで、そこから楽天モバイル公式(r10.to)へ進みます
  • 申込み前の疑問はLINEで個別相談可能

▶ 楽天モバイル紹介特典の詳細を見る

大手3社との料金比較・動画解説はこちら →

※ポイント付与条件・対象期間などの詳細は遷移先キャンペーンページをご確認ください。

📩 LINE で深掘り配信中

AI / マーケ / 楽天モバの限定情報を 週1〜2回 お届け(無料)
興味のあるテーマだけ選んで受け取れます

友だち追加する 👉

AIエージェント運用 / MMM / 楽天モバ紹介 の3テーマから選べます

コメント

タイトルとURLをコピーしました