LLMエージェントの月額コスト、本当は「12ドル」じゃ済まない——論文3本を突き合わせてわかった「損する使い方」と「得する使い方」

結論から言う。月12ドルは「嘘」ではないが「罠」である LLMをエージェントとして業務に組み込んだら、月いくらかかるのか。 「月12ドルくらいですよ」——こう聞いたら、大半の中小企業経営者は「安いじゃん」と思うだろう。実際、単純計算では

By Kai

|

Related Articles

結論から言う。月12ドルは「嘘」ではないが「罠」である

LLMをエージェントとして業務に組み込んだら、月いくらかかるのか。

「月12ドルくらいですよ」——こう聞いたら、大半の中小企業経営者は「安いじゃん」と思うだろう。実際、単純計算ではそうなる。1回の呼び出しが0.02ドル、1日20タスク、月600回で12ドル。

だが、この数字を鵜呑みにすると痛い目に遭う。

論文を3本読み込み、現場の実感と突き合わせたら、「月12ドルで済む使い方」と「月12ドルが月500ドルに化ける使い方」の境界線がはっきり見えてきた。

中小企業がAIエージェントで損しないために、その境界線を具体的に示す。

—

まず、コストの正体を分解する

「Harnessing LLMs as Agents: What Does It Cost?」という論文が、LLMエージェントのコスト構造を初めてまともに定量化した。提唱されたフレームワーク「Language Model Agent Machine(LAM)」によると、エージェントのコストは大きく4つに分かれる。

  1. 通信コスト:LLMへのAPI呼び出し回数と送受信トークン量
  2. メモリアクセスコスト:過去の会話履歴やタスク文脈の読み込み
  3. 再計算コスト:メモリが溢れた時や失敗時のリトライ
  4. 信頼性コスト:出力の検証・修正にかかる追加呼び出し

ここが重要だ。多くの人が意識しているのは1番だけ。「1回0.02ドルだから安い」というのは、通信コストしか見ていない。

実際にエージェントとして使うと、2〜4が乗ってくる。たとえば、エージェントが過去の会話履歴を参照しながら判断する場合、毎回のプロンプトに数千トークンのコンテキストが付加される。GPT-4oで入力1Mトークンあたり2.50ドル、出力1Mトークンあたり10ドル(2025年6月時点)。1回あたりのコンテキストが3,000トークン、出力が500トークンだとすると、1タスクあたり約0.0125ドル。これだけなら安い。

だが、エージェントは1タスクに対して1回しかLLMを呼ばない、とは限らない。

ツール呼び出し、中間推論、エラーハンドリング——実際のエージェント動作では、1タスクあたり平均5〜15回のLLM呼び出しが発生する。論文のベンチマークでも、複雑なタスクでは20回以上の呼び出しが観測されている。

ここで計算し直そう。

条件 単純計算(1回/タスク) 実態(平均8回/タスク)
1日のタスク数 20 20
月のタスク数 600 600
LLM呼び出し回数/月 600 4,800
1回あたりコスト 0.02ドル 0.02ドル
月額 12ドル 96ドル

8倍。これが「コンテキスト込みの現実」だ。

さらに、メモリが溢れてリトライが発生すると、呼び出し回数はさらに1.5〜2倍に膨らむ。月96ドルが144〜192ドルになる。

月12ドルと月192ドルでは、意思決定がまったく変わる。

—

「安いモデルに自動で振り分ける」は本当に得か?

ここで多くの人が考えるのが、「じゃあ簡単なタスクは安いモデルに振り分ければいいのでは?」という発想だ。いわゆる動的LLMルーターがそれをやる。

「Dynamic LLM Routers are Often Misguided」という論文が、この発想に冷水を浴びせている。

研究チームが6つの商業用ルーターを分析した結果、動的ルーターを使った場合、パフォーマンスが10ポイント以上低下するケースが頻発した。つまり、コストを下げようとして品質が落ち、結果的にリトライや手戻りが増え、トータルコストが上がる。

なぜこうなるか。動的ルーターは「このクエリは簡単だから安いモデルで十分」と判断するが、その判断基準自体が粗い。特に業務文脈が絡むタスク——たとえば「過去の見積もり履歴を踏まえて返信文を作る」のような、一見シンプルだが文脈依存度が高いタスク——を「簡単」と誤判定する。安いモデルがトンチンカンな出力を返し、人間が修正するか、再度高いモデルで回し直す。

コスト削減のつもりが、コスト増+時間ロスのダブルパンチ。

中小企業への示唆は明確だ。

  • タスクの種類が少ないなら、ルーターは不要。最初から「このタスクにはこのモデル」と固定した方が安定する
  • ルーターを入れるなら、最低でも2週間は精度を計測してから本番投入する
  • 「安いモデルで済むタスク」と「高いモデルが必要なタスク」の仕分けは、AIではなく人間がやった方が精度が高い

ここに中小企業の強みがある。大企業は数百種類のタスクがあるからルーターに頼らざるを得ない。だが中小企業のタスクは5〜10種類に絞れることが多い。人間が仕分けられる粒度だ。

—

トークンの「重さ」は均一ではない

もう一つ、コスト感覚を狂わせる要因がある。

「What Does a Token Cost?」という研究が明らかにしたのは、生成されるトークンの計算コストが均一ではないという事実だ。最もコストのかかるトークン上位10%が、全体の計算量(フロップ)の64〜80%を占めている。

これは何を意味するか。

「500トークンの出力」と一口に言っても、その中身によって実際の計算負荷は数倍違う。APIの課金は現時点ではトークン数ベースだから直接の請求額には反映されにくいが、今後トークン単価が「内容の複雑さ」に応じた従量課金に変わる可能性がある。

すでにOpenAIのo1やo3のような推論モデルは、思考トークン(reasoning tokens)に対して別単価を設定している。この流れが進めば、「同じ500トークンでも、推論が重いタスクは3倍課金」という世界が来る。

中小企業が今やるべきことは、「重い推論が本当に必要なタスク」と「テンプレ的に回せるタスク」を明確に分けておくことだ。後者はコストが下がり続ける。前者は下がらないどころか、上がる可能性すらある。

—

現実的なコスト試算:3つのパターン

以上を踏まえて、中小企業がLLMエージェントを導入した場合の現実的な月額コストを試算する。

パターンA:定型業務の自動化(メール返信、FAQ対応など)

  • モデル:GPT-4o mini(入力0.15ドル/1Mトークン、出力0.60ドル/1Mトークン)
  • 1タスクあたりLLM呼び出し:平均3回
  • 1日20タスク、月600タスク
  • 月額:約3〜8ドル(500〜1,200円程度)
  • 人件費削減効果:月20〜40時間分 → 時給1,500円換算で3〜6万円
  • ROI:投資の30〜60倍

パターンB:判断を伴う業務支援(見積もり作成、レポート要約など)

  • モデル:GPT-4o(入力2.50ドル/1Mトークン、出力10ドル/1Mトークン)
  • 1タスクあたりLLM呼び出し:平均8回
  • 1日20タスク、月600タスク
  • 月額:約80〜200ドル(12,000〜30,000円程度)
  • 人件費削減効果:月40〜80時間分 → 時給2,000円換算で8〜16万円
  • ROI:投資の4〜13倍

パターンC:複雑な推論タスク(契約書レビュー、戦略分析など)

  • モデル:o3(入力10ドル/1Mトークン、出力40ドル/1Mトークン)
  • 1タスクあたりLLM呼び出し:平均15回、思考トークン大量消費
  • 1日10タスク、月300タスク
  • 月額:約300〜800ドル(45,000〜120,000円程度)
  • 専門家外注費の削減効果:月1〜3件分 → 1件5万円換算で5〜15万円
  • ROI:投資の1〜3倍(場合によっては赤字)

見えてきたか。

パターンAは「やらない理由がない」レベル。パターンBは「ちゃんと設計すれば十分ペイする」。パターンCは「本当に必要なタスクだけに絞らないと損する」。

—

「損する使い方」の正体

3つの論文と現場の実感を突き合わせて見えた「損する使い方」は、結局こういうことだ。

  1. 全タスクを高いモデルで回す——定型業務にo3を使うのは、コンビニに行くのにタクシーを呼ぶようなもの
  2. 動的ルーターに丸投げする——タスクが少ない中小企業では、人間の仕分けの方が精度もコスパも上
  3. エージェントの呼び出し回数を把握していない——「1回0.02ドル」だけ見て安心し、実際は8回呼ばれていることに気づかない
  4. コンテキスト長を管理していない——会話履歴を全部突っ込んで、毎回数万トークンを食わせている

逆に「得する使い方」はシンプルだ。

  • タスクごとにモデルを固定する。5種類のタスクに3種類のモデル、くらいの粒度で十分
  • コンテキストは最小限に。必要な情報だけ渡す仕組みを作る
  • 呼び出し回数にリミットを設ける。エージェントが暴走して30回ループする事故を防ぐ
  • 月次でコストを計測する。API利用料のダッシュボードを週1で確認する習慣をつける

—

で、結局どうすればいいのか

中小企業がLLMエージェントを導入するなら、まずはパターンAから始めるべきだ。月1,000円以下で、月3〜6万円分の人件費が浮く。この成功体験を作ってから、パターンBに進む。

パターンCは、よほど明確なROIが見えない限り手を出さない方がいい。あるいは、月に1〜2回だけスポットで使う、という割り切りが正解だ。

「AIエージェントは安い」も「AIエージェントは高い」も、どちらも間違っている。正確には「使い方次第で30倍得するか、赤字になるかが分かれる」だ。

その分かれ目は、技術の問題ではない。自社のタスクを理解し、適切にモデルとコストを設計する——という、きわめて経営的な判断の問題だ。

中小企業は、タスクの種類が少ないからこそ、この設計を人間の頭でやれる。大企業が自動化に頼らざるを得ない部分を、手作業で最適化できる。それが、中小企業がAIエージェントで大企業に勝てる数少ないポイントだ。

まずは1つ、定型タスクを選んで、来週から回してみてほしい。月1,000円で始められる実験だ。

—

POPULAR ARTICLES

Related Articles

POPULAR ARTICLES

JP JA US EN