LLMエージェントの月額コスト、本当は「12ドル」じゃ済まない——論文3本を突き合わせてわかった「損する使い方」と「得する使い方」
Related Articles

結論から言う。月12ドルは「嘘」ではないが「罠」である
LLMをエージェントとして業務に組み込んだら、月いくらかかるのか。
「月12ドルくらいですよ」——こう聞いたら、大半の中小企業経営者は「安いじゃん」と思うだろう。実際、単純計算ではそうなる。1回の呼び出しが0.02ドル、1日20タスク、月600回で12ドル。
だが、この数字を鵜呑みにすると痛い目に遭う。
論文を3本読み込み、現場の実感と突き合わせたら、「月12ドルで済む使い方」と「月12ドルが月500ドルに化ける使い方」の境界線がはっきり見えてきた。
中小企業がAIエージェントで損しないために、その境界線を具体的に示す。
—
まず、コストの正体を分解する
「Harnessing LLMs as Agents: What Does It Cost?」という論文が、LLMエージェントのコスト構造を初めてまともに定量化した。提唱されたフレームワーク「Language Model Agent Machine(LAM)」によると、エージェントのコストは大きく4つに分かれる。
- 通信コスト:LLMへのAPI呼び出し回数と送受信トークン量
- メモリアクセスコスト:過去の会話履歴やタスク文脈の読み込み
- 再計算コスト:メモリが溢れた時や失敗時のリトライ
- 信頼性コスト:出力の検証・修正にかかる追加呼び出し
ここが重要だ。多くの人が意識しているのは1番だけ。「1回0.02ドルだから安い」というのは、通信コストしか見ていない。
実際にエージェントとして使うと、2〜4が乗ってくる。たとえば、エージェントが過去の会話履歴を参照しながら判断する場合、毎回のプロンプトに数千トークンのコンテキストが付加される。GPT-4oで入力1Mトークンあたり2.50ドル、出力1Mトークンあたり10ドル(2025年6月時点)。1回あたりのコンテキストが3,000トークン、出力が500トークンだとすると、1タスクあたり約0.0125ドル。これだけなら安い。
だが、エージェントは1タスクに対して1回しかLLMを呼ばない、とは限らない。
ツール呼び出し、中間推論、エラーハンドリング——実際のエージェント動作では、1タスクあたり平均5〜15回のLLM呼び出しが発生する。論文のベンチマークでも、複雑なタスクでは20回以上の呼び出しが観測されている。
ここで計算し直そう。
| 条件 | 単純計算(1回/タスク) | 実態(平均8回/タスク) |
|---|---|---|
| 1日のタスク数 | 20 | 20 |
| 月のタスク数 | 600 | 600 |
| LLM呼び出し回数/月 | 600 | 4,800 |
| 1回あたりコスト | 0.02ドル | 0.02ドル |
| 月額 | 12ドル | 96ドル |
8倍。これが「コンテキスト込みの現実」だ。
さらに、メモリが溢れてリトライが発生すると、呼び出し回数はさらに1.5〜2倍に膨らむ。月96ドルが144〜192ドルになる。
月12ドルと月192ドルでは、意思決定がまったく変わる。
—
「安いモデルに自動で振り分ける」は本当に得か?
ここで多くの人が考えるのが、「じゃあ簡単なタスクは安いモデルに振り分ければいいのでは?」という発想だ。いわゆる動的LLMルーターがそれをやる。
「Dynamic LLM Routers are Often Misguided」という論文が、この発想に冷水を浴びせている。
研究チームが6つの商業用ルーターを分析した結果、動的ルーターを使った場合、パフォーマンスが10ポイント以上低下するケースが頻発した。つまり、コストを下げようとして品質が落ち、結果的にリトライや手戻りが増え、トータルコストが上がる。
なぜこうなるか。動的ルーターは「このクエリは簡単だから安いモデルで十分」と判断するが、その判断基準自体が粗い。特に業務文脈が絡むタスク——たとえば「過去の見積もり履歴を踏まえて返信文を作る」のような、一見シンプルだが文脈依存度が高いタスク——を「簡単」と誤判定する。安いモデルがトンチンカンな出力を返し、人間が修正するか、再度高いモデルで回し直す。
コスト削減のつもりが、コスト増+時間ロスのダブルパンチ。
中小企業への示唆は明確だ。
- タスクの種類が少ないなら、ルーターは不要。最初から「このタスクにはこのモデル」と固定した方が安定する
- ルーターを入れるなら、最低でも2週間は精度を計測してから本番投入する
- 「安いモデルで済むタスク」と「高いモデルが必要なタスク」の仕分けは、AIではなく人間がやった方が精度が高い
ここに中小企業の強みがある。大企業は数百種類のタスクがあるからルーターに頼らざるを得ない。だが中小企業のタスクは5〜10種類に絞れることが多い。人間が仕分けられる粒度だ。
—
トークンの「重さ」は均一ではない
もう一つ、コスト感覚を狂わせる要因がある。
「What Does a Token Cost?」という研究が明らかにしたのは、生成されるトークンの計算コストが均一ではないという事実だ。最もコストのかかるトークン上位10%が、全体の計算量(フロップ)の64〜80%を占めている。
これは何を意味するか。
「500トークンの出力」と一口に言っても、その中身によって実際の計算負荷は数倍違う。APIの課金は現時点ではトークン数ベースだから直接の請求額には反映されにくいが、今後トークン単価が「内容の複雑さ」に応じた従量課金に変わる可能性がある。
すでにOpenAIのo1やo3のような推論モデルは、思考トークン(reasoning tokens)に対して別単価を設定している。この流れが進めば、「同じ500トークンでも、推論が重いタスクは3倍課金」という世界が来る。
中小企業が今やるべきことは、「重い推論が本当に必要なタスク」と「テンプレ的に回せるタスク」を明確に分けておくことだ。後者はコストが下がり続ける。前者は下がらないどころか、上がる可能性すらある。
—
現実的なコスト試算:3つのパターン
以上を踏まえて、中小企業がLLMエージェントを導入した場合の現実的な月額コストを試算する。
パターンA:定型業務の自動化(メール返信、FAQ対応など)
- モデル:GPT-4o mini(入力0.15ドル/1Mトークン、出力0.60ドル/1Mトークン)
- 1タスクあたりLLM呼び出し:平均3回
- 1日20タスク、月600タスク
- 月額:約3〜8ドル(500〜1,200円程度)
- 人件費削減効果:月20〜40時間分 → 時給1,500円換算で3〜6万円
- ROI:投資の30〜60倍
パターンB:判断を伴う業務支援(見積もり作成、レポート要約など)
- モデル:GPT-4o(入力2.50ドル/1Mトークン、出力10ドル/1Mトークン)
- 1タスクあたりLLM呼び出し:平均8回
- 1日20タスク、月600タスク
- 月額:約80〜200ドル(12,000〜30,000円程度)
- 人件費削減効果:月40〜80時間分 → 時給2,000円換算で8〜16万円
- ROI:投資の4〜13倍
パターンC:複雑な推論タスク(契約書レビュー、戦略分析など)
- モデル:o3(入力10ドル/1Mトークン、出力40ドル/1Mトークン)
- 1タスクあたりLLM呼び出し:平均15回、思考トークン大量消費
- 1日10タスク、月300タスク
- 月額:約300〜800ドル(45,000〜120,000円程度)
- 専門家外注費の削減効果:月1〜3件分 → 1件5万円換算で5〜15万円
- ROI:投資の1〜3倍(場合によっては赤字)
見えてきたか。
パターンAは「やらない理由がない」レベル。パターンBは「ちゃんと設計すれば十分ペイする」。パターンCは「本当に必要なタスクだけに絞らないと損する」。
—
「損する使い方」の正体
3つの論文と現場の実感を突き合わせて見えた「損する使い方」は、結局こういうことだ。
- 全タスクを高いモデルで回す——定型業務にo3を使うのは、コンビニに行くのにタクシーを呼ぶようなもの
- 動的ルーターに丸投げする——タスクが少ない中小企業では、人間の仕分けの方が精度もコスパも上
- エージェントの呼び出し回数を把握していない——「1回0.02ドル」だけ見て安心し、実際は8回呼ばれていることに気づかない
- コンテキスト長を管理していない——会話履歴を全部突っ込んで、毎回数万トークンを食わせている
逆に「得する使い方」はシンプルだ。
- タスクごとにモデルを固定する。5種類のタスクに3種類のモデル、くらいの粒度で十分
- コンテキストは最小限に。必要な情報だけ渡す仕組みを作る
- 呼び出し回数にリミットを設ける。エージェントが暴走して30回ループする事故を防ぐ
- 月次でコストを計測する。API利用料のダッシュボードを週1で確認する習慣をつける
—
で、結局どうすればいいのか
中小企業がLLMエージェントを導入するなら、まずはパターンAから始めるべきだ。月1,000円以下で、月3〜6万円分の人件費が浮く。この成功体験を作ってから、パターンBに進む。
パターンCは、よほど明確なROIが見えない限り手を出さない方がいい。あるいは、月に1〜2回だけスポットで使う、という割り切りが正解だ。
「AIエージェントは安い」も「AIエージェントは高い」も、どちらも間違っている。正確には「使い方次第で30倍得するか、赤字になるかが分かれる」だ。
その分かれ目は、技術の問題ではない。自社のタスクを理解し、適切にモデルとコストを設計する——という、きわめて経営的な判断の問題だ。
中小企業は、タスクの種類が少ないからこそ、この設計を人間の頭でやれる。大企業が自動化に頼らざるを得ない部分を、手作業で最適化できる。それが、中小企業がAIエージェントで大企業に勝てる数少ないポイントだ。
まずは1つ、定型タスクを選んで、来週から回してみてほしい。月1,000円で始められる実験だ。
—
JA
EN