AIパイプラインは「組むほど馬鹿になる」——精度40ポイント消失の衝撃と、中小企業が取るべきたった一つの設計原則

結論から言う。LLMは「つなぐほど精度が落ちる」 「AIを賢く使うには、複数のモデルをつないでパイプラインを組め」——この常識が、根本から間違っている可能性が出てきた。 最新の研究が示したのは、LLM(大規模言語モデル)を4段階つないだ

By Kai

|

Related Articles

結論から言う。LLMは「つなぐほど精度が落ちる」

「AIを賢く使うには、複数のモデルをつないでパイプラインを組め」——この常識が、根本から間違っている可能性が出てきた。

最新の研究が示したのは、LLM(大規模言語モデル)を4段階つないだパイプラインで、各接続部ごとに最大40.5ポイントの精度低下が起きるという事実だ。研究者たちはこれを「分解税(Decomposition Tax)」と呼んでいる。

40ポイントがどれくらいか。100点満点のテストで60点取れていた仕組みが、パイプラインを組んだだけで20点になる。使い物にならない。

しかもこれは、モデルもプロンプトもトークン予算もすべて固定した条件での話だ。「パイプラインを組む」という設計判断そのものが、精度を殺しているということになる。

中小企業にとって、これは他人事ではない。むしろ一番刺さる話だ。

なぜ「つなぐ」と精度が消えるのか

仕組みはシンプルだ。

LLMパイプラインでは、ステップ1の出力がステップ2の入力になる。ステップ2の出力がステップ3の入力になる。伝言ゲームと同じだ。

問題は、各ステップが元の問題文をどれだけ見られるかにある。ステップが進むほど、元の文脈は薄まる。前のステップの「要約」や「中間結果」だけが渡され、元の問い合わせの意図やニュアンスが欠落していく。

gemma-3-12Bモデルを使った検証では、GSM-Hard(算数の応用問題)やMATH-500(数学ベンチマーク)で、118のテストケースのうち70件で統計的に有意な精度低下が確認された。Benjamini-Hochberg補正(多重比較の統計的補正)を通過した数字だから、偶然ではない。

これが「分解税」の正体だ。タスクを細かく分けるほど、各ステップは「部分最適」に走り、全体の精度が崩壊する。

「再グラウンディング」で救えるか?——答えは「部分的にYes」

研究では、精度低下を緩和する手法として「再グラウンディング」が提案されている。各ステップに、元の問題文をもう一度渡し直すというシンプルなアプローチだ。

これで精度低下はある程度緩和される。だが、完全には防げない。なぜなら、ステップを分けた時点で「タスクの分解方法」自体にバイアスがかかり、元の問題の構造とズレが生じるからだ。

つまり、パイプラインを組むこと自体がコストであり、そのコストはゼロにはならない。

ここで中小企業の経営者に問いたい。

「そのパイプライン、本当に必要ですか?」

中小企業が陥る「過剰設計」の罠

大企業のAI事例を見ると、よくこういう構成が出てくる。

  1. ユーザーの入力を分類するLLM
  2. 分類結果に応じて検索するRAGシステム
  3. 検索結果を要約するLLM
  4. 要約をもとに回答を生成するLLM
  5. 回答を品質チェックするLLM

5段階のパイプライン。各段階で分解税がかかる。しかも各段階にAPIコストがかかる。開発工数もかかる。保守もかかる。

大企業にはそれを支えるエンジニアと予算がある。中小企業にはない。

そして今回の研究が示しているのは、その5段階パイプラインが、1段階のシンプルなプロンプトに精度で負ける可能性があるということだ。

コストをかけて、工数をかけて、精度が下がる。これが「分解税」の本当の怖さだ。

小さいモデルが大きいモデルに勝つ——「LLMシェパーディング」の衝撃

もう一つ、中小企業にとって重要な研究がある。「LLMシェパーディング」というフレームワークだ。

仕組みはこうだ。

  • 大型のLLM(GPT-4クラス)に「ヒント」だけを出させる
  • そのヒントを小型モデル(GPT-3.5クラス)に渡して、実際の回答を生成させる

つまり、大型モデルは「方向性を示す羊飼い」、小型モデルが「実際に走る羊」だ。

結果はどうか。

  • コスト削減:42〜94%
  • 精度:維持もしくは向上
  • 従来のルーティング(振り分け)やカスケード(段階的処理)手法と比較して、2.8倍のコスト効率

数学的推論やコード生成のベンチマークでこの数字だ。

月に10万円のAPI費用をかけていた処理が、6,000円〜58,000円になる計算だ。中小企業にとって、この差は「やるかやらないか」を分ける。

「シンプルに組め」は精神論ではない。構造的な優位性だ

ここまでの話を整理する。

分解税の教訓:

  • LLMパイプラインは「つなぐほど精度が落ちる」
  • 各接続部で最大40.5ポイントの精度低下
  • 再グラウンディングで緩和できるが、ゼロにはならない

シェパーディングの教訓:

  • 大型モデルの「知恵」だけ借りて、実行は小型モデルに任せる
  • コスト42〜94%削減、精度維持

この2つが示しているのは、同じ結論だ。

「複雑にするな。賢くシンプルにしろ。」

これは精神論ではない。統計的に検証された構造的な事実だ。

そして、この構造は中小企業にとって逆転のチャンスでもある。

大企業は組織の論理で複雑なパイプラインを組みがちだ。部署ごとに要件が違い、承認フローが複雑で、結果として多段階のAIシステムが出来上がる。そして分解税を払い続ける。

中小企業は違う。意思決定が速い。「これ、1段階でいけるんじゃない?」と社長が言えば、翌日には試せる。

明日から使える3つの設計原則

具体的にどうすればいいか。

1. まず「1プロンプト」で試す

パイプラインを組む前に、1つのプロンプトでどこまでできるか試す。意外とそれで十分なケースが多い。分解税ゼロ。開発コストも最小。

2. 分けるなら「元の問題文」を毎回渡す

どうしてもステップを分ける必要があるなら、各ステップに元の入力を必ず添付する。再グラウンディングだ。これだけで精度低下を大幅に緩和できる。追加コストはほぼゼロ。

3. 大型モデルは「ヒント係」にする

GPT-4oやClaude Sonnetのような高性能モデルを全処理に使う必要はない。方向性やヒントだけ出させて、実際の処理はGPT-4o-miniやHaikuに任せる。コストが半分以下になり、精度は維持できる。

このままでいいのか?

今、多くのAI導入支援会社が「パイプラインを組みましょう」「エージェントを連携させましょう」と提案している。その提案のたびに、分解税が積み上がっている可能性がある。

300万円かけて構築した5段階パイプラインが、5万円の1プロンプト設計に精度で負ける。そういう世界が、もう来ている。

AI導入で成果を出す中小企業と、コストだけかけて成果が出ない中小企業。その分かれ目は「どれだけ高度なAIを使ったか」ではない。「どれだけシンプルに設計できたか」だ。

複雑さは、もはやコストではなく負債だ。まず1プロンプトで試す。それで足りなければ、分解税を意識しながら最小限のステップを足す。この順番を間違えてはいけない。

—

POPULAR ARTICLES

Related Articles

POPULAR ARTICLES

JP JA US EN