DeepSeek値上げ後にAI APIコストを削減する5つの方法(2026年)

DeepSeekは自社の価格の説明の中で、開発者に対しAPIの価格を「近い将来」引き上げる予定であり、「大幅な上昇が見込まれる」と伝えた。上げ幅も適用日も公表されていない。同社が明らかにしたのは警告だけで、これは2026年7月のピーク時間帯の価格導入に続くものだ。DeepSeekの基盤ではひと月のうちに2度目の価格変更であり、その安さゆえにDeepSeekを採り入れた組織に直接効いてくる。

AIの費用を見積もる組織は、最終的な数字を待たずに動くべきだ。5つの業務(モデルの振り分け、プロンプトの最適化、キャッシュ、バッチ処理、提供者の分散)で、一般的なLLM(大規模言語モデル)の請求を4割から85%減らせる。しかもどれも、DeepSeekから完全に移行せずに今週から実装できる。以下では効果の出る速さの順に各手法を見て、代償を示し、2026年8月時点で最も安いモデルの比較表を載せる。どこから削るかを見極めたいチームは、より詳しい入門としてエンタープライズのLLM費用の最適化の記事も参照してほしい。

DeepSeekが2026年に値上げする背景の経済

DeepSeekは2026年5月に料金を大きく下げ、中国のAI価格競争に火をつけた。ByteDanceとTencentも競争力を保つために追随した。この価格競争が業界全体の利幅を圧縮し、DeepSeek自身の安さが、いまの価格で支えきれる水準を超える需要を呼び込んだ。結果として、底値の料金が恒久ではなかったと示す基盤が現れた一方、同じ値下げに追随した競合も、方向を戻す同じ圧力に直面している。

これはいまの予算の立て方に2つの意味で効いてくる。1つ目に、DeepSeekのV4-Flashはキャッシュに当たらない場合で100万入力トークンあたり0.14ドルと、主要な提供者の中でも屈指の安さで、GPT-4oの2.50ドルのおよそ17.8分の1だ。これほど低い土台の上での「大幅な」上げは、絶対額では安いままでも、その料金を前提に組んだ月々の請求を大きく動かしうる。2つ目に、この圧力はDeepSeekに固有のものではない。業界全体の報道は、今後18か月で特定の価格帯のAPIが30〜50%値上がりするとみている。推論の費用が、いまや企業のAI予算のおよそ85%を占めているためだ。より広い最先端モデルのトークン価格の指数は2026年8月10日時点で12であり、2023年3月の基準から88%下がっている。つまりAPI価格の長期の流れは急な下降のままだ。DeepSeekの値上げは、構造的に安くなり続ける分野の中で起きた、提供者に固有の補正である。だからこそ、反射的な削減ではなく分散の戦略が適切な応答になる。

費用削減の手法を見極める:手間と見返り

5つの手法を並べる前に、やる価値のある変更とそうでない変更を分けるものを押さえておきたい。3つの問いでふるいにかけられる。

  • その手は支出のどれだけに触れるか。振り分けとキャッシュは、費用の2大要因 ── すべての問い合わせを1つの旗艦モデルに送ること、そして同一またはほぼ同一のプロンプトを繰り返し処理すること ── を狙う。したがって一般的な請求の最も広い部分に効く。
  • どれだけの技術の手間が要るか。設定を1行変えるだけのもの(キャッシュのヘッダーを有効にする)もあれば、中間層を立てる必要があるもの(振り分けの層)もある。見返りが構築に見合う必要がある。
  • 出力の質を落とさないか。費用は減らすが出力の質を損なう手は、費用を後の対応へ移し替えているだけだ。以下の手法は、公開された研究が質を保ったまま支出を減らすと示しているものを選んでいる。

1. 各問い合わせを、実際にこなせる最も安いモデルへ振り分ける

本番の構成の多くは、単純な分類の作業も本当に難しい推論の問題も同じ旗艦モデルへ既定で送る。振り分けの仕組みを作ってこなかったからだ。この習慣だけで、何にでも最上位のモデルを使う組織はAIの請求を4割から85%払いすぎている。

賢いモデルの振り分けは、届いた問い合わせを複雑さで分類し、それをこなせる最も安い階層へ送る。広く引かれる学術的な実装であるカリフォルニア大学バークレー校のRouteLLM(ICLR 2025)は、強いモデルへ送る問い合わせを14%に抑えることで、MT-Benchの評価で85%超の費用削減を達成しつつ、GPT-4水準の質を95%保った。より一般的な本番の内訳(単純が約60%、中程度が30%、複雑が10%)なら、3階層の振り分け(低価格、中位、旗艦)で、単一モデルの構成に比べておよそ70〜80%の費用削減になる。

実務では3つの振り分けの戦略が使える。分類器による振り分け(軽量なモデルが送出の前に複雑さを予測する)、段階的な振り分け(まず安いモデルを試し、確信が低いときだけ上げる)、意味による振り分け(問い合わせの埋め込みを、最も適したモデルに合わせる)だ。どれも本格的な入口の基盤を必要とせず、3つとも既存のAPI連携の手前で軽い中間層として動かせる。具体例を挙げると、単純な問い合わせの分類を旗艦モデルからGPT-5.4 Nanoのような低価格帯のモデルへ移すと、100万入力トークンあたり約4.80ドルの節約になる。1つの用途で月1億トークンなら、月480ドルに相当する。

代償は、振り分けのロジックを作り、保守し、持ち続けなければならないことだ。複雑さの判定を誤れば、易しい問い合わせを高いモデルへ送るか、もっと悪くすると、難しい問い合わせをこなせないモデルへ送ってしまう。決定論的なワークフローの基盤が価値を示すのはここだ。書類の多い処理(KYCの点検、契約レビュー、コンプライアンスの業務)を回す規制下のチームにとって、業務のうち本当に判断が要る部分だけLLMを呼ぶルールベースの実行の層は、すべての段階をモデルに通すのではなく、確率的な分類器ではなく監査できる判断の道筋で同じ振り分けの効果を得られる。Jinbaは、規制下の企業のために作られたSOC II準拠でYC出資のワークフロー基盤で、ある業務のおよそ8割が決定論的なルールで走り、残りだけがLLMの呼び出しを伴うように自動化を組み立てる。これは1件ごとの段階ではなく、業務の設計の段階で下される振り分けの判断にあたる。同社によれば、この進め方は、同じ処理をすべての段階で汎用の確率的なエージェントに通す場合に比べ、規模が大きいときのトークン費用が15〜60分の1で済むという。

向いている相手:問い合わせの量が多く、作業の複雑さに実際の幅があるチーム。顧客対応、分類の流れ、書類の振り分けなどだ。すべての呼び出しが本当に複雑な単一用途のアプリでは効きにくい。振り分けて逃がす先がないからだ。

2. 徹底してキャッシュする ── 完全一致と意味の両方で

企業の通信の多くは新規のものではない。費用最適化の文献が引く調査によれば、企業のLLMへの問い合わせのおよそ30%は、過去の問い合わせと意味の上で重複している。言い回しが違っても、前の答えを再利用できるほど近い。同じ答えを作り直すために満額を払うことは、多くの請求で最も避けやすい費目だ。

DeepSeek自身のAPIは、追加の道具なしに文脈のキャッシュ(KVキャッシュ)に対応している。割引は大きい。V4-Flashではキャッシュに当たると入力トークンの価格が100万あたり0.14ドルから0.0028ドルへ落ちる(50分の1)。V4-Proにも同等の仕組みがある。これは構成の変更であって設計の変更ではないため、すでにDeepSeekを使っている組織にとっては、このリストで作業1時間あたりの見返りが最も大きい項目になる。

完全一致のキャッシュの先に、意味によるキャッシュ(同一の文言ではなく意味で、新しい問い合わせを過去に答えたものへ結びつける)がある。完全一致では取り逃す重複を捉える手だ。この種の徹底したキャッシュで4割から7割の費用削減が報告されており、記録に残る事例が示唆に富む。月4万7,000ドルのLLMの請求を抱えていた事業者が、意味によるキャッシュを入れただけで1万2,700ドルへ、73%減らした。別の事例では、ある個人開発者の構成で、キャッシュが5つの変更の1つ(振り分け、プロンプトの圧縮、本番品質の検索、バッチ処理と併せて)となり、月847ドルの請求を月159ドルへ、81%減らしている。

譲る点もある。意味によるキャッシュは、近さのしきい値を緩く設定しすぎると、古い、あるいは微妙に文脈のずれた答えを返す小さなリスクを抱える。確信の下限と定期的な見直しが要り、置いたら終わりの仕組みではない。

向いている相手:同じ利用者が繰り返し来るチーム、よくある質問のような業務、同じ問いが絶えず戻ってくる社内ツール。本当に一度きりの生成(創作、新規のコード生成)で、キャッシュする余地の少ない用途では効きにくい。

3. プロンプトを圧縮し、出力トークンに上限を置く

システムのプロンプトは、何か月もの編集の中で澱をためる。誰も消さない指示、もう関係のない例、3通りに書かれた同じ体裁の指定。この膨らみは、その呼び出しに価値を足すかどうかに関わらず、毎回課金される。費用分析の研究は、システムプロンプトの膨張と出力トークンの上限の欠如を、LLMの予算を食う5つの代表的な原因のうちの2つとして挙げている。残りは、何にでも旗艦モデルを使うこと、キャッシュを一切しないこと、そして過剰で選別されていない文脈を毎回詰め込む「雑な」検索拡張生成(RAG)だ。

これに手を打つのに新しい基盤は要らない。システムプロンプトを点検し、当てはまらなくなった指示を消し、冗長な例を短いものに置き換え、max_tokensの上限を明示して、モデルが見返りの薄いところまで生成し続けないようにする。雑なRAG(1つで足りる答えに5つの文書を渡す)を刈り込むのは、指示ではなく文脈に同じ規律を当てることだ。

この手法は最も目立たないが、同じプロンプトを何か月も見直さずに走らせてきたチームにとっては、たいてい最も速く実行できる。新しい仕組みではなく、文章の編集だからだ。限界は、天井が振り分けやキャッシュより低いこと。プロンプトの刈り込みが節約するのは割合の中の割合であって、他の手が生む70〜80%の振れ幅ではない。積み上がる衛生の習慣であって、一発の劇的な解決ではない。プロンプトの刈り込みと構造的な変更を比べたいチームには、プロンプト最適化と決定論的なワークフローの比較が、どちらの手が実際にトークン費用を下げるのかを分解している。

向いている相手:同じ本番のプロンプトを半年以上、掃除もせずに手直ししてきたチーム。単独の解決策としては最も弱い。振り分けやキャッシュの代わりではなく、それらに重ねて使うのが最も効く。

4. 急がない仕事をバッチ処理へ移し、時計も見る

すべての呼び出しが200ミリ秒で応答する必要はない。夜間の集計、データセットの注釈付け、大量の文書の要約など、生きた利用者に応じない仕事も、既定の構成では応答が急がれる通信と同じ単価で課金される。まったく急ぎではない仕事に、余計な費用を払っていることになる。

OpenAIのバッチのAPIの窓口は、処理の遅れを許せる仕事について、1件ずつ送る場合に比べ50%安い。生きた利用者に応じるのではなく予定に沿って走る仕事(日次の突合、週次のダイジェスト作成、大規模な再要約)は、この割引の候補になる。モデルの選択やプロンプトの設計を変える必要はなく、依頼の出し方を変えるだけだ。

関連して、追っておく価値のある新しい手がある。DeepSeekは大幅値上げの予告に先立ち、2026年7月にピーク時間帯の価格を導入した。クラウドの計算資源におけるスポット価格に似た、時間帯による価格の仕組みだ。より広い再値付けの圧力が示すとおり、これが他の提供者にも広がるなら、バッチの仕事、再試行、その他の急がない呼び出しをピーク外の時間帯へずらすことが、バッチ割引の上に重なる2つ目の手になる。いまのうちに予定を組む層を備えたバッチの流れを作っておけば、ピーク時間帯の価格がDeepSeek固有のものにとどまらず標準になったとき、その節約を自動で取り込める。

向いている相手:報告、大量の分類、オフラインでのデータ補強など、予定に沿った大量の仕事を回すチーム。生きた利用者が待っているものには使えない。

5. 提供者を分散し、1社の値上げに請求を握らせない

1社に頼る構成は、価格における単一障害点だ。DeepSeekの値上げに向き合う開発者に対するTepiAIの助言は明快である。高い料金で月の予算を計算し直し、動的な振り分けを伴う複数提供者の切り替えを実装し、キャッシュを最適化すること。分散は、キャッシュと並ぶ3つの具体的な備えの1つに位置づけられている。

実務上の道筋は素直だ。DeepSeek自身の作りに固有の事情がある。DeepSeekはOpenAIのAPIの形式にもAnthropicのAPIの形式にも対応している。つまり提供者を入れ替えたり、通信を分けたりするのに、連携を書き直す必要はない。窓口とモデル名を変えるだけでよい。同じ仕組みはどの提供者にも当てはまる。詳しくは、規制下の業務でOpenAIのAPI費用を減らす方法の記事にまとめている。2026年8月時点で、いくつかの低価格帯のモデルはDeepSeekのいまの料金を素直に下回る。Gemini 1.5 Flashは100万入力トークンあたり0.075ドルで、DeepSeek V4-Flashの0.14ドルのほぼ半分だ。GPT-4.1 Nano(100万あたり0.10ドル)とGPT-4o Mini(同0.15ドル)も同じ帯にいる。

分散を選ぶ戦略上の理由は、1社への備え以上に深い。ByteDanceとTencentは競争力を保つためにDeepSeekの2026年5月の値下げに追随した。つまりDeepSeekがいま動いているのと同じ利幅の圧力を抱えている。今日2社か3社の低価格帯の提供者に分散した構成は、DeepSeek固有の値上げだけでなく、低価格帯の全体が一斉に再値付けされる事態にも守られる。これは分散を、後手の当て物から、恒常的な構成上の判断へと位置づけ直す。もともと振り分けの層を作るのと同じ理屈だ。モデルの選択をすでに変数として扱う振り分けなら、アプリのコードに触れずに提供者を足したり外したりできる。

向いている相手:1社に月々ささやかとは言えない額を払っているすべてのチーム。代償は調整の手間だ。1社ではなく2〜3社の価格表、上限、機能を追うことになる。その手間こそ、振り分けや入口の層が吸収するために作られたものである。

価格で見る最も安いAIモデルの比較(2026年8月)

モデル

入力の価格(100万トークンあたり)

キャッシュに当たった場合の入力価格

出力の価格(100万トークンあたり)

DeepSeek V4-Flash

0.14ドル

0.0028ドル

0.28ドル

DeepSeek V4-Pro

0.435ドル

0.003625ドル

0.87ドル

Gemini 1.5 Flash

0.075ドル

—

—

GPT-4.1 Nano

0.10ドル

—

—

GPT-4o mini

0.15ドル

—

—

GPT-5.4 Nano

0.20ドル

—

—

Gemini 3.1 Flash Lite

0.25ドル

—

—

この表は、DeepSeekが高くなったことを示すものではない。いまの料金は依然として競争力がある。示しているのは、DeepSeekと次に安い選択肢との差が、そこそこの値上げでも最安の枠から外れてしまうほど小さいということだ。だからこそ1社への依存ではなく、振り分けと分散が持続する答えになる。

5つの手法を組み合わせる

この5つは互いを置き換えるものではない。キャッシュと振り分けは支出の最も大きな部分に効くので、実装の順番では先頭に来る。プロンプトの衛生は、その両方に添える最も手間の軽い相棒だ。バッチ処理と分散は、DeepSeekがいま予告したような提供者固有の衝撃に対する強さを作る。上に挙げた記録された事例に照らせば、キャッシュと振り分けだけを実装したチームでも、目に見える質の低下なしに70〜85%の費用削減が見込める。そこにプロンプトの圧縮、バッチ処理、提供者の分散を重ねれば、その幅の上のほうへ寄り、さらに重要なことに、特定の提供者の価格が変わらないことへの依存がなくなる。

規制下の、あるいは書類の多い処理(KYC、契約レビュー、コンプライアンスの点検、引受)でこれらの手法を人手で回しているチームにとって、自然な次の一歩は、振り分けとキャッシュのロジックを場当たりのスクリプトから、設計としてそれを守らせ監査証跡の付くワークフローの層へ移すことだ。上の戦術的な手直しとは規模の違う課題だが、出発点は同じ原理にある。確率的なモデルの呼び出しに払うのは、それが本当に必要なところだけにする。

よくある質問

2026年になって、AIのAPI費用が急に上がっているのはなぜですか。DeepSeekが2026年5月に料金を大きく下げて価格競争に火をつけ、競合が追随して業界全体の利幅が圧縮されました。そのDeepSeekがいま「大幅な」値上げを予告しており、より広い報道も、今後18か月で特定の価格帯が業界全体で30〜50%上がるとみています。推論の費用が企業のAI予算のおよそ85%を占めることが背景にあります。長期の流れはいまも下降ですが、個々の提供者は持続しない価格を補正しています。

2026年のAIのAPI価格の全体の流れは、上がっているのですか、下がっているのですか。全体としては下がっています。最先端モデルのトークン価格の指数は2026年8月10日時点で12であり、2023年3月の水準から88%低い状態です。DeepSeekの値上げは、構造的に安くなり続ける分野の中で起きた、提供者に固有の補正です。

開発者が今週できる、最も速い費用対策は何ですか。DeepSeekが標準で備える文脈のキャッシュを有効にすることです。新しい道具が要らず、キャッシュに当たった入力トークンで50分の1の割引が効きます。次に速いのはシステムプロンプトの点検と圧縮で、基盤の変更ではなく文章の編集だからです。

安いモデルは、実際に性能が劣るのですか。本番の通信の大半についてはそうではありません。RouteLLMの研究では、最も強いモデルへ送る問い合わせを14%に絞った振り分けでも、GPT-4水準の質を95%保ちつつ費用を85%超削減しました。効いてくる質の差は、本当に複雑で、曖昧で、安全上の重みがある作業(振り分けの枠組みでいう「複雑」の階層)に集まっており、単純な問い合わせの大半を占める分類、抽出、短い要約の仕事にはありません。

ピーク時間帯の価格は、費用の戦略をどう変えますか。DeepSeekは大幅値上げの予告に先立ち、2026年7月に時間帯による価格を導入しました。業界全体の利幅の圧力が示すとおりこれが他社へ広がるなら、バッチの仕事、再試行、急がない呼び出しをピーク外の時間帯に組むことが、クラウドの計算資源のスポット価格に似た手になります。それが当たり前の要件になる前に、いまのうちに流れの中へ予定を組む柔軟さを作っておく価値があります。

人馬一体のワークフロー構築を体験せよ

エンタープライズ組織を支えるAI基盤

無料で始める