プロンプトキャッシュprompt caching

言語モデルに繰り返し送るプロンプトの前半部分を保存し、次のリクエストで再利用する手法。

記事5本
最終言及

プロンプトキャッシュは、大規模言語モデルのAPIで、リクエストごとに繰り返されるプロンプトの前半部分、つまりシステム指示や長い文書、過去の会話履歴などをサーバー側に保存し、以降のリクエストで再利用する手法である。同じ内容を最初から処理し直さないため、入力トークンの処理コストと応答の遅延を抑えられる。GoogleのGemini APIでは同じ機能をコンテキストキャッシュ(context caching)と呼ぶ。

Anthropic、OpenAI、GoogleなどのAI企業がAPIの機能として提供している。保存した内容は一定時間使われないと失効し、その後は同じ内容を改めて処理する必要がある。長い会話を続けるチャットボットやコーディングエージェントで広く使われている。

この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。

この項目を扱った記事

スティッキーセッションが重要なのは、会話がアカウント間を移動するとプロンプトキャッシュのミスが起き、提供元がプロンプトの先行部分の保存内容を再利用できなくなるうえ、モデルの思考過程の記録も途切れてしまうためです。

プロンプトキャッシュは、モデルがすでに受け取った内容を保存して再利用する仕組みで、こうした入力トークンのコストを約95%下げます。

分岐したサブエージェントは、親セッションのプロンプトキャッシュ、つまりモデルがすでに読み込んだ入力の処理結果を再利用できます。

DeepSeek V4 Flashの実行では、以前に処理した入力を再利用するプロンプトのコンテキストキャッシュが使われました。

プロンプトキャッシュの読み取り $0.20 $0.50


© 2026 AIPOST. All rights reserved.

AIPOSTは、AIの活用法、AIセキュリティ、性能、起業、ヘルスケア、倫理、業界ニュースを扱うAI専門メディアです。会員登録なしで利用でき、個人情報の取り扱いはプライバシーポリシーで確認できます。