プロンプトキャッシュprompt caching
言語モデルに繰り返し送るプロンプトの前半部分を保存し、次のリクエストで再利用する手法。
プロンプトキャッシュは、大規模言語モデルのAPIで、リクエストごとに繰り返されるプロンプトの前半部分、つまりシステム指示や長い文書、過去の会話履歴などをサーバー側に保存し、以降のリクエストで再利用する手法である。同じ内容を最初から処理し直さないため、入力トークンの処理コストと応答の遅延を抑えられる。GoogleのGemini APIでは同じ機能をコンテキストキャッシュ(context caching)と呼ぶ。
Anthropic、OpenAI、GoogleなどのAI企業がAPIの機能として提供している。保存した内容は一定時間使われないと失効し、その後は同じ内容を改めて処理する必要がある。長い会話を続けるチャットボットやコーディングエージェントで広く使われている。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
プロンプトキャッシュは、モデルがすでに受け取った内容を保存して再利用する仕組みで、こうした入力トークンのコストを約95%下げます。
分岐したサブエージェントは、親セッションのプロンプトキャッシュ、つまりモデルがすでに読み込んだ入力の処理結果を再利用できます。
DeepSeek V4 Flashの実行では、以前に処理した入力を再利用するプロンプトのコンテキストキャッシュが使われました。
プロンプトキャッシュの読み取り $0.20 $0.50