prompt caching프롬프트 캐싱

언어 모델에 반복해 보내는 prompt의 앞부분을 저장해 두고 다음 요청에서 다시 쓰는 기법이다.

기사 3편
최근 언급

prompt caching은 대규모 언어 모델 API에서 요청마다 되풀이되는 prompt의 앞부분, 곧 시스템 지시, 긴 문서, 지난 대화 기록 같은 내용을 서버에 저장해 두고 이후 요청에서 다시 쓰는 기법이다. 같은 내용을 처음부터 다시 처리하지 않으므로 입력 token의 처리 비용과 응답 지연을 줄일 수 있다. Google의 Gemini API는 같은 기능을 context caching이라고 부른다.

Anthropic, OpenAI, Google 같은 AI 기업이 API 기능으로 제공한다. 저장한 내용은 일정 시간 동안 쓰이지 않으면 만료되며, 만료 뒤에는 같은 내용을 다시 처리해야 한다. 긴 대화를 이어 가는 챗봇과 코딩 agent에서 널리 쓰인다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

sticky session이 중요한 이유는 대화가 계정을 옮겨 다니면 prompt cache(앞서 보낸 prompt를 저장해 두고 다시 쓰는 기능)가 맞지 않고 모델의 thinking 기록도 이어지지 않기 때문입니다.

prompt caching(앞서 보낸 내용을 저장해 두고 다시 쓰는 기능)이 살아 있으면 입력 token 비용을 약 95% 덜 내지만, 활동 없이 1시간이 지나면 cache가 만료되어 수천 token이 넘는 맥락을 정가로 다시 읽게 됩니다.

DeepSeek V4 Flash는 54개 과제에서 32개를 풀었고, context caching(이미 처리한 입력을 저장해 다시 쓰는 방식)을 적용한 해당 시험의 API 비용은 총 $0.58였습니다.


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.