prefill프리필

prefill은 대규모 언어 모델이 답을 생성하기 전에 입력된 prompt 전체를 한꺼번에 처리하는 단계다.

기사 1편
최근 언급

prefill 단계에서 모델은 prompt의 모든 token을 병렬로 계산해 이후 생성에 쓸 KV 캐시를 만든다. 이어지는 decode 단계가 token을 하나씩 만들어 내는 것과 달리 연산량이 많아 계산 성능의 영향을 크게 받으며, 처리 속도는 보통 초당 처리하는 token 수로 나타낸다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

캐시 없는 prefill(입력 처리) 512 token에서 초당 235.1 token, 8k에서 초당 295.1 token, 32k에서 초당 271.2 token


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.