预填充prefill

预填充是大语言模型在开始生成回答之前,一次性处理全部输入提示的阶段。

2篇文章
最近提及

在预填充阶段,模型并行计算提示中的全部token,并生成后续生成所需的KV缓存。与之后逐个生成token的解码阶段不同,预填充计算量大,主要受算力影响,其速度通常以每秒处理的token数表示。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

预填充是模型读取提示的速度,解码是模型写出回答的速度。

预填充速度 每秒85.71个token


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。