预填充prefill
预填充是大语言模型在开始生成回答之前,一次性处理全部输入提示的阶段。
2篇文章
最近提及 在预填充阶段,模型并行计算提示中的全部token,并生成后续生成所需的KV缓存。与之后逐个生成token的解码阶段不同,预填充计算量大,主要受算力影响,其速度通常以每秒处理的token数表示。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
预填充速度 每秒85.71个token
预填充是大语言模型在开始生成回答之前,一次性处理全部输入提示的阶段。
在预填充阶段,模型并行计算提示中的全部token,并生成后续生成所需的KV缓存。与之后逐个生成token的解码阶段不同,预填充计算量大,主要受算力影响,其速度通常以每秒处理的token数表示。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
预填充速度 每秒85.71个token
AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。