上下文压缩compaction
上下文压缩是在对话接近上下文窗口上限时,对此前内容进行摘要和压缩,使语言模型得以继续工作的技术。
2篇文章
最近提及 上下文压缩是基于大语言模型的智能体在执行长时间任务时采用的技术:当对话和工作记录接近上下文窗口上限时,将此前内容进行摘要或压缩,只保留关键状态,并以压缩后的内容作为新上下文窗口的起点继续工作。
它用于长时间运行的编程智能体任务,在不丢失先前要求和进度的同时减少token消耗。压缩过程中可能丢失细节,被视为其局限。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
Codex每个活跃小时还要进行约20次上下文压缩,也就是压缩先前的内容,以便在有限的上下文窗口内继续工作。