量化quantization
量化是将AI模型的权重转换为更低比特数的数值,以缩小模型体积和内存占用的技术。
6篇文章
最近提及 量化通常把以16位或32位浮点数存储的权重转换为8位、4位、2位等较低精度。这样可以用更少内存运行大模型,有时还能提高速度,但比特数越低,输出质量可能越差。量化被广泛用于在个人电脑上运行大语言模型的本地部署。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
量化是以较低精度存储模型数值的方法,而QAT在训练时就考虑到这种低精度,从而保留更多模型能力。
它们反复进行基于性能剖析的实验,检查编译器输出,并重新调整Rust代码,让编译器能够自动向量化,也就是把循环转换成一次处理多个数值的指令。
端到端追踪: 在检索、向量化转换、模型使用、智能体工具和衍生文件之间保持关联。
这是一种伦理主张,而不是评估每份合同的可量化规则。
Q4 表示 4 位量化:以更低精度存储权重,从而缩小文件体积和内存占用。