量子化quantization
量子化は、AIモデルの重みをより少ないビット数の数値に置き換え、モデルのサイズとメモリ使用量を減らす手法である。
記事3本
最終言及 量子化では一般に、16ビットや32ビットの浮動小数点数で保存された重みを、8ビット、4ビット、2ビットといった低い精度に変換する。少ないメモリで大きなモデルを動かせ、速度が上がることもあるが、ビット数を減らすほど出力の品質が下がる場合がある。大規模言語モデルをパソコンで動かすローカルLLMで広く使われている。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
量子化はモデルの数値を低い精度で保存する手法で、QATはその低い精度を前提にモデルを学習させることで、より多くの能力を保ちます。
Q4は4ビット量子化を意味し、重みを低精度で保存してファイルサイズとメモリ使用量を減らします。