quantization양자화
quantization은 AI 모델의 가중치를 더 적은 비트의 숫자로 바꿔 모델의 크기와 메모리 사용량을 줄이는 기법이다.
기사 1편
최근 언급 quantization은 보통 16비트나 32비트 부동소수점으로 저장한 가중치를 8비트, 4비트, 2비트 같은 낮은 정밀도로 바꾼다. 적은 메모리로 큰 모델을 실행할 수 있고 속도가 빨라지기도 하지만, 비트 수를 줄일수록 출력 품질이 떨어질 수 있다. 대규모 언어 모델을 개인용 컴퓨터에서 돌리는 로컬 LLM에서 널리 쓰인다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.