본문 바로가기

Inference/Quantization2

Quantization Formats GGUF, AWQ, bitsandbytes, 같은 4비트인데 왜 다 다른가요약양자화에는 방법(GPTQ, AWQ, QAT처럼 "얼마나 잘 줄이나")과 별개로 포맷("어떤 형식으로 저장하고 어디서 실행하나")이라는 축이 따로 있습니다. 실무 배포의 절반은 이 포맷 선택입니다."4비트로 줄였다"와 "GGUF로 저장했다"는 다른 층의 결정입니다. 같은 4비트라도 GGUF, compressed-tensors, bitsandbytes로 저장이 다르고 호환되는 런타임이 다릅니다.핵심 포맷은 다섯입니다. GGUF(로컬, CPU, Mac), compressed-tensors(vLLM 서버), bitsandbytes(transformers 학습과 QLoRA), MXFP4(네이티브 저정밀), MLX(Apple Silicon.. 2026. 8. 9.
Quantization (양자화) 양자화, 정밀도를 깎으면 품질은 얼마나 떨어지나요약양자화는 16비트 실수로 저장하던 가중치와 활성값을 8비트나 4비트 정수, FP8 같은 저정밀 형식으로 바꿔 메모리와 대역폭을 줄이는 압축 기법입니다.효과가 큽니다. 7B 모델을 FP16으로 두면 약 14GB라 소비자 GPU에 안 들어가지만, 4비트로 낮추면 약 3.5GB가 되어 노트북에서도 돕니다.두 축으로 갈립니다. 언제 하느냐(학습 후 PTQ, 학습 중 QAT)와 무엇을 낮추느냐(가중치만, 가중치와 활성 둘 다)입니다.핵심 난제는 활성값의 outlier입니다. LLM.int8부터 SmoothQuant, AWQ, GPTQ, 회전 기반 기법까지 전부 이 문제 하나를 푸는 계보입니다.흔한 오해 하나. 비트를 줄인다고 항상 빨라지지 않습니다. 가중치만 양자.. 2025. 2. 13.