양자화 비주얼 가이드 — Maarten Grootendorst가 그림으로 푸는 LLM 경량화

Maarten Grootendorst가 Exploring Language Models 뉴스레터에 공개한 A Visual Guide to Quantization은 LLM 양자화의 직관을 50여 장의 커스텀 비주얼로 풀어낸 글입니다. 이 글은 그 핵심을 한국어로 정리합니다 — 숫자 표현의 기초부터 FP32→INT4의 매핑 수학, GPTQ·GGUF의 작동 원리, 그리고 1-bit/1.58-bit BitNet까지. 원문: A Visual Guide to Quantization — Maarten Grootendorst TL;DR 요약 문제: 70B 모델을 FP32(full-precision)로 로딩하면 약 280GB. 비트 수가 많을수록 표현 범위(dynamic range)와 인접 값 간 거리(precision)가 동시에 커진다. 데이터 타입: FP32 → FP16(범위 좁음) → BF16(FP16과 같은 16비트지만 FP32 수준 범위, 딥러닝 표준) → INT8(1/4 비트, 정수 연산) → INT4까지. 매핑 방식: Symmetric(absmax) 은 0 중심 대칭, Asymmetric(zero-point) 는 zero-point z를 두고 비대칭 매핑. Outlier 처리에는 clipping이 필요하고, 범위 선택은 calibration(percentile/MSE/KL)으로 결정한다. PTQ vs QAT: PTQ는 학습 후 양자화(빠르고 단순), QAT는 학습 중 fake quant로 양자화 노이즈를 학습 → INT4 같은 저비트 영역에서 PTQ보다 우월. 4-bit 영역: GPTQ는 inverse-Hessian으로 weight 중요도를 가중해 양자화 오차를 분배(GPU). GGUF는 super/sub 블록의 이중 스케일 양자화로 CPU 오프로딩을 가능하게 한다(llama.cpp). 1-bit 시대: BitNet은 weights를 {-1, 1}로, BitNet b1.58은 {-1, 0, 1} ternary로. 0의 추가가 곱셈을 덧셈으로 환원하고 feature filtering을 가능하게 한다 — “13B BitNet b1.58은 3B FP16 LLM보다 효율적”. Part 1. LLM의 “문제점” LLM은 수십억 개 파라미터(주로 weights)와 추론 중 만들어지는 activations로 구성됩니다. 가능한 적은 비트로 값을 표현해야 메모리와 연산 비용을 줄일 수 있습니다. ...

April 28, 2026 · 7 min