양자화 비주얼 가이드 — Maarten Grootendorst가 그림으로 푸는 LLM 경량화

Maarten Grootendorst가 Exploring Language Models 뉴스레터에 공개한 A Visual Guide to Quantization은 LLM 양자화의 직관을 50여 장의 커스텀 비주얼로 풀어낸 글입니다. 이 글은 그 핵심을 한국어로 정리합니다 — 숫자 표현의 기초부터 FP32→INT4의 매핑 수학, GPTQ·GGUF의 작동 원리, 그리고 1-bit/1.58-bit BitNet까지. 원문: A Visual Guide to Quantization — Maarten Grootendorst TL;DR 요약 문제: 70B 모델을 FP32(full-precision)로 로딩하면 약 280GB. 비트 수가 많을수록 표현 범위(dynamic range)와 인접 값 간 거리(precision)가 동시에 커진다. 데이터 타입: FP32 → FP16(범위 좁음) → BF16(FP16과 같은 16비트지만 FP32 수준 범위, 딥러닝 표준) → INT8(1/4 비트, 정수 연산) → INT4까지. 매핑 방식: Symmetric(absmax) 은 0 중심 대칭, Asymmetric(zero-point) 는 zero-point z를 두고 비대칭 매핑. Outlier 처리에는 clipping이 필요하고, 범위 선택은 calibration(percentile/MSE/KL)으로 결정한다. PTQ vs QAT: PTQ는 학습 후 양자화(빠르고 단순), QAT는 학습 중 fake quant로 양자화 노이즈를 학습 → INT4 같은 저비트 영역에서 PTQ보다 우월. 4-bit 영역: GPTQ는 inverse-Hessian으로 weight 중요도를 가중해 양자화 오차를 분배(GPU). GGUF는 super/sub 블록의 이중 스케일 양자화로 CPU 오프로딩을 가능하게 한다(llama.cpp). 1-bit 시대: BitNet은 weights를 {-1, 1}로, BitNet b1.58은 {-1, 0, 1} ternary로. 0의 추가가 곱셈을 덧셈으로 환원하고 feature filtering을 가능하게 한다 — “13B BitNet b1.58은 3B FP16 LLM보다 효율적”. Part 1. LLM의 “문제점” LLM은 수십억 개 파라미터(주로 weights)와 추론 중 만들어지는 activations로 구성됩니다. 가능한 적은 비트로 값을 표현해야 메모리와 연산 비용을 줄일 수 있습니다. ...

April 28, 2026 · 7 min

LLM의 양자화(Quantization): 기초부터 실전까지

출처: https://ngrok.com/blog/quantization 주요 주제 이 글은 대형 언어 모델(LLM)의 양자화(Quantization) 를 기초부터 자세히 설명합니다. LLM이 너무 커서 일반 PC나 노트북에서 돌리기 어려운 문제를 해결하기 위해, 모델 크기를 줄이면서도 성능을 최대한 유지하는 방법을 다룹니다. 독자가 로컬 환경에서 강력한 LLM을 실제로 실행할 수 있도록 돕는 것이 목적입니다. 왜 양자화가 중요한가? 최신 LLM은 수십억~수조 개의 매개변수(Weights) 를 가짐 → 예: 80B 모델 = 약 159GB (float32 기준) 1T(조) 매개변수 모델은 2TB RAM 이 필요해 단일 머신에서 거의 불가능 양자화로 모델을 4배 작게 , 최대 2배 빠르게 만들 수 있음 (정확도 손실은 5~10% 수준) 핵심 개념 양자화(Quantization) : 고정밀 부동소수점(float32 등)을 낮은 비트(8비트, 4비트 등)로 변환하는 손실 압축 기법 부동소수점 비교: float32: 32비트 (높은 정확도, 큰 메모리) bfloat16 / float16: 16비트 (메모리 절반) 8비트, 4비트: 더 극단적 압축 LLM 매개변수는 대부분 0 근처 에 몰려 있지만, 소수의 아웃라이어(Outliers) 가 존재해 양자화 시 주의가 필요합니다. ...

March 29, 2026 · 2 min