স্বাভাবিকভাবে প্রতিটি প্যারামিটার ১৬ বিটে (FP16) রাখা হয়। কোয়ান্টাইজেশনে সেগুলো ৮ বা ৪ বিটে রাখা হয় — মডেল ছোট হয়, দ্রুত চলে, মানও সামান্যই কমে।
GGUF, AWQ, GPTQ জনপ্রিয় ৪-বিট ফরম্যাট। চ্যাটবট চালাতে ৪-বিট প্রায়ই যথেষ্ট; সূক্ষ্ম কাজের জন্য ৮-বিট বা FP16 ভালো।
উদাহরণ
Llama 3.1 70B FP16-এ ~১৪০ GB, কিন্তু ৪-বিটে ~৪০ GB — একটি ৮০ GB A100-এ চলে।
In English: Quantization — Storing parameters in fewer bits to shrink a model — 4-bit needs about a quarter of the memory.