← AI শব্দকোষ

কোয়ান্টাইজেশন

প্যারামিটারগুলো কম বিটে লিখে মডেলকে ছোট করা — ৪-বিটে মেমরি প্রায় চার ভাগের এক ভাগ।

স্বাভাবিকভাবে প্রতিটি প্যারামিটার ১৬ বিটে (FP16) রাখা হয়। কোয়ান্টাইজেশনে সেগুলো ৮ বা ৪ বিটে রাখা হয় — মডেল ছোট হয়, দ্রুত চলে, মানও সামান্যই কমে।

GGUF, AWQ, GPTQ জনপ্রিয় ৪-বিট ফরম্যাট। চ্যাটবট চালাতে ৪-বিট প্রায়ই যথেষ্ট; সূক্ষ্ম কাজের জন্য ৮-বিট বা FP16 ভালো।

উদাহরণ

Llama 3.1 70B FP16-এ ~১৪০ GB, কিন্তু ৪-বিটে ~৪০ GB — একটি ৮০ GB A100-এ চলে।

In English: Quantization — Storing parameters in fewer bits to shrink a model — 4-bit needs about a quarter of the memory.

আসল AI কম্পিউটারে চালিয়ে দেখুন

এক মিনিটের মধ্যে JupyterLab চালু হয়। bKash-এ টাকায় পেমেন্ট, মিনিট হিসেবে বিল — যখন খুশি বন্ধ করুন।