QLoRA-তে মূল মডেলটি ৪-বিটে কোয়ান্টাইজ করে রাখা হয়, তারপর LoRA অ্যাডাপ্টার শেখানো হয়। এতে মেমরি LoRA-র চেয়েও প্রায় তিন-চার গুণ কমে যায়।
দাম হলো গতি: প্রতিটি ধাপ একটু ধীর (প্রায় ২০–৩০%)। বড় মডেল ছোট GPU-তে শেখাতে এটাই সবচেয়ে কাজের উপায়।
উদাহরণ
Qwen2.5 32B-এর QLoRA ফাইন-টিউন একটি ৪৮ GB-র L40S-এ সম্ভব।
In English: QLoRA — LoRA on top of a 4-bit compressed base model — fine-tuning with the least memory.