Qwen2.5 32B চালাতে কত VRAM লাগে?
Qwen2.5 32B FP16-এ প্রায় ৬৮ GB আর ৪-বিটে প্রায় ২০.৬ GB GPU মেমরি প্রয়োজন। নিচে প্রিসিশন বেছে দেখুন কোন ComputeBD AI কম্পিউটারে এটি চলবে আর ঘণ্টায় খরচ কত।
Qwen2.5 32B FP16 / BF16-এ চালাতে প্রায় ৬৮ GB GPU মেমরি (VRAM) লাগবে।
- মডেলের ওয়েট ৬১.১ GB
- কনটেক্সট মেমরি (KV cache) ১ GB
- রানটাইম ও ওয়ার্কস্পেস ৫.৯ GB
সবচেয়ে সাশ্রয়ী যে AI কম্পিউটারে এটি চলবে: NVIDIA A100 — ৳৬৩৮/ঘণ্টা, মিনিট হিসেবে বিল।
| AI কম্পিউটার | চলবে? | গতি (১ জন) | দাম |
|---|---|---|---|
| NVIDIA L4২৪ GB | চলবে না |
≈ ৩ টোকেন/সে. | ৳১৪৭/ঘণ্টা |
| NVIDIA A10২৪ GB | চলবে না |
≈ ৫ টোকেন/সে. | ৳১৯৬/ঘণ্টা |
| NVIDIA L40S৪৮ GB | চলবে না |
≈ ৮ টোকেন/সে. | ৳৩৪৩/ঘণ্টা |
| NVIDIA A100৮০ GB | চলবে |
≈ ১৯ টোকেন/সে. | ৳৬৩৮/ঘণ্টা |
| NVIDIA H100৮০ GB | চলবে |
≈ ৩১ টোকেন/সে. | ৳১,০৪৭/ঘণ্টা |
| NVIDIA H200১৪১ GB | চলবে |
≈ ৪৪ টোকেন/সে. | ৳১,৩৯০/ঘণ্টা |
| NVIDIA B200১৮০ GB | চলবে |
≈ ৭৩ টোকেন/সে. | ৳১,৬৫২/ঘণ্টা |
| NVIDIA B300২৮৮ GB | চলবে |
≈ ৭৩ টোকেন/সে. | ৳১,৮৮০/ঘণ্টা |
প্রতিটি প্রিসিশনে Qwen2.5 32B
| প্রিসিশন | যত GPU মেমরি লাগবে | সবচেয়ে সাশ্রয়ী ComputeBD AI কম্পিউটার |
|---|---|---|
| FP32পূর্ণ প্রিসিশন — খুব কম দরকার হয় | ১৩৪ GB | NVIDIA B200 · ৳১,৬৫২/ঘণ্টা |
| FP16 / BF16সাধারণ — মূল মান | ৬৮ GB | NVIDIA A100 · ৳৬৩৮/ঘণ্টা |
| 8-bitমান প্রায় একই থাকে | ৩৭.১ GB | NVIDIA L40S · ৳৩৪৩/ঘণ্টা |
| 4-bit (GGUF / AWQ / GPTQ)মান সামান্য কমে, মেমরি ~৪ গুণ কম | ২০.৬ GB | NVIDIA L4 · ৳১৪৭/ঘণ্টা |
- নির্মাতা
- Alibaba Qwen
- প্যারামিটার
- ৩২.৮B
- সর্বোচ্চ কনটেক্সট
- ১,৩১,০৭২ টোকেন
- LoRA / QLoRA ফাইন-টিউন
- ≈ ৭২.৪ GB / ২৮.৫ GB
- Hugging Face
- Qwen/Qwen2.5-32B-Instruct
হিসাবটা যেভাবে করা হয়
- ওয়েট = প্যারামিটার × প্রতি প্যারামিটারের বাইট (FP16 = ২, ৮-বিট ≈ ১, ৪-বিট ≈ ০.৫৬)।
- KV cache (কনটেক্সট মেমরি) কনটেক্সট আর একসাথে ব্যবহারকারীর সংখ্যার সাথে বাড়ে: ২ × লেয়ার × KV-হেড × হেডের আকার × টোকেন × ২ বাইট।
- রানটাইম: CUDA-র জন্য প্রায় ১ GB আর ওয়ার্কস্পেসের জন্য ওয়েটের ~৮%।
- ফাইন-টিউনিং: LoRA-তে মডেলের FP16 কপি থাকে আর ~১% বাড়তি প্যারামিটার ট্রেইন করা হয়; QLoRA-তে ৪-বিট কপি; পুরো ফাইন-টিউনে প্রতি প্যারামিটারে ~১৬ বাইট। Gradient checkpointing ধরে নেওয়া হয়েছে।
- গতি: একজনের জন্য টেক্সট জেনারেশন মেমরি-ব্যান্ডউইথ দ্বারা সীমাবদ্ধ হয়, তাই টোকেন/সেকেন্ড ≈ ব্যান্ডউইথ × ৬০% ÷ মডেলের আকার।
এগুলো আনুমানিক হিসাব, নিশ্চয়তা নয়: আসল সংখ্যা সফটওয়্যার (vLLM, llama.cpp, Transformers…), সেটিং আর ডেটার ওপর নির্ভর করে। ~১০% অতিরিক্ত মেমরি হাতে রাখুন।
মডেল অনুযায়ী VRAM
সাধারণ প্রশ্ন
Qwen2.5 32B চালাতে কত VRAM লাগে?
একজন ব্যবহারকারী আর ৪k কনটেক্সটে FP16-এ (মূল মান) প্রায় ৬৮ GB, ৪-বিটে প্রায় ২০.৬ GB।
কোন GPU-তে Qwen2.5 32B চলে?
ফুল প্রিসিশনে (Full precision) এটি NVIDIA A100-এ (৮০ GB) চলবে — ComputeBD-তে ঘণ্টায় ৳৬৩৮।
Qwen2.5 32B ফাইন-টিউন করতে কত VRAM লাগে?
LoRA-তে প্রায় ৭২.৪ GB, QLoRA-তে প্রায় ২৮.৫ GB (sequence length ২,০৪৮, ব্যাচ ১, gradient checkpointing)। সময় ও খরচ জানতে ফাইন-টিউনিং খরচ ক্যালকুলেটর দেখুন।
আসল AI কম্পিউটারে চালিয়ে দেখুন
এক মিনিটের মধ্যে JupyterLab চালু হয়। bKash-এ টাকায় পেমেন্ট, মিনিট হিসেবে বিল — যখন খুশি বন্ধ করুন।