এই AI মডেল চালাতে পারব? GPU মেমরি (VRAM) ক্যালকুলেটর
মডেল আর প্রিসিশন বেছে নিন: কত GPU মেমরি লাগবে, কোন ComputeBD AI কম্পিউটারে চলবে, কত দ্রুত চলবে, আর ঘণ্টায় কত টাকা — দেখুন।
Llama 3.1 8B FP16 / BF16-এ চালাতে প্রায় ১৭.৭ GB GPU মেমরি (VRAM) লাগবে।
- মডেলের ওয়েট ১৫ GB
- কনটেক্সট মেমরি (KV cache) ০.৫ GB
- রানটাইম ও ওয়ার্কস্পেস ২.২ GB
সবচেয়ে সাশ্রয়ী যে AI কম্পিউটারে এটি চলবে: NVIDIA L4 — ৳১৪৭/ঘণ্টা, মিনিট হিসেবে বিল।
| AI কম্পিউটার | চলবে? | গতি (১ জন) | দাম |
|---|---|---|---|
| NVIDIA L4২৪ GB | চলবে |
≈ ১১ টোকেন/সে. | ৳১৪৭/ঘণ্টা |
| NVIDIA A10২৪ GB | চলবে |
≈ ২২ টোকেন/সে. | ৳১৯৬/ঘণ্টা |
| NVIDIA L40S৪৮ GB | চলবে |
≈ ৩২ টোকেন/সে. | ৳৩৪৩/ঘণ্টা |
| NVIDIA A100৮০ GB | চলবে |
≈ ৭৬ টোকেন/সে. | ৳৬৩৮/ঘণ্টা |
| NVIDIA H100৮০ GB | চলবে |
≈ ১২৫ টোকেন/সে. | ৳১,০৪৭/ঘণ্টা |
| NVIDIA H200১৪১ GB | চলবে |
≈ ১৭৯ টোকেন/সে. | ৳১,৩৯০/ঘণ্টা |
| NVIDIA B200১৮০ GB | চলবে |
≈ ২৯৯ টোকেন/সে. | ৳১,৬৫২/ঘণ্টা |
| NVIDIA B300২৮৮ GB | চলবে |
≈ ২৯৯ টোকেন/সে. | ৳১,৮৮০/ঘণ্টা |
এক নজরে: জনপ্রিয় মডেলে কত GPU মেমরি লাগে
| মডেল | FP16 | 8-bit | 4-bit | LoRA ফাইন-টিউন |
|---|---|---|---|---|
| Llama 3.1 8B | ১৭.৭ GB | ১০.১ GB | ৬ GB | ১৮.৯ GB |
| Llama 3.2 3B | ৭.৯ GB | ৪.৯ GB | ৩.৩ GB | ৮.৪ GB |
| Llama 3.1 70B | ১৪৪.৩ GB | ৭৭.৭ GB | ৪২.২ GB | ১৫৪.১ GB |
| Qwen2.5 7B | ১৬.৫ GB | ৯.৪ GB | ৫.৫ GB | ১৮ GB |
| Qwen2.5 14B | ৩১.৫ GB | ১৭.৬ GB | ১০.১ GB | ৩৩.৫ GB |
| Qwen2.5 32B | ৬৮ GB | ৩৭.১ GB | ২০.৬ GB | ৭২.৪ GB |
| Qwen2.5 72B | ১৪৮.৫ GB | ৭৯.৯ GB | ৪৩.৪ GB | ১৫৮.৭ GB |
| Mistral 7B | ১৬.১ GB | ৯.২ GB | ৫.৬ GB | ১৭.২ GB |
| Mixtral 8x7B | ৯৫.৪ GB | ৫১.৪ GB | ২৭.৯ GB | ১০২.৪ GB |
| Gemma 2 9B | ২০.৯ GB | ১২.২ GB | ৭.৫ GB | ২১.৫ GB |
| Gemma 2 27B | ৫৭.২ GB | ৩১.৫ GB | ১৭.৮ GB | ৬০.৩ GB |
| Phi-3.5 mini (3.8B) | ১০.২ GB | ৬.৬ GB | ৪.৭ GB | ৯.৮ GB |
একজন ব্যবহারকারী, ৪k কনটেক্সটে চালানো। প্রতিটি মডেলের আলাদা পাতা দেখতে নামে ক্লিক করুন।
হিসাবটা যেভাবে করা হয়
- ওয়েট = প্যারামিটার × প্রতি প্যারামিটারের বাইট (FP16 = ২, ৮-বিট ≈ ১, ৪-বিট ≈ ০.৫৬)।
- KV cache (কনটেক্সট মেমরি) কনটেক্সট আর একসাথে ব্যবহারকারীর সংখ্যার সাথে বাড়ে: ২ × লেয়ার × KV-হেড × হেডের আকার × টোকেন × ২ বাইট।
- রানটাইম: CUDA-র জন্য প্রায় ১ GB আর ওয়ার্কস্পেসের জন্য ওয়েটের ~৮%।
- ফাইন-টিউনিং: LoRA-তে মডেলের FP16 কপি থাকে আর ~১% বাড়তি প্যারামিটার ট্রেইন করা হয়; QLoRA-তে ৪-বিট কপি; পুরো ফাইন-টিউনে প্রতি প্যারামিটারে ~১৬ বাইট। Gradient checkpointing ধরে নেওয়া হয়েছে।
- গতি: একজনের জন্য টেক্সট জেনারেশন মেমরি-ব্যান্ডউইথ দ্বারা সীমাবদ্ধ হয়, তাই টোকেন/সেকেন্ড ≈ ব্যান্ডউইথ × ৬০% ÷ মডেলের আকার।
এগুলো আনুমানিক হিসাব, নিশ্চয়তা নয়: আসল সংখ্যা সফটওয়্যার (vLLM, llama.cpp, Transformers…), সেটিং আর ডেটার ওপর নির্ভর করে। ~১০% অতিরিক্ত মেমরি হাতে রাখুন।
মডেল অনুযায়ী VRAM
সাধারণ প্রশ্ন
Llama 3.1 8B চালাতে কত VRAM লাগে?
FP16-এ প্রায় ১৭.৭ GB, ৪-বিটে ৬ GB — ২৪ GB-র L4-এ ফুল প্রিসিশনে (Full precision) চলে।
৪-বিটে কি মডেলের একুরেসি বা কোয়ালিটি কমে?
সামান্য। চ্যাট আর বেশিরভাগ কাজে পার্থক্য কম, অথচ মেমরি লাগে প্রায় চার ভাগের এক ভাগ। সূক্ষ্ম কাজে (কোড, গণিত, মূল্যায়ন) ৮-বিট বা FP16 ভালো।
বেশি কনটেক্সটে বেশি মেমরি কেন লাগে?
মডেল প্রতিটি টোকেনের জন্য KV cache রাখে। লম্বা ডকুমেন্ট বা একসাথে অনেক ব্যবহারকারী হলে এটি বহু গুণ বাড়ে।
আসল AI কম্পিউটারে চালিয়ে দেখুন
এক মিনিটের মধ্যে JupyterLab চালু হয়। bKash-এ টাকায় পেমেন্ট, মিনিট হিসেবে বিল — যখন খুশি বন্ধ করুন।