← সব ফ্রি টুলস

এই AI মডেল চালাতে পারব? GPU মেমরি (VRAM) ক্যালকুলেটর

মডেল আর প্রিসিশন বেছে নিন: কত GPU মেমরি লাগবে, কোন ComputeBD AI কম্পিউটারে চলবে, কত দ্রুত চলবে, আর ঘণ্টায় কত টাকা — দেখুন।

কী করতে চান?

Llama 3.1 8B FP16 / BF16-এ চালাতে প্রায় ১৭.৭ GB GPU মেমরি (VRAM) লাগবে।

  • মডেলের ওয়েট ১৫ GB
  • কনটেক্সট মেমরি (KV cache) ০.৫ GB
  • রানটাইম ও ওয়ার্কস্পেস ২.২ GB

সবচেয়ে সাশ্রয়ী যে AI কম্পিউটারে এটি চলবে: NVIDIA L4 — ৳১৪৭/ঘণ্টা, মিনিট হিসেবে বিল।

AI কম্পিউটারচলবে?গতি (১ জন)দাম
NVIDIA L4২৪ GB চলবে
≈ ১১ টোকেন/সে. ৳১৪৭/ঘণ্টা
NVIDIA A10২৪ GB চলবে
≈ ২২ টোকেন/সে. ৳১৯৬/ঘণ্টা
NVIDIA L40S৪৮ GB চলবে
≈ ৩২ টোকেন/সে. ৳৩৪৩/ঘণ্টা
NVIDIA A100৮০ GB চলবে
≈ ৭৬ টোকেন/সে. ৳৬৩৮/ঘণ্টা
NVIDIA H100৮০ GB চলবে
≈ ১২৫ টোকেন/সে. ৳১,০৪৭/ঘণ্টা
NVIDIA H200১৪১ GB চলবে
≈ ১৭৯ টোকেন/সে. ৳১,৩৯০/ঘণ্টা
NVIDIA B200১৮০ GB চলবে
≈ ২৯৯ টোকেন/সে. ৳১,৬৫২/ঘণ্টা
NVIDIA B300২৮৮ GB চলবে
≈ ২৯৯ টোকেন/সে. ৳১,৮৮০/ঘণ্টা

এক নজরে: জনপ্রিয় মডেলে কত GPU মেমরি লাগে

মডেলFP168-bit4-bitLoRA ফাইন-টিউন
Llama 3.1 8B১৭.৭ GB১০.১ GB৬ GB১৮.৯ GB
Llama 3.2 3B৭.৯ GB৪.৯ GB৩.৩ GB৮.৪ GB
Llama 3.1 70B১৪৪.৩ GB৭৭.৭ GB৪২.২ GB১৫৪.১ GB
Qwen2.5 7B১৬.৫ GB৯.৪ GB৫.৫ GB১৮ GB
Qwen2.5 14B৩১.৫ GB১৭.৬ GB১০.১ GB৩৩.৫ GB
Qwen2.5 32B৬৮ GB৩৭.১ GB২০.৬ GB৭২.৪ GB
Qwen2.5 72B১৪৮.৫ GB৭৯.৯ GB৪৩.৪ GB১৫৮.৭ GB
Mistral 7B১৬.১ GB৯.২ GB৫.৬ GB১৭.২ GB
Mixtral 8x7B৯৫.৪ GB৫১.৪ GB২৭.৯ GB১০২.৪ GB
Gemma 2 9B২০.৯ GB১২.২ GB৭.৫ GB২১.৫ GB
Gemma 2 27B৫৭.২ GB৩১.৫ GB১৭.৮ GB৬০.৩ GB
Phi-3.5 mini (3.8B)১০.২ GB৬.৬ GB৪.৭ GB৯.৮ GB

একজন ব্যবহারকারী, ৪k কনটেক্সটে চালানো। প্রতিটি মডেলের আলাদা পাতা দেখতে নামে ক্লিক করুন।

হিসাবটা যেভাবে করা হয়

এগুলো আনুমানিক হিসাব, নিশ্চয়তা নয়: আসল সংখ্যা সফটওয়্যার (vLLM, llama.cpp, Transformers…), সেটিং আর ডেটার ওপর নির্ভর করে। ~১০% অতিরিক্ত মেমরি হাতে রাখুন।

মডেল অনুযায়ী VRAM

সাধারণ প্রশ্ন

Llama 3.1 8B চালাতে কত VRAM লাগে?

FP16-এ প্রায় ১৭.৭ GB, ৪-বিটে ৬ GB — ২৪ GB-র L4-এ ফুল প্রিসিশনে (Full precision) চলে।

৪-বিটে কি মডেলের একুরেসি বা কোয়ালিটি কমে?

সামান্য। চ্যাট আর বেশিরভাগ কাজে পার্থক্য কম, অথচ মেমরি লাগে প্রায় চার ভাগের এক ভাগ। সূক্ষ্ম কাজে (কোড, গণিত, মূল্যায়ন) ৮-বিট বা FP16 ভালো।

বেশি কনটেক্সটে বেশি মেমরি কেন লাগে?

মডেল প্রতিটি টোকেনের জন্য KV cache রাখে। লম্বা ডকুমেন্ট বা একসাথে অনেক ব্যবহারকারী হলে এটি বহু গুণ বাড়ে।

আসল AI কম্পিউটারে চালিয়ে দেখুন

এক মিনিটের মধ্যে JupyterLab চালু হয়। bKash-এ টাকায় পেমেন্ট, মিনিট হিসেবে বিল — যখন খুশি বন্ধ করুন।