Llama 3.1 8B চালাতে কত VRAM লাগে?
Llama 3.1 8B FP16-এ প্রায় ১৭.৭ GB আর ৪-বিটে প্রায় ৬ GB GPU মেমরি প্রয়োজন। নিচে প্রিসিশন বেছে দেখুন কোন ComputeBD AI কম্পিউটারে এটি চলবে আর ঘণ্টায় খরচ কত।
Llama 3.1 8B FP16 / BF16-এ চালাতে প্রায় ১৭.৭ GB GPU মেমরি (VRAM) লাগবে।
- মডেলের ওয়েট ১৫ GB
- কনটেক্সট মেমরি (KV cache) ০.৫ GB
- রানটাইম ও ওয়ার্কস্পেস ২.২ GB
সবচেয়ে সাশ্রয়ী যে AI কম্পিউটারে এটি চলবে: NVIDIA L4 — ৳১৪৭/ঘণ্টা, মিনিট হিসেবে বিল।
| AI কম্পিউটার | চলবে? | গতি (১ জন) | দাম |
|---|---|---|---|
| NVIDIA L4২৪ GB | চলবে |
≈ ১১ টোকেন/সে. | ৳১৪৭/ঘণ্টা |
| NVIDIA A10২৪ GB | চলবে |
≈ ২২ টোকেন/সে. | ৳১৯৬/ঘণ্টা |
| NVIDIA L40S৪৮ GB | চলবে |
≈ ৩২ টোকেন/সে. | ৳৩৪৩/ঘণ্টা |
| NVIDIA A100৮০ GB | চলবে |
≈ ৭৬ টোকেন/সে. | ৳৬৩৮/ঘণ্টা |
| NVIDIA H100৮০ GB | চলবে |
≈ ১২৫ টোকেন/সে. | ৳১,০৪৭/ঘণ্টা |
| NVIDIA H200১৪১ GB | চলবে |
≈ ১৭৯ টোকেন/সে. | ৳১,৩৯০/ঘণ্টা |
| NVIDIA B200১৮০ GB | চলবে |
≈ ২৯৯ টোকেন/সে. | ৳১,৬৫২/ঘণ্টা |
| NVIDIA B300২৮৮ GB | চলবে |
≈ ২৯৯ টোকেন/সে. | ৳১,৮৮০/ঘণ্টা |
প্রতিটি প্রিসিশনে Llama 3.1 8B
| প্রিসিশন | যত GPU মেমরি লাগবে | সবচেয়ে সাশ্রয়ী ComputeBD AI কম্পিউটার |
|---|---|---|
| FP32পূর্ণ প্রিসিশন — খুব কম দরকার হয় | ৩৩.৮ GB | NVIDIA L40S · ৳৩৪৩/ঘণ্টা |
| FP16 / BF16সাধারণ — মূল মান | ১৭.৭ GB | NVIDIA L4 · ৳১৪৭/ঘণ্টা |
| 8-bitমান প্রায় একই থাকে | ১০.১ GB | NVIDIA L4 · ৳১৪৭/ঘণ্টা |
| 4-bit (GGUF / AWQ / GPTQ)মান সামান্য কমে, মেমরি ~৪ গুণ কম | ৬ GB | NVIDIA L4 · ৳১৪৭/ঘণ্টা |
- নির্মাতা
- Meta
- প্যারামিটার
- ৮.০৩B
- সর্বোচ্চ কনটেক্সট
- ১,৩১,০৭২ টোকেন
- LoRA / QLoRA ফাইন-টিউন
- ≈ ১৮.৯ GB / ৮.১ GB
- Hugging Face
- meta-llama/Llama-3.1-8B-Instruct
হিসাবটা যেভাবে করা হয়
- ওয়েট = প্যারামিটার × প্রতি প্যারামিটারের বাইট (FP16 = ২, ৮-বিট ≈ ১, ৪-বিট ≈ ০.৫৬)।
- KV cache (কনটেক্সট মেমরি) কনটেক্সট আর একসাথে ব্যবহারকারীর সংখ্যার সাথে বাড়ে: ২ × লেয়ার × KV-হেড × হেডের আকার × টোকেন × ২ বাইট।
- রানটাইম: CUDA-র জন্য প্রায় ১ GB আর ওয়ার্কস্পেসের জন্য ওয়েটের ~৮%।
- ফাইন-টিউনিং: LoRA-তে মডেলের FP16 কপি থাকে আর ~১% বাড়তি প্যারামিটার ট্রেইন করা হয়; QLoRA-তে ৪-বিট কপি; পুরো ফাইন-টিউনে প্রতি প্যারামিটারে ~১৬ বাইট। Gradient checkpointing ধরে নেওয়া হয়েছে।
- গতি: একজনের জন্য টেক্সট জেনারেশন মেমরি-ব্যান্ডউইথ দ্বারা সীমাবদ্ধ হয়, তাই টোকেন/সেকেন্ড ≈ ব্যান্ডউইথ × ৬০% ÷ মডেলের আকার।
এগুলো আনুমানিক হিসাব, নিশ্চয়তা নয়: আসল সংখ্যা সফটওয়্যার (vLLM, llama.cpp, Transformers…), সেটিং আর ডেটার ওপর নির্ভর করে। ~১০% অতিরিক্ত মেমরি হাতে রাখুন।
মডেল অনুযায়ী VRAM
সাধারণ প্রশ্ন
Llama 3.1 8B চালাতে কত VRAM লাগে?
একজন ব্যবহারকারী আর ৪k কনটেক্সটে FP16-এ (মূল মান) প্রায় ১৭.৭ GB, ৪-বিটে প্রায় ৬ GB।
কোন GPU-তে Llama 3.1 8B চলে?
ফুল প্রিসিশনে (Full precision) এটি NVIDIA L4-এ (২৪ GB) চলবে — ComputeBD-তে ঘণ্টায় ৳১৪৭।
Llama 3.1 8B ফাইন-টিউন করতে কত VRAM লাগে?
LoRA-তে প্রায় ১৮.৯ GB, QLoRA-তে প্রায় ৮.১ GB (sequence length ২,০৪৮, ব্যাচ ১, gradient checkpointing)। সময় ও খরচ জানতে ফাইন-টিউনিং খরচ ক্যালকুলেটর দেখুন।
আসল AI কম্পিউটারে চালিয়ে দেখুন
এক মিনিটের মধ্যে JupyterLab চালু হয়। bKash-এ টাকায় পেমেন্ট, মিনিট হিসেবে বিল — যখন খুশি বন্ধ করুন।