Phi-3.5 mini (3.8B) চালাতে কত VRAM লাগে?
Phi-3.5 mini (3.8B) FP16-এ প্রায় ১০.২ GB আর ৪-বিটে প্রায় ৪.৭ GB GPU মেমরি প্রয়োজন। নিচে প্রিসিশন বেছে দেখুন কোন ComputeBD AI কম্পিউটারে এটি চলবে আর ঘণ্টায় খরচ কত।
Phi-3.5 mini (3.8B) FP16 / BF16-এ চালাতে প্রায় ১০.২ GB GPU মেমরি (VRAM) লাগবে।
- মডেলের ওয়েট ৭.১ GB
- কনটেক্সট মেমরি (KV cache) ১.৫ GB
- রানটাইম ও ওয়ার্কস্পেস ১.৬ GB
সবচেয়ে সাশ্রয়ী যে AI কম্পিউটারে এটি চলবে: NVIDIA L4 — ৳১৪৭/ঘণ্টা, মিনিট হিসেবে বিল।
| AI কম্পিউটার | চলবে? | গতি (১ জন) | দাম |
|---|---|---|---|
| NVIDIA L4২৪ GB | চলবে |
≈ ২৪ টোকেন/সে. | ৳১৪৭/ঘণ্টা |
| NVIDIA A10২৪ GB | চলবে |
≈ ৪৭ টোকেন/সে. | ৳১৯৬/ঘণ্টা |
| NVIDIA L40S৪৮ GB | চলবে |
≈ ৬৮ টোকেন/সে. | ৳৩৪৩/ঘণ্টা |
| NVIDIA A100৮০ GB | চলবে |
≈ ১৬০ টোকেন/সে. | ৳৬৩৮/ঘণ্টা |
| NVIDIA H100৮০ GB | চলবে |
≈ ২৬৩ টোকেন/সে. | ৳১,০৪৭/ঘণ্টা |
| NVIDIA H200১৪১ GB | চলবে |
≈ ৩৭৭ টোকেন/সে. | ৳১,৩৯০/ঘণ্টা |
| NVIDIA B200১৮০ GB | চলবে |
≈ ৬২৮ টোকেন/সে. | ৳১,৬৫২/ঘণ্টা |
| NVIDIA B300২৮৮ GB | চলবে |
≈ ৬২৮ টোকেন/সে. | ৳১,৮৮০/ঘণ্টা |
প্রতিটি প্রিসিশনে Phi-3.5 mini (3.8B)
| প্রিসিশন | যত GPU মেমরি লাগবে | সবচেয়ে সাশ্রয়ী ComputeBD AI কম্পিউটার |
|---|---|---|
| FP32পূর্ণ প্রিসিশন — খুব কম দরকার হয় | ১৭.৯ GB | NVIDIA L4 · ৳১৪৭/ঘণ্টা |
| FP16 / BF16সাধারণ — মূল মান | ১০.২ GB | NVIDIA L4 · ৳১৪৭/ঘণ্টা |
| 8-bitমান প্রায় একই থাকে | ৬.৬ GB | NVIDIA L4 · ৳১৪৭/ঘণ্টা |
| 4-bit (GGUF / AWQ / GPTQ)মান সামান্য কমে, মেমরি ~৪ গুণ কম | ৪.৭ GB | NVIDIA L4 · ৳১৪৭/ঘণ্টা |
- নির্মাতা
- Microsoft
- প্যারামিটার
- ৩.৮২B
- সর্বোচ্চ কনটেক্সট
- ১,৩১,০৭২ টোকেন
- LoRA / QLoRA ফাইন-টিউন
- ≈ ৯.৮ GB / ৪.৬ GB
- Hugging Face
- microsoft/Phi-3.5-mini-instruct
হিসাবটা যেভাবে করা হয়
- ওয়েট = প্যারামিটার × প্রতি প্যারামিটারের বাইট (FP16 = ২, ৮-বিট ≈ ১, ৪-বিট ≈ ০.৫৬)।
- KV cache (কনটেক্সট মেমরি) কনটেক্সট আর একসাথে ব্যবহারকারীর সংখ্যার সাথে বাড়ে: ২ × লেয়ার × KV-হেড × হেডের আকার × টোকেন × ২ বাইট।
- রানটাইম: CUDA-র জন্য প্রায় ১ GB আর ওয়ার্কস্পেসের জন্য ওয়েটের ~৮%।
- ফাইন-টিউনিং: LoRA-তে মডেলের FP16 কপি থাকে আর ~১% বাড়তি প্যারামিটার ট্রেইন করা হয়; QLoRA-তে ৪-বিট কপি; পুরো ফাইন-টিউনে প্রতি প্যারামিটারে ~১৬ বাইট। Gradient checkpointing ধরে নেওয়া হয়েছে।
- গতি: একজনের জন্য টেক্সট জেনারেশন মেমরি-ব্যান্ডউইথ দ্বারা সীমাবদ্ধ হয়, তাই টোকেন/সেকেন্ড ≈ ব্যান্ডউইথ × ৬০% ÷ মডেলের আকার।
এগুলো আনুমানিক হিসাব, নিশ্চয়তা নয়: আসল সংখ্যা সফটওয়্যার (vLLM, llama.cpp, Transformers…), সেটিং আর ডেটার ওপর নির্ভর করে। ~১০% অতিরিক্ত মেমরি হাতে রাখুন।
মডেল অনুযায়ী VRAM
সাধারণ প্রশ্ন
Phi-3.5 mini (3.8B) চালাতে কত VRAM লাগে?
একজন ব্যবহারকারী আর ৪k কনটেক্সটে FP16-এ (মূল মান) প্রায় ১০.২ GB, ৪-বিটে প্রায় ৪.৭ GB।
কোন GPU-তে Phi-3.5 mini (3.8B) চলে?
ফুল প্রিসিশনে (Full precision) এটি NVIDIA L4-এ (২৪ GB) চলবে — ComputeBD-তে ঘণ্টায় ৳১৪৭।
Phi-3.5 mini (3.8B) ফাইন-টিউন করতে কত VRAM লাগে?
LoRA-তে প্রায় ৯.৮ GB, QLoRA-তে প্রায় ৪.৬ GB (sequence length ২,০৪৮, ব্যাচ ১, gradient checkpointing)। সময় ও খরচ জানতে ফাইন-টিউনিং খরচ ক্যালকুলেটর দেখুন।
আসল AI কম্পিউটারে চালিয়ে দেখুন
এক মিনিটের মধ্যে JupyterLab চালু হয়। bKash-এ টাকায় পেমেন্ট, মিনিট হিসেবে বিল — যখন খুশি বন্ধ করুন।