একটি নিউরাল নেটওয়ার্ক আসলে কোটি কোটি সংখ্যার সমষ্টি — এগুলোকে প্যারামিটার বা ওয়েট বলে। ট্রেনিংয়ের সময় এই সংখ্যাগুলো একটু একটু করে বদলে মডেল শেখে।
যত বেশি প্যারামিটার, মডেল সাধারণত তত দক্ষ, কিন্তু তত বেশি GPU মেমরি ও সময় লাগে। B মানে বিলিয়ন (১০০ কোটি): 8B = ৮০০ কোটি, 70B = ৭,০০০ কোটি।
উদাহরণ
Llama 3.1 8B-এর প্রায় ৮০৩ কোটি প্যারামিটার; FP16-এ প্রতিটি ২ বাইট, তাই শুধু ওয়েটেই প্রায় ১৫ GB।
In English: Parameter (weight) — The numbers inside a model that are learned during training. “8B” means 8 billion parameters.