ট্রেনিংয়ে মডেল শেখে; ইনফারেন্সে সেই শেখা মডেল ব্যবহার করা হয়। চ্যাটবটে প্রশ্ন করা, ছবি বানানো, অডিও থেকে লেখা বের করা — সবই ইনফারেন্স।
ইনফারেন্সে ট্রেনিংয়ের চেয়ে অনেক কম মেমরি ও শক্তি লাগে। সাধারণত মডেল ঠিকমতো মেমরিতে ধরলেই হয়; গতি নির্ভর করে GPU-র মেমরি-ব্যান্ডউইথের ওপর।
উদাহরণ
নিজের ওয়েবসাইটের চ্যাটবটের জন্য Llama 3.1 8B চালানো — এটি ইনফারেন্স।
In English: Inference — Using a trained model to do work — answering a question, generating an image.