LLM সরাসরি অক্ষর বা শব্দ পড়ে না; লেখাকে টোকেনে ভাগ করে। ইংরেজিতে একটি টোকেন মোটামুটি ৪টি অক্ষর বা শব্দের তিন-চতুর্থাংশ।
বাংলার জন্য বেশিরভাগ মডেলে একই কথা লিখতে অনেক বেশি টোকেন লাগে — কোনো কোনো টোকেনাইজারে ইংরেজির ছয় গুণ পর্যন্ত। AI API-র বিল আর মডেলের মেমরি-সীমা টোকেনে মাপা হয়, তাই বাংলায় খরচ বেশি পড়ে।
উদাহরণ
“আমি বাংলায় কথা বলি।” GPT-4-এর টোকেনাইজারে ২৭ টোকেন, অথচ “I speak Bangla.” মাত্র ৫।
In English: Token — The small pieces an LLM splits text into. Both price and limits are measured in tokens.