Token (LLM) (BN)
টোকেন (token) — সর্বনিম্ন পাঠ্য একক যা বৃহৎ ভাষা মডেলগুলো (LLM) প্রক্রিয়া করতে সক্ষম। LLM দ্বারা প্রক্রিয়াকরণের আগে যেকোনো পাঠ্যকে প্রথমে টোকেনের একটি ক্রমে রূপান্তরিত করা হয়, যা পরে মডেলের বিশ্লেষণ ও প্রক্রিয়াকরণের জন্য উপযুক্ত সংখ্যাসূচক উপস্থাপনায় পরিণত হয়।
ব্যবহৃত টোকেনাইজেশন কৌশলের উপর নির্ভর করে, একটি টোকেন হতে পারে:
- সম্পূর্ণ শব্দ (যেমন, "বাড়ি")
- শব্দের অংশ বা মূল (যেমন, "বাড়" শব্দে "বাড়ি")
- একক অক্ষর বা বিরামচিহ্ন (যেমন, ",", "!")
টোকেনের ব্যবহার ভাষা মডেলগুলোকে পাঠ্যের কাঠামো কার্যকরভাবে শিখতে ও পুনরুৎপাদন করতে, নিয়মিততা চিহ্নিত করতে, এবং পাঠ্যের অর্থতত্ত্ব ও বাক্যগঠন বুঝতে সক্ষম করে।
প্রসেস অফ টোকেনাইজেশন - টোকেনাইজেশন প্রক্রিয়া
টোকেনাইজেশন (tokenization) — এটি মূল পাঠ্যকে টোকেনে বিভক্ত করার এবং পরবর্তীতে সেগুলোকে মডেলের বোধগম্য সংখ্যাসূচক শনাক্তকারীতে রূপান্তরিত করার প্রক্রিয়া।
এই পর্যায়টি বৃহৎ ভাষা মডেলগুলোর কার্যকারিতার জন্য বাধ্যতামূলক ও মৌলিক। এর মাধ্যমে LLM সক্ষম হয়:
- বাক্যগঠন বিশ্লেষণ করতে — পাঠ্যের কাঠামো এবং উপাদানগুলোর (শব্দ ও বাক্যাংশ) অবস্থান;
- অর্থতত্ত্ব উদ্ধার করতে — পাঠ্যের গভীর অর্থ এবং উপাদানগুলোর মধ্যে পারস্পরিক সম্পর্ক।
টোকেনাইজেশনের বেশ কয়েকটি প্রধান পদ্ধতি রয়েছে, যার মধ্যে উল্লেখযোগ্য:
- Byte Pair Encoding (BPE): একটি অ্যালগরিদম যা পুনরাবৃত্তিমূলকভাবে সবচেয়ে ঘন ঘন আসা অক্ষর জোড়াগুলোকে নতুন টোকেন দিয়ে প্রতিস্থাপন করে, যা বিরল শব্দ এবং রূপতাত্ত্বিক বৈচিত্র্য কার্যকরভাবে প্রক্রিয়া করতে সহায়তা করে।
- WordPiece: BERT মডেলে ব্যবহৃত হয় এবং শব্দগুলোকে উপশব্দ এককে বিভক্ত করে, যা অজানা শব্দ প্রক্রিয়াকরণে সহায়তা করে।
- SentencePiece: একটি পদ্ধতি যা পাঠ্যকে অক্ষরের ক্রম হিসেবে বিবেচনা করে এবং টোকেনাইজেশনের জন্য BPE বা Unigram ভিত্তিক মডেল প্রয়োগ করে।
টোকেনাইজেশন পদ্ধতির পছন্দ মডেলের কর্মক্ষমতা, বিভিন্ন ভাষা প্রক্রিয়া করার ক্ষমতা এবং প্রশিক্ষণের দক্ষতাকে প্রভাবিত করে।
বিশেষ টোকেন
মূল টোকেনগুলো ছাড়াও, মডেলগুলো পাঠ্যের কার্যকরী উপাদান চিহ্নিত করার জন্য বিশেষ টোকেনও ব্যবহার করে, যেমন:
[CLS](class) — ক্রমের শুরুর টোকেন, প্রায়শই পাঠ্য শ্রেণিবিন্যাসের কাজে ব্যবহৃত হয়;[SEP](separator) — পাঠ্যের বিভিন্ন অংশ পৃথক করে (যেমন, প্রশ্ন ও উত্তর, বাক্য বা অনুচ্ছেদ);[MASK]— একটি বিশেষ টোকেন যা এমন শব্দ চিহ্নিত করে যা মডেলকে পূর্বাভাস দিতে হবে (BERT এবং অন্যান্য masked-language মডেলে ব্যবহৃত হয়);[PAD](padding) — দৈর্ঘ্য অনুযায়ী পাঠ্য সমান করতে ব্যবহৃত হয়।
এই বিশেষ টোকেনগুলো মডেলগুলোকে প্রক্রিয়াকৃত পাঠ্যের কাঠামো ও প্রসঙ্গ আরো সঠিকভাবে উপলব্ধি করতে সহায়তা করে।
টোকেন এবং কনটেক্সট উইন্ডো
কনটেক্সট উইন্ডো (context window) — এটি সর্বোচ্চ সংখ্যক টোকেন যা মডেলটি পাঠ্য তৈরির সময় একসাথে বিবেচনা ও প্রক্রিয়া করতে সক্ষম।
উদাহরণস্বরূপ, GPT-3 মডেলের কনটেক্সট উইন্ডোর আকার ২০৪৮ টোকেন। এর অর্থ হলো পাঠ্য তৈরির সময় মডেলটি একসাথে সর্বোচ্চ ২০৪৮ টোকেনে থাকা তথ্য বিবেচনা করতে পারে। কনটেক্সট উইন্ডোর আকার প্রভাবিত করে:
- মডেলের জন্য উপলব্ধ সর্বোচ্চ তথ্যের পরিমাণ;
- উৎপন্ন উত্তরের গুণমান ও অর্থবহতা;
- দীর্ঘ পাঠ্য উপলব্ধি করার এবং টোকেনের মধ্যে দীর্ঘ দূরত্বে প্রসঙ্গ ধরে রাখার মডেলের ক্ষমতা।
সাহিত্য
- Sennrich, R.; Haddow, B.; Birch, A. (2016). Neural Machine Translation of Rare Words with Subword Units. arXiv:1508.07909.
- Kudo, T.; Richardson, J. (2018). SentencePiece: A Simple and Language-Independent Subword Tokenizer and Detokenizer for Neural Text Processing. arXiv:1808.06226.
- Kudo, T. (2018). Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates. arXiv:1804.10959.
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- Song, X. et al. (2021). Fast WordPiece Tokenization. *EMNLP 2021*. ACL Anthology.
- Mielke, S. J.; Dalmia, S.; Cotterell, R. (2021). A Brief History of Open-Vocabulary Modeling and Tokenization in NLP. arXiv:2112.10508.
- Xue, J. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
- Limisiewicz, T.; Balhar, J.; Mareček, D. (2023). Tokenization Impacts Multilingual Language Modeling: Assessing Vocabulary Allocation and Overlap Across Languages. arXiv:2305.17179.
- Pourmostafa Roshan Sharami, J.; Shterionov, D.; Spronck, P. (2023). A Systematic Analysis of Vocabulary and BPE Settings for Optimal Fine-tuning of NMT. arXiv:2303.00722.
- Batsuren, K. et al. (2024). Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge. arXiv:2404.13292.
- Chai, Y. et al. (2024). Tokenization Falling Short: On Subword Robustness in Large Language Models. arXiv:2406.11687.