Token (LLM) (HI)
टोकन (token) — पाठ की न्यूनतम इकाई, जिसके साथ बड़े भाषा मॉडल (LLM) कार्य करने में सक्षम होते हैं। LLM द्वारा प्रसंस्करण से पहले किसी भी पाठ को टोकनों के अनुक्रम में परिवर्तित किया जाता है, जिन्हें बाद में संख्यात्मक प्रतिनिधित्व में बदला जाता है जो मॉडल द्वारा विश्लेषण और प्रसंस्करण के लिए उपयुक्त होते हैं।
टोकनीकरण की प्रयुक्त रणनीति के आधार पर, एक टोकन निम्नलिखित हो सकता है:
- एक पूरा शब्द (उदाहरण के लिए, "घर")
- किसी शब्द का भाग या मूल (उदाहरण के लिए, "घर" — "घरेलू" में)
- एक एकल अक्षर या विराम चिह्न (उदाहरण के लिए, ",", "!")
टोकनों का उपयोग भाषा मॉडलों को पाठ की संरचनाओं को प्रभावी ढंग से सीखने और पुनरुत्पादित करने, नियमितताओं की पहचान करने, तथा पाठ की अर्थविज्ञान और वाक्यविन्यास को समझने में सक्षम बनाता है।
टोकनीकरण की प्रक्रिया
टोकनीकरण (tokenization) — यह मूल पाठ को टोकनों में विभाजित करने और फिर उन्हें मॉडल के लिए समझने योग्य संख्यात्मक पहचानकर्ताओं में परिवर्तित करने की प्रक्रिया है।
यह चरण बड़े भाषा मॉडलों के संचालन के लिए अनिवार्य और मूलभूत है। इसकी सहायता से LLM को यह क्षमता प्राप्त होती है:
- वाक्यविन्यास का विश्लेषण करना — पाठ की संरचना और तत्वों (शब्दों और वाक्यांशों) की स्थिति;
- अर्थविज्ञान निकालना — पाठ का गहन अर्थ और तत्वों के बीच परस्पर संबंध।
टोकनीकरण के कई प्रमुख तरीके हैं, जिनमें शामिल हैं:
- Byte Pair Encoding (BPE): एक एल्गोरिदम जो अक्षरों के सबसे अधिक बार आने वाले जोड़ों को पुनरावृत्त रूप से नए टोकनों से प्रतिस्थापित करता है, जिससे दुर्लभ शब्दों और रूपात्मक विविधताओं को प्रभावी ढंग से संसाधित किया जा सकता है।
- WordPiece: BERT मॉडलों में उपयोग किया जाता है और शब्दों को उप-शब्द इकाइयों में विभाजित करता है, जो अज्ञात शब्दों के प्रसंस्करण में सहायक होता है।
- SentencePiece: एक विधि जो पाठ को अक्षरों के अनुक्रम के रूप में मानती है और टोकनीकरण के लिए BPE या Unigram पर आधारित मॉडलों का उपयोग करती है।
टोकनीकरण विधि का चुनाव मॉडल के प्रदर्शन, विभिन्न भाषाओं को संसाधित करने की उसकी क्षमता और प्रशिक्षण की दक्षता को प्रभावित करता है।
विशेष टोकन
मूल टोकनों के अलावा, मॉडल पाठ के कार्यात्मक तत्वों को दर्शाने के लिए विशेष टोकनों का भी उपयोग करते हैं, जैसे:
[CLS](class) — अनुक्रम के आरंभ का टोकन, जो अक्सर पाठ वर्गीकरण कार्यों के लिए उपयोग किया जाता है;[SEP](separator) — पाठ के विभिन्न भागों को अलग करता है (उदाहरण के लिए, प्रश्न और उत्तर, वाक्य या अनुच्छेद);[MASK]— उस शब्द को दर्शाने के लिए विशेष टोकन जिसका मॉडल को अनुमान लगाना होता है (BERT और अन्य masked-language मॉडलों में उपयोग किया जाता है);[PAD](padding) — पाठ को लंबाई के अनुसार समायोजित करने के लिए उपयोग किया जाता है।
ये विशेष टोकन मॉडलों को संसाधित किए जा रहे पाठ की संरचना और संदर्भ को अधिक सटीक रूप से समझने में सहायता करते हैं।
टोकन और संदर्भ विंडो
संदर्भ विंडो (context window) — यह टोकनों की अधिकतम संख्या है जिसे मॉडल पाठ उत्पन्न करते समय एक साथ ध्यान में रख सकता है और संसाधित कर सकता है।
उदाहरण के लिए, GPT-3 मॉडल की संदर्भ विंडो का आकार 2048 टोकन है। इसका अर्थ है कि पाठ निर्माण करते समय मॉडल एक साथ अधिकतम 2048 टोकनों में निहित जानकारी को ध्यान में रख सकता है। संदर्भ विंडो का आकार निम्नलिखित को प्रभावित करता है:
- मॉडल के लिए उपलब्ध जानकारी की अधिकतम मात्रा;
- उत्पन्न उत्तरों की गुणवत्ता और सार्थकता;
- लंबे पाठों को समझने और टोकनों के बीच बड़ी दूरी पर संदर्भ बनाए रखने की मॉडल की क्षमता।
साहित्य
- Sennrich, R.; Haddow, B.; Birch, A. (2016). Neural Machine Translation of Rare Words with Subword Units. arXiv:1508.07909.
- Kudo, T.; Richardson, J. (2018). SentencePiece: A Simple and Language-Independent Subword Tokenizer and Detokenizer for Neural Text Processing. arXiv:1808.06226.
- Kudo, T. (2018). Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates. arXiv:1804.10959.
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- Song, X. et al. (2021). Fast WordPiece Tokenization. *EMNLP 2021*. ACL Anthology.
- Mielke, S. J.; Dalmia, S.; Cotterell, R. (2021). A Brief History of Open-Vocabulary Modeling and Tokenization in NLP. arXiv:2112.10508.
- Xue, J. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
- Limisiewicz, T.; Balhar, J.; Mareček, D. (2023). Tokenization Impacts Multilingual Language Modeling: Assessing Vocabulary Allocation and Overlap Across Languages. arXiv:2305.17179.
- Pourmostafa Roshan Sharami, J.; Shterionov, D.; Spronck, P. (2023). A Systematic Analysis of Vocabulary and BPE Settings for Optimal Fine-tuning of NMT. arXiv:2303.00722.
- Batsuren, K. et al. (2024). Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge. arXiv:2404.13292.
- Chai, Y. et al. (2024). Tokenization Falling Short: On Subword Robustness in Large Language Models. arXiv:2406.11687.