Token (LLM) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

ٹوکن (token) — متن کی کم سے کم اکائی جس کے ساتھ بڑے زبانی ماڈل (LLM) کام کرنے کی صلاحیت رکھتے ہیں۔ LLM کے ذریعے پروسیسنگ سے پہلے کوئی بھی متن ٹوکنوں کی ترتیب میں تبدیل کیا جاتا ہے، جنہیں بعد میں عددی نمائندگی میں ڈھالا جاتا ہے تاکہ ماڈل انہیں آسانی سے تجزیہ اور پروسیس کر سکے۔

استعمال شدہ tokenization کی حکمتِ عملی کے لحاظ سے، ٹوکن درج ذیل صورتوں میں سے کوئی ایک ہو سکتا ہے:

  • پورا لفظ (مثلاً، "گھر")
  • لفظ کا حصہ یا جڑ (مثلاً، "گھر" جیسا کہ "گھریلو" میں)
  • اکیلا حرف یا رموزِ اوقاف (مثلاً، ","، "!")

ٹوکنوں کا استعمال زبانی ماڈلوں کو متن کی ساختوں کو مؤثر طریقے سے سیکھنے اور دوبارہ پیش کرنے، باقاعدگیوں کو پہچاننے، نیز متن کی معنویت (semantics) اور نحویات (syntax) کو سمجھنے کے قابل بناتا ہے۔

Tokenization کا عمل

Tokenization — یہ وہ عمل ہے جس میں اصل متن کو ٹوکنوں میں تقسیم کیا جاتا ہے اور پھر انہیں عددی شناخت کاروں میں تبدیل کیا جاتا ہے جو ماڈل کے لیے قابلِ فہم ہوں۔

یہ مرحلہ بڑے زبانی ماڈلوں کے کام کے لیے لازمی اور بنیادی حیثیت رکھتا ہے۔ اس کی مدد سے LLM کو یہ صلاحیت حاصل ہوتی ہے:

  • نحوی تجزیہ کرنا — متن کی ساخت اور عناصر (الفاظ اور جملوں) کی ترتیب؛
  • معنوی مفہوم اخذ کرنا — متن کا گہرا مفہوم اور عناصر کے درمیان باہمی روابط۔

Tokenization کے کئی بنیادی طریقے ہیں، جن میں درج ذیل شامل ہیں:

  • Byte Pair Encoding (BPE): ایک الگورتھم جو بار بار سب سے زیادہ ملنے والے حروف کے جوڑوں کو نئے ٹوکنوں سے بدلتا ہے، جس سے نادر الفاظ اور صرفی تبدیلیوں کو مؤثر طریقے سے پروسیس کرنا ممکن ہو جاتا ہے۔
  • WordPiece: BERT جیسے ماڈلوں میں استعمال ہوتا ہے اور الفاظ کو ذیلی لفظی اکائیوں میں تقسیم کرتا ہے، جو نامعلوم الفاظ کی پروسیسنگ میں معاون ہوتا ہے۔
  • SentencePiece: ایک ایسا طریقہ جو متن کو حروف کی ترتیب کے طور پر دیکھتا ہے اور tokenization کے لیے BPE یا Unigram پر مبنی ماڈل استعمال کرتا ہے۔

Tokenization کے طریقے کا انتخاب ماڈل کی کارکردگی، مختلف زبانوں کو پروسیس کرنے کی صلاحیت اور تربیت کی افادیت پر اثر انداز ہوتا ہے۔

خصوصی ٹوکن

بنیادی ٹوکنوں کے علاوہ، ماڈل متن کے فعلی عناصر کو ظاہر کرنے کے لیے خصوصی ٹوکن بھی استعمال کرتے ہیں، جیسے:

  • [CLS] (class) — ترتیب کے آغاز کا ٹوکن، جو اکثر متن کی درجہ بندی کے کاموں میں استعمال ہوتا ہے؛
  • [SEP] (separator) — متن کے مختلف حصوں کو الگ کرتا ہے (مثلاً سوال اور جواب، جملے یا پیراگراف)؛
  • [MASK] — ایک خصوصی ٹوکن اس لفظ کو ظاہر کرنے کے لیے جو ماڈل کو پیش گوئی کرنی ہے (BERT اور دیگر masked-language ماڈلوں میں استعمال ہوتا ہے)؛
  • [PAD] (padding) — متن کو لمبائی کے اعتبار سے برابر کرنے کے لیے استعمال ہوتا ہے۔

یہ خصوصی ٹوکن ماڈلوں کو پروسیس کیے جانے والے متن کی ساخت اور سیاق و سباق کو زیادہ درست طریقے سے سمجھنے میں مدد دیتے ہیں۔

ٹوکن اور Context Window

Context window — یہ ٹوکنوں کی وہ زیادہ سے زیادہ تعداد ہے جنہیں ماڈل متن تیار کرتے وقت بیک وقت مدنظر رکھ سکتا اور پروسیس کر سکتا ہے۔

مثلاً، GPT-3 ماڈل کا context window 2048 ٹوکنوں پر مشتمل ہے۔ اس کا مطلب یہ ہے کہ متن تیار کرتے وقت ماڈل بیک وقت زیادہ سے زیادہ 2048 ٹوکنوں میں موجود معلومات کو مدنظر رکھ سکتا ہے۔ Context window کا حجم درج ذیل پر اثر انداز ہوتا ہے:

  • ماڈل کے لیے دستیاب معلومات کی زیادہ سے زیادہ مقدار؛
  • تیار کردہ جوابات کا معیار اور معنویت؛
  • طویل متن کو سمجھنے اور ٹوکنوں کے درمیان زیادہ فاصلے پر سیاق و سباق برقرار رکھنے کی ماڈل کی صلاحیت۔

ادبیات

  • Sennrich, R.; Haddow, B.; Birch, A. (2016). Neural Machine Translation of Rare Words with Subword Units. arXiv:1508.07909.
  • Kudo, T.; Richardson, J. (2018). SentencePiece: A Simple and Language-Independent Subword Tokenizer and Detokenizer for Neural Text Processing. arXiv:1808.06226.
  • Kudo, T. (2018). Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates. arXiv:1804.10959.
  • Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
  • Song, X. et al. (2021). Fast WordPiece Tokenization. *EMNLP 2021*. ACL Anthology.
  • Mielke, S. J.; Dalmia, S.; Cotterell, R. (2021). A Brief History of Open-Vocabulary Modeling and Tokenization in NLP. arXiv:2112.10508.
  • Xue, J. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
  • Limisiewicz, T.; Balhar, J.; Mareček, D. (2023). Tokenization Impacts Multilingual Language Modeling: Assessing Vocabulary Allocation and Overlap Across Languages. arXiv:2305.17179.
  • Pourmostafa Roshan Sharami, J.; Shterionov, D.; Spronck, P. (2023). A Systematic Analysis of Vocabulary and BPE Settings for Optimal Fine-tuning of NMT. arXiv:2303.00722.
  • Batsuren, K. et al. (2024). Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge. arXiv:2404.13292.
  • Chai, Y. et al. (2024). Tokenization Falling Short: On Subword Robustness in Large Language Models. arXiv:2406.11687.