Token (LLM) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Token — ang pinakamaliit na yunit ng teksto na kayang gamitin ng malalaking language model (LLM). Ang anumang teksto bago iproseso ng LLM ay unang kino-convert sa isang pagkakasunod-sunod ng mga token, na pagkatapos ay isinasalin sa mga numerical na representasyon na angkop para sa pagsusuri at pagproseso ng modelo.

Depende sa estratehiya ng tokenization na ginagamit, ang isang token ay maaaring kumatawan sa:

  • Isang buong salita (halimbawa, "bahay")
  • Isang bahagi ng salita o ugat (halimbawa, "bahay" sa "bahayanan")
  • Isang solong karakter o bantas (halimbawa, ",", "!")

Ang paggamit ng mga token ay nagbibigay-daan sa mga language model na epektibong pag-aralan at gayahin ang mga istruktura ng teksto, tuklasin ang mga pattern, at maunawaan ang semantika at sintaksis ng teksto.

Proseso ng Tokenization

Tokenization — ito ang proseso ng paghati sa orihinal na teksto sa mga token na sinusundan ng kanilang conversion sa mga numerical na identifier na naiintindihan ng modelo.

Ang yugtong ito ay sapilitan at pundamental para sa pagtatrabaho ng malalaking language model. Sa pamamagitan nito, nakakamit ng LLM ang kakayahang:

  • Suriin ang sintaksis — ang istruktura ng teksto at ang pagkakalagay ng mga elemento (salita at parirala);
  • Kunin ang semantika — ang malalim na kahulugan ng teksto at ang mga ugnayan sa pagitan ng mga elemento.

Mayroong ilang pangunahing pamamaraan ng tokenization, kabilang ang:

  • Byte Pair Encoding (BPE): Isang algorithm na paulit-ulit na pinapalitan ang pinaka-madalas na mga pares ng karakter ng mga bagong token, na nagbibigay-daan sa epektibong pagproseso ng mga bihirang salita at mga morpolohikal na pagbabago.
  • WordPiece: Ginagamit sa mga modelo ng BERT at hinahati ang mga salita sa mga subword na yunit, na nakakatulong sa pagproseso ng mga hindi kilalang salita.
  • SentencePiece: Isang pamamaraan na itinuturing ang teksto bilang isang pagkakasunod-sunod ng mga karakter at gumagamit ng mga modelo batay sa BPE o Unigram para sa tokenization.

Ang pagpili ng pamamaraan ng tokenization ay nakakaapekto sa pagganap ng modelo, sa kakayahan nitong iproseso ang iba't ibang wika, at sa kahusayan ng pagsasanay.

Mga Espesyal na Token

Bukod sa mga pangunahing token, gumagamit din ang mga modelo ng mga espesyal na token upang tukuyin ang mga functional na elemento ng teksto, tulad ng:

  • [CLS] (class) — token ng simula ng pagkakasunod-sunod, madalas na ginagamit para sa mga gawain ng klasipikasyon ng teksto;
  • [SEP] (separator) — naghihiwalay ng iba't ibang bahagi ng teksto (halimbawa, tanong at sagot, pangungusap o talata);
  • [MASK] — espesyal na token para sa pagtukoy ng salitang dapat hulaan ng modelo (ginagamit sa BERT at iba pang masked-language na mga modelo);
  • [PAD] (padding) — ginagamit para sa pagpapantay ng teksto ayon sa haba.

Ang mga espesyal na token na ito ay nakakatulong sa mga modelo na mas tumpak na mapagtanto ang istruktura at konteksto ng pinoprosesong teksto.

Mga Token at Context Window

Context window — ito ang pinakamataas na bilang ng mga token na kayang sabay na isaalang-alang at iproseso ng modelo sa panahon ng pagbuo ng teksto.

Halimbawa, ang modelong GPT-3 ay may context window na may sukat na 2048 token. Nangangahulugan ito na sa paglikha ng teksto, kayang sabay na isaalang-alang ng modelo ang impormasyong nilalaman ng hanggang 2048 token ng orihinal na teksto. Ang sukat ng context window ay nakakaapekto sa:

  • Pinakamataas na dami ng impormasyon na magagamit ng modelo;
  • Kalidad at kahulugan ng mga nabuong sagot;
  • Kakayahan ng modelo na maproseso ang mahahabang teksto at mapanatili ang konteksto sa malaking distansya sa pagitan ng mga token.

Mga Sanggunian

  • Sennrich, R.; Haddow, B.; Birch, A. (2016). Neural Machine Translation of Rare Words with Subword Units. arXiv:1508.07909.
  • Kudo, T.; Richardson, J. (2018). SentencePiece: A Simple and Language-Independent Subword Tokenizer and Detokenizer for Neural Text Processing. arXiv:1808.06226.
  • Kudo, T. (2018). Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates. arXiv:1804.10959.
  • Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
  • Song, X. et al. (2021). Fast WordPiece Tokenization. *EMNLP 2021*. ACL Anthology.
  • Mielke, S. J.; Dalmia, S.; Cotterell, R. (2021). A Brief History of Open-Vocabulary Modeling and Tokenization in NLP. arXiv:2112.10508.
  • Xue, J. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
  • Limisiewicz, T.; Balhar, J.; Mareček, D. (2023). Tokenization Impacts Multilingual Language Modeling: Assessing Vocabulary Allocation and Overlap Across Languages. arXiv:2305.17179.
  • Pourmostafa Roshan Sharami, J.; Shterionov, D.; Spronck, P. (2023). A Systematic Analysis of Vocabulary and BPE Settings for Optimal Fine-tuning of NMT. arXiv:2303.00722.
  • Batsuren, K. et al. (2024). Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge. arXiv:2404.13292.
  • Chai, Y. et al. (2024). Tokenization Falling Short: On Subword Robustness in Large Language Models. arXiv:2406.11687.