---
title: "Token (LLM) (PT)"
source: "https://systems-analysis.info/int/Token_(LLM)_(PT)"
wiki: "systems-analysis.info/int"
article: "Token_(LLM)_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 8108
wiki_created_at: 2026-09-07T01:12:27Z
wiki_modified_at: 2026-09-07T01:12:27Z
downloaded_at: 2026-09-07T23:23:24Z
---

# Token (LLM) (PT)

**Token** — é a menor unidade de texto com a qual os modelos de linguagem grandes (LLMs) são capazes de trabalhar. Qualquer texto, antes de ser processado por um LLM, é previamente convertido em uma sequência de tokens, que são então traduzidos em representações numéricas convenientes para análise e processamento pelo modelo.

Dependendo da estratégia de tokenização utilizada, um token pode representar:

- Uma palavra inteira (por exemplo, "casa")
- Parte de uma palavra ou raiz (por exemplo, "casa" em "casinha")

<!-- -->

- Um único caractere ou pontuação (por exemplo, ",", "!")

O uso de tokens permite que os modelos de linguagem estudem e reproduzam eficientemente as estruturas do texto, identifiquem padrões e compreendam a semântica e a sintaxe do texto.

## Processo de tokenização

**Tokenização** (tokenization) — é o processo de dividir o texto original em tokens, seguido pela sua conversão em identificadores numéricos compreensíveis pelo modelo.

Esta etapa é obrigatória e fundamental para o funcionamento dos modelos de linguagem grandes. Com ela, um LLM ganha a capacidade de:

- Analisar a sintaxe — a estrutura do texto e a disposição dos elementos (palavras e frases);
- Extrair a semântica — o significado profundo do texto e as inter-relações entre os elementos.

Existem vários métodos principais de tokenização, entre os quais se destacam:

- **Byte Pair Encoding (BPE)**: Um algoritmo que substitui iterativamente os pares de caracteres mais frequentes por novos tokens, o que permite processar eficientemente palavras raras e variações morfológicas.​
- **WordPiece**: Utilizado em modelos como o BERT, divide as palavras em unidades de subpalavras, o que ajuda no processamento de palavras desconhecidas.
- **SentencePiece**: Um método que trata o texto como uma sequência de caracteres e aplica modelos baseados em BPE ou Unigram para a tokenização.

A escolha do método de tokenização afeta o desempenho do modelo, sua capacidade de processar diferentes idiomas e a eficiência do treinamento.

## Tokens especiais

Além dos tokens principais, os modelos também utilizam tokens especiais para designar elementos funcionais do texto, tais como:

- `[CLS]` (class) — token de início de sequência, frequentemente utilizado para tarefas de classificação de texto;
- `[SEP]` (separator) — separa diferentes partes do texto (por exemplo, pergunta e resposta, frases ou parágrafos);
- `[MASK]` — token especial para indicar uma palavra que o modelo deve prever (usado no BERT e em outros modelos de linguagem mascarada);
- `[PAD]` (padding) — utilizado para alinhar o texto em comprimento (preenchimento).

Esses tokens especiais ajudam os modelos a perceber com mais precisão a estrutura e o contexto do texto processado.

## Tokens e janela de contexto

A **janela de contexto** (context window) é a quantidade máxima de tokens que um modelo consegue considerar e processar simultaneamente ao gerar texto.

Por exemplo, o modelo GPT-3 tem uma janela de contexto de 2048 tokens. Isso significa que, ao criar texto, o modelo pode considerar simultaneamente a informação contida em no máximo 2048 tokens do texto original. O tamanho da janela de contexto afeta:

- O volume máximo de informação disponível para o modelo;
- A qualidade e a coerência das respostas geradas;
- A capacidade do modelo de compreender textos longos e manter o contexto ao longo de grandes distâncias entre os tokens.

## Literatura

- Sennrich, R.; Haddow, B.; Birch, A. (2016). *Neural Machine Translation of Rare Words with Subword Units*. <a href="https://arxiv.org/abs/1508.07909" class="external text" rel="nofollow">arXiv:1508.07909</a>.
- Kudo, T.; Richardson, J. (2018). *SentencePiece: A Simple and Language-Independent Subword Tokenizer and Detokenizer for Neural Text Processing*. <a href="https://arxiv.org/abs/1808.06226" class="external text" rel="nofollow">arXiv:1808.06226</a>.
- Kudo, T. (2018). *Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates*. <a href="https://arxiv.org/abs/1804.10959" class="external text" rel="nofollow">arXiv:1804.10959</a>.
- Devlin, J. et al. (2019). *BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external text" rel="nofollow">arXiv:1810.04805</a>.
- Song, X. et al. (2021). *Fast WordPiece Tokenization*. \*EMNLP 2021\*. <a href="https://aclanthology.org/2021.emnlp-main.160.pdf" class="external text" rel="nofollow">ACL Anthology</a>.
- Mielke, S. J.; Dalmia, S.; Cotterell, R. (2021). *A Brief History of Open-Vocabulary Modeling and Tokenization in NLP*. <a href="https://arxiv.org/abs/2112.10508" class="external text" rel="nofollow">arXiv:2112.10508</a>.
- Xue, J. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. <a href="https://arxiv.org/abs/2105.13626" class="external text" rel="nofollow">arXiv:2105.13626</a>.
- Limisiewicz, T.; Balhar, J.; Mareček, D. (2023). *Tokenization Impacts Multilingual Language Modeling: Assessing Vocabulary Allocation and Overlap Across Languages*. <a href="https://arxiv.org/abs/2305.17179" class="external text" rel="nofollow">arXiv:2305.17179</a>.
- Pourmostafa Roshan Sharami, J.; Shterionov, D.; Spronck, P. (2023). *A Systematic Analysis of Vocabulary and BPE Settings for Optimal Fine-tuning of NMT*. <a href="https://arxiv.org/abs/2303.00722" class="external text" rel="nofollow">arXiv:2303.00722</a>.
- Batsuren, K. et al. (2024). *Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge*. <a href="https://arxiv.org/abs/2404.13292" class="external text" rel="nofollow">arXiv:2404.13292</a>.
- Chai, Y. et al. (2024). *Tokenization Falling Short: On Subword Robustness in Large Language Models*. <a href="https://arxiv.org/abs/2406.11687" class="external text" rel="nofollow">arXiv:2406.11687</a>.
