---
title: "Токен"
source: "https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD"
wiki: "systems-analysis.info/wiki"
article: "Токен"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Базовые понятия LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 425
wiki_created_at: 2026-09-06T22:08:42Z
wiki_modified_at: 2026-09-06T22:08:42Z
downloaded_at: 2026-09-07T22:19:44Z
---

# Токен

**Токен (token)** — минимальная единица текста, с которой способны работать [большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM). Любой текст перед обработкой LLM предварительно преобразуется в последовательность токенов, которые затем переводятся в числовые представления, удобные для анализа и обработки моделью.

В зависимости от используемой стратегии токенизации, токен может представлять собой:​

- Целое слово (например, "дом")
- Часть слова или корень (например, "дом" в "домик")

<!-- -->

- Одиночный символ или пунктуацию (например, ",", "!")

Использование токенов позволяет языковым моделям эффективно изучать и воспроизводить структуры текста, выявлять закономерности, а также понимать семантику и синтаксис текста.

## Процесс токенизации

**Токенизация** ([tokenization](https://systems-analysis.info/wiki/Tokenization "Tokenization")) — это процесс разбиения исходного текста на токены с последующим их преобразованием в числовые идентификаторы, понятные модели.

Данный этап является обязательным и фундаментальным для работы больших языковых моделей. С его помощью LLM получает возможность:

- Анализировать синтаксис — структуру текста и расположение элементов (слов и фраз);
- Извлекать семантику — глубинный смысл текста и взаимосвязи между элементами.

Выделяют несколько основных методов токенизации, среди которых:

- **Byte Pair Encoding (BPE)**: Алгоритм, который итеративно заменяет наиболее частые пары символов на новые токены, что позволяет эффективно обрабатывать редкие слова и морфологические вариации .​
- **WordPiece**: Используется в моделях [BERT](https://systems-analysis.info/wiki/BERT "BERT") и разбивает слова на субсловные единицы, что помогает в обработке неизвестных слов.
- **SentencePiece**: Метод, который рассматривает текст как последовательность символов и применяет модели на основе BPE или Unigram для токенизации.

Выбор метода токенизации влияет на производительность модели, ее способность обрабатывать различные языки и эффективность обучения.

## Специальные токены

Кроме основных токенов, модели также используют специальные токены для обозначения функциональных элементов текста, таких как:

- `[CLS]` (class) — токен начала последовательности, часто используемый для задач классификации текста;
- `[SEP]` (separator) — разделяет разные части текста (например, вопрос и ответ, предложения или абзацы);
- `[MASK]` — специальный токен для обозначения слова, которое модель должна предсказать (используется в BERT и других masked-language моделях);
- `[PAD]` (padding) — используется для выравнивания текста по длине.

Эти специальные токены помогают моделям более точно воспринимать структуру и контекст обрабатываемого текста.

## Токены и контекстное окно

**[Контекстное окно](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE "Контекстное окно")** (context window) — это максимальное количество токенов, которые модель способна одновременно учитывать и обрабатывать при генерации текста.

Например, модель GPT-3 имеет контекстное окно размером 2048 токенов. Это означает, что при создании текста модель может одновременно учитывать информацию, содержащуюся максимум в 2048 токенах исходного текста. Размер контекстного окна влияет на:

- Максимальный объем информации, доступный модели;
- Качество и осмысленность сгенерированных ответов;
- Способность модели воспринимать длинные тексты и сохранять контекст на большом расстоянии между токенами.

## См. также

- [Stop sequences](https://systems-analysis.info/wiki/Stop_sequences "Stop sequences")
- [Большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")
- [Контекстное окно](https://systems-analysis.info/wiki/%D0%9A%D0%BE%D0%BD%D1%82%D0%B5%D0%BA%D1%81%D1%82%D0%BD%D0%BE%D0%B5_%D0%BE%D0%BA%D0%BD%D0%BE "Контекстное окно")
- [Основные приёмы Prompt Engineering](https://systems-analysis.info/wiki/%D0%9E%D1%81%D0%BD%D0%BE%D0%B2%D0%BD%D1%8B%D0%B5_%D0%BF%D1%80%D0%B8%D1%91%D0%BC%D1%8B_Prompt_Engineering "Основные приёмы Prompt Engineering")
- [Перплексия](https://systems-analysis.info/wiki/%D0%9F%D0%B5%D1%80%D0%BF%D0%BB%D0%B5%D0%BA%D1%81%D0%B8%D1%8F "Перплексия")

## Литература

- Sennrich, R.; Haddow, B.; Birch, A. (2016). *Neural Machine Translation of Rare Words with Subword Units*. <a href="https://arxiv.org/abs/1508.07909" class="external text" rel="nofollow">arXiv:1508.07909</a>.
- Kudo, T.; Richardson, J. (2018). *SentencePiece: A Simple and Language-Independent Subword Tokenizer and Detokenizer for Neural Text Processing*. <a href="https://arxiv.org/abs/1808.06226" class="external text" rel="nofollow">arXiv:1808.06226</a>.
- Kudo, T. (2018). *Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates*. <a href="https://arxiv.org/abs/1804.10959" class="external text" rel="nofollow">arXiv:1804.10959</a>.
- Devlin, J. et al. (2019). *BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external text" rel="nofollow">arXiv:1810.04805</a>.
- Song, X. et al. (2021). *Fast WordPiece Tokenization*. \*EMNLP 2021\*. <a href="https://aclanthology.org/2021.emnlp-main.160.pdf" class="external text" rel="nofollow">ACL Anthology</a>.
- Mielke, S. J.; Dalmia, S.; Cotterell, R. (2021). *A Brief History of Open-Vocabulary Modeling and Tokenization in NLP*. <a href="https://arxiv.org/abs/2112.10508" class="external text" rel="nofollow">arXiv:2112.10508</a>.
- Xue, J. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. <a href="https://arxiv.org/abs/2105.13626" class="external text" rel="nofollow">arXiv:2105.13626</a>.
- Limisiewicz, T.; Balhar, J.; Mareček, D. (2023). *Tokenization Impacts Multilingual Language Modeling: Assessing Vocabulary Allocation and Overlap Across Languages*. <a href="https://arxiv.org/abs/2305.17179" class="external text" rel="nofollow">arXiv:2305.17179</a>.
- Pourmostafa Roshan Sharami, J.; Shterionov, D.; Spronck, P. (2023). *A Systematic Analysis of Vocabulary and BPE Settings for Optimal Fine-tuning of NMT*. <a href="https://arxiv.org/abs/2303.00722" class="external text" rel="nofollow">arXiv:2303.00722</a>.
- Batsuren, K. et al. (2024). *Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge*. <a href="https://arxiv.org/abs/2404.13292" class="external text" rel="nofollow">arXiv:2404.13292</a>.
- Chai, Y. et al. (2024). *Tokenization Falling Short: On Subword Robustness in Large Language Models*. <a href="https://arxiv.org/abs/2406.11687" class="external text" rel="nofollow">arXiv:2406.11687</a>.
