Yi (01.AI)

Материал из Systems analysis Wiki
Перейти к навигации Перейти к поиску

Yi — семейство больших языковых моделей (Large Language Model, LLM) и визуально-языковых моделей (Vision-Language Model, VLM), разработанное компанией 01.AI (零一万物) под руководством Кай-Фу Ли (Kai-Fu Lee). Модели обучены с нуля на высококачественном билингвальном корпусе (английский и китайский языки) объёмом 3,1 трлн токенов и включают варианты для генерации текста, обработки длинного контекста (до 200 тыс. токенов), мультимодального ввода (текст + изображения), кодогенерации и эффективного вывода на основе архитектуры Mixture-of-Experts (MoE). Открытые варианты распространяются под лицензией Apache 2.0 с разрешением коммерческого использования; закрытые флагманские модели (Yi-Large, Yi-Lightning) доступны через API.[1][2][3]

История и хронология развития

Компания 01.AI основана в марте 2023 года Кай-Фу Ли, бывшим руководителем Microsoft Research Asia и Google China, со штаб-квартирой в Пекине. Фокус компании — разработка эффективных LLM с акцентом на качество данных и инженерную оптимизацию инфраструктуры. К ноябрю 2023 года 01.AI достигла статуса «единорога» (оценка свыше 1 млрд долларов) после раунда финансирования с участием Alibaba.[4][5]

Первое поколение (2023–2024)

Первые открытые модели Yi-6B и Yi-34B были представлены 2 ноября 2023 года. В течение последующих недель линейка была дополнена вариантами с контекстом 200 тыс. токенов (5 ноября 2023), чат-вариантами и квантованными моделями (23 ноября 2023). В январе 2024 года вышли мультимодальные Yi-VL-6B и Yi-VL-34B. В марте 2024 года представлена модель Yi-9B, полученная методом глубинного масштабирования (depth upscaling) из Yi-6B, и опубликован технический отчёт arXiv:2403.04652.[1][2]

Yi-1.5 и специализированные модели (2024)

13 мая 2024 года выпущена серия Yi-1.5 (6B/9B/34B) — результат непрерывного предобучения на дополнительных 500 млрд токенов и дообучения на 3 млн примеров инструкций. В мае–июне 2024 года представлена закрытая проприетарная модель Yi-Large с API-доступом, позиционируемая как SOTA. В сентябре 2024 года вышла специализированная серия Yi-Coder (1.5B/9B) для кодогенерации с контекстом 128 тыс. токенов и поддержкой 52 языков программирования.[1][6][7]

Yi-Lightning (2024)

В октябре 2024 года представлена флагманская модель Yi-Lightning на основе архитектуры Mixture-of-Experts (MoE), оптимизированная для скорости и эффективности вывода. Yi-Lightning заняла 6-е место в общем рейтинге LMSYS Chatbot Arena (Elo 1287), 2-е место по китайскому языку и 3–4-е место по математике и кодированию. Технический отчёт опубликован в декабре 2024 года (arXiv:2412.01253).[8]

Смена стратегии (2025)

В марте 2025 года компания 01.AI объявила о прекращении предобучения новых крупных языковых моделей и сосредоточилась на корпоративных приложениях, многоагентных системах и платформе WorldWise LLM Platform 2.5 на базе сторонних моделей (включая DeepSeek).[4]

Сводная хронология

Дата Событие
Ноябрь 2023 Релиз Yi-6B и Yi-34B (base, chat, 200K-варианты)
Январь 2024 Мультимодальные Yi-VL-6B и Yi-VL-34B
Март 2024 Yi-9B (depth-upscaled); публикация технического отчёта arXiv:2403.04652
Май 2024 Yi-1.5 (6B/9B/34B); Yi-Large (закрытая, API)
Сентябрь 2024 Yi-Coder-1.5B/9B (специализация на коде, контекст 128K)
Октябрь 2024 Yi-Lightning (MoE-архитектура, флагманская модель)
Декабрь 2024 Публикация технического отчёта Yi-Lightning (arXiv:2412.01253)
Март 2025 Прекращение предобучения новых LLM; фокус на корпоративных решениях

Теоретические основы и архитектура

Базовая архитектура

Все модели семейства Yi основаны на архитектуре декодерного трансформера (decoder-only Transformer), описанной в работе Vaswani et al.[9] Модели обучены с нуля и не являются производными от LLaMA, несмотря на сходство реализации.[1]

Базовый механизм многоголового самовнимания (Multi-Head Self-Attention) описывается формулой:

Attention(Q,K,V)=softmax(QKdk)V

где Q, K, V — матрицы запросов (queries), ключей (keys) и значений (values) соответственно, dk — размерность ключей.[9]

Ключевые архитектурные модификации Yi:[1]

  • Grouped-Query Attention (GQA) — разделение query-голов на группы с общими key/value-головами, что снижает потребление памяти при сохранении качества.
  • SwiGLU-активация — замена стандартной ReLU/GELU; уменьшает размер активаций до 8/3 от размерности скрытого слоя (hidden size).
  • Rotary Position Embedding (RoPE) с адаптированной базовой частотой (adjusted base frequency, ABF), обеспечивающей расширение контекста без архитектурных изменений.
  • Словарь (vocabulary): 64 000 токенов на основе BPE (SentencePiece) с разделением чисел на цифры и unicode-byte fallback для редких символов.

Конфигурации базовых моделей

Параметры архитектуры из технического отчёта arXiv:2403.04652:[1]

Параметр Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
Число слоёв 32 60
Длина предобучения (Pretrain Seq. Len) 4096 4096
Макс. скорость обучения (Max LR) 3×10⁻⁴ 1,5×10⁻⁴

Источник: arXiv:2403.04652, таблица параметров.[1]

Архитектура Yi-Lightning (MoE)

Yi-Lightning (2024) использует улучшенную архитектуру Mixture-of-Experts (MoE) со следующими особенностями:[8]

  • Fine-grained expert segmentation — мелкогранулярное разделение FFN-блоков на экспертов для повышения специализации.
  • Многоуровневая балансировка нагрузки — комбинация Switch-Transformer (ST), Expert Parallel (EP) и Partitioned EP (PEP) losses для равномерного распределения токенов между экспертами.
  • Гибридное внимание — чередование 3 слоёв со скользящим окном (sliding window) и 1 слоя с полным вниманием (full attention), с повторным использованием KV-кэша между слоями.
  • Снижение памяти KV-кэша на 82,8 % по сравнению со стандартным подходом при обработке длинных последовательностей.
  • Контекстное окно расширено до 64 тыс. токенов.

Точное число экспертов и общее количество параметров Yi-Lightning в публичных источниках не раскрыто.[8]

Мультимодальные варианты (Yi-VL)

В мультимодальных моделях Yi-VL языковая модель соединяется с визуальным энкодером CLIP ViT-H/14 через MLP-проекцию. Изображение I преобразуется визуальным энкодером в последовательность эмбеддингов {v1,,vK}, которые подаются в языковую модель совместно с текстовыми токенами. Обучение проходит в три стадии с увеличением разрешения: 224×224 → 448×448 пикселей.[1]

Пайплайн обучения и выравнивание

Предварительное обучение (Pre-training)

Базовые модели Yi-6B и Yi-34B предобучены на билингвальном корпусе объёмом 3,1 трлн токенов. Данные проходят каскадный пайплайн фильтрации и дедупликации: эвристические фильтры, обученные скореры (perplexity, quality, coherence, safety), кластеризация и MinHash-дедупликация. Источники — Common Crawl, книги и научные статьи.[1]

Для Yi-1.5 выполнено непрерывное предобучение (continued pre-training) на дополнительных 500 млрд токенов высококачественного корпуса.[7]

Контролируемое дообучение (Supervised Fine-Tuning, SFT)

Чат-варианты первого поколения дообучены на малом, но тщательно выверенном наборе — менее 10 тыс. многооборотных (multi-turn) примеров, каждый из которых вручную проверен и отредактирован инженерами машинного обучения. Для Yi-1.5 объём SFT-данных увеличен до 3 млн примеров.[1][7]

Выравнивание с помощью обучения с подкреплением

Для Yi-Lightning применяется многоэтапный процесс выравнивания: SFT с последующим RLHF/DPO. Синтетические данные генерируются с использованием Monte Carlo Tree Search (MCTS). Фреймворк безопасности RAISE реализует четырёхуровневую защиту: фильтрация данных предобучения, safety fine-tuning, входной контроль промптов и выходной контроль ответов.[8]

Расширение контекста

Расширение контекстного окна до 200 тыс. токенов реализовано через лёгкое непрерывное предобучение на 5 млрд токенов (книги + синтетические вопрос-ответ) с использованием техники RoPE ABF. После доработки точность в задаче Needle-in-a-Haystack (поиск целевого фрагмента в длинном тексте) достигает 99,8 %.[1][2]

Глубинное масштабирование (Depth Upscaling)

Yi-9B получена путём дублирования слоёв 12–28 базовой модели Yi-6B с последующим предобучением на 800 млрд токенов. Метод обеспечивает увеличение ёмкости модели без обучения с нуля.[1]

Состав семейства моделей

Основные языковые модели

Модель Параметры Тип Контекст Дата релиза Лицензия Примечание
Yi-6B / Yi-34B 6 млрд / 34 млрд Base / Chat 4K (расш. до 32K) Ноябрь 2023 Apache 2.0 Базовые модели, обученные с нуля
Yi-6B-200K / Yi-34B-200K 6 млрд / 34 млрд Base 200K Ноябрь 2023 Apache 2.0 Непрерывное предобучение на длинных последовательностях
Yi-9B 9 млрд Base 4K (расш. до 200K) Март 2024 Apache 2.0 Depth-upscale из Yi-6B + 800 млрд токенов
Yi-1.5-6B/9B/34B 6 / 9 / 34 млрд Base / Chat 4K / 16K / 32K Май 2024 Apache 2.0 +500 млрд токенов + 3 млн SFT-примеров
Yi-Large ~1 трлн (MoE, активных не раскрыто) LLM Не раскрыт Май 2024 Закрытая (API) Позиционируется как SOTA
Yi-Lightning MoE (число экспертов не раскрыто) LLM 64K Октябрь 2024 API 6-е место LMSYS Chatbot Arena

Источники: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]

Специализированные модели

Модель Параметры Модальности Контекст Дата релиза Примечание
Yi-VL-6B / Yi-VL-34B 6 / 34 млрд Текст + изображения (448×448) Стандартный базовой модели Январь 2024 ViT-энкодер (CLIP ViT-H/14), трёхстадийное обучение
Yi-Coder-1.5B / Yi-Coder-9B 1,5 / 9 млрд Текст (код) 128K Сентябрь 2024 52 языка программирования

Источники: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]

Идентификаторы API

Примеры на платформе 01.AI и сторонних провайдерах: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]

Оценка и бенчмарки

Результаты базовых моделей

Данные из технического отчёта arXiv:2403.04652 (условия: 0-shot / 5-shot, в зависимости от бенчмарка):[1]

Бенчмарк Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63,2 76,3 62,6 69,7 66,7
BBH 42,8 54,3 44,1 53,4
C-Eval 72,0 81,4 50,1 72,1 70,1
CMMLU 75,5 83,7 53,3 71,0 52,5
GSM8K 32,5 67,2 42,2 56,8 61,3 57,1
HumanEval 15,9 23,2 22,6 31,7 32,3 48,1

Источник: arXiv:2403.04652, таблицы результатов.[1]

Yi-34B продемонстрировала результаты, превосходящие Llama 2-70B (при вдвое меньшем размере) на большинстве бенчмарков и лидирующие среди открытых моделей на C-Eval и CMMLU на момент релиза.[1][12]

Результаты Yi-Lightning

Данные из технического отчёта arXiv:2412.01253 (условия: 0-shot, где не указано иное):[8]

Бенчмарк Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50,9 49,1 45,1
MATH 76,4 82,7 67,1
HumanEval 83,5 86,0 76,2
WildBench 65,1 59,9 49,0
Arena-Hard 91,8 90,5 74,0

Источник: arXiv:2412.01253.[8]

Пользовательские рейтинги

Yi-34B-Chat занимала 2-е место на AlpacaEval (94,08 %, после GPT-4 Turbo) в декабре 2023 — январе 2024 года, с рейтингом Elo ~1110 на LMSYS Chatbot Arena. Yi-34B лидировала среди открытых моделей на Hugging Face Open LLM Leaderboard и C-Eval на момент релиза.[2][1]

Yi-Lightning заняла 6-е общее место на LMSYS Chatbot Arena (score 1287), 2-е место по китайскому языку и 3–4-е места в подкатегориях «математика», «кодирование», «hard prompts» и «multi-turn» на момент публикации отчёта.[8]

Примечание. Прямое сравнение моделей из разных релизов и конфигураций требует единообразных условий тестирования (одни и те же версии бенчмарков, одинаковые параметры генерации). Субъективные оценки на краудсорсинговых платформах зависят от состава участников и текущего набора моделей в системе.[12]

Применение

Семейство Yi применяется в широком диапазоне задач обработки естественного языка и мультимодального анализа:[3][13]

  • Чат-ассистенты и диалоговые системы — на базе чат-вариантов Yi-34B-Chat и Yi-1.5.
  • Генерация и анализ кода — Yi-Coder поддерживает 52 языка программирования.
  • Анализ длинных документов — варианты с контекстом 200K для юридических, технических и аналитических задач.
  • Мультимодальный анализ — описание изображений и визуальный вопрос-ответ через Yi-VL.
  • Корпоративные агенты — RAG-системы, поиск знаний и классификация данных через платформу 01.AI.
  • Локальное развёртывание — через vLLM, llama.cpp, Hugging Face Transformers; квантованные версии (AWQ/GPTQ 4/8-bit) доступны для развёртывания на потребительских GPU (например, RTX 4090 для Yi-34B-4bit).

API-варианты (Yi-Large, Yi-Lightning) используются для чат-ботов, мультиязычных сервисов и low-cost inference. Стоимость инференса Yi-Lightning составляла 14 центов за миллион токенов по состоянию на 2024 год.[8]

Ограничения и открытые проблемы

  • Галлюцинации. Модели подвержены типичным для LLM фактическим ошибкам в генерируемых ответах, особенно в сложных рассуждениях и длинных цепочках вывода.[1]
  • Математика и код в ранних версиях. Базовые модели Yi-34B показывают более слабые результаты в сложном кодировании и математике по сравнению со специализированными frontier-моделями (например, MATH Yi-34B в 4-shot — 14,4). Эта проблема частично решена в Yi-1.5 и Yi-Lightning.[1][8]
  • Длинный контекст. Расширение до 200K требует дополнительного предобучения и вычислительных ресурсов; возможна незначительная деградация производительности на коротком контексте.[1]
  • Закрытые модели. Yi-Large и Yi-Lightning не предоставляют весов для скачивания, что ограничивает независимую верификацию архитектуры и данных.[8]
  • Разрыв между Arena и бенчмарками. Yi-Lightning демонстрирует сильные результаты в пользовательских оценках (Chatbot Arena), но отстаёт от некоторых конкурентов на статических академических бенчмарках — отражение общей проблемы несоответствия метрик.[8]
  • Воспроизводимость. Не все детали обучения (точный состав датасета, распределение доменов, гиперпараметры) полностью раскрыты.[13]
  • Чувствительность к промптам. Как и другие LLM, модели Yi чувствительны к формулировке промпта, что влияет на стабильность выводов.[1]

Известных серьёзных регрессий после релизов не зафиксировано; сообщество отмечает стабильность квантованных версий.[2]

Этические и регуляторные аспекты

В Yi-Lightning внедрён фреймворк безопасности RAISE, реализующий четырёхуровневую защиту:[8]

  • Фильтрация токсичного контента, PII и вредоносных материалов на этапе предобучения.
  • Safety fine-tuning с примерами корректной обработки чувствительных запросов.
  • Входной контроль (классификация промптов).
  • Выходной контроль (фильтрация ответов).

Лицензия Apache 2.0 для открытых моделей разрешает коммерческое использование; отдельные хостинги могут предъявлять дополнительные требования. Модели соответствуют китайским регуляторным нормам в области ИИ (сертификация CAICT для корпоративных решений).[1][3]

Перспективы и направления исследований

Серия Yi демонстрирует эффективность подхода, ставящего качество данных выше объёма параметров, а также лёгкого масштабирования (continual pretraining, depth upscaling, MoE-оптимизации).[1]

После 2025 года акцент 01.AI сместился на прикладные решения:[4]

  • Многоагентные системы и enterprise-платформа WorldWise LLM Platform 2.5.
  • Интеграция сторонних моделей (включая DeepSeek) в корпоративные workflow.
  • Оптимизация инференса (квантование, FP8) для снижения стоимости развёртывания.

Открытые модели продолжают использоваться сообществом для исследований, fine-tuning и дистилляции.[6]

См. также

Ссылки

Литература

Примечания

  1. 1,00 1,01 1,02 1,03 1,04 1,05 1,06 1,07 1,08 1,09 1,10 1,11 1,12 1,13 1,14 1,15 1,16 1,17 1,18 1,19 1,20 1,21 1,22 1,23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2,0 2,1 2,2 2,3 2,4 2,5 2,6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3,0 3,1 3,2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4,0 4,1 4,2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6,0 6,1 6,2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7,0 7,1 7,2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8,00 8,01 8,02 8,03 8,04 8,05 8,06 8,07 8,08 8,09 8,10 8,11 8,12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9,0 9,1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12,0 12,1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13,0 13,1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms