Yi (01.AI)
Yi — семейство больших языковых моделей (Large Language Model, LLM) и визуально-языковых моделей (Vision-Language Model, VLM), разработанное компанией 01.AI (零一万物) под руководством Кай-Фу Ли (Kai-Fu Lee). Модели обучены с нуля на высококачественном билингвальном корпусе (английский и китайский языки) объёмом 3,1 трлн токенов и включают варианты для генерации текста, обработки длинного контекста (до 200 тыс. токенов), мультимодального ввода (текст + изображения), кодогенерации и эффективного вывода на основе архитектуры Mixture-of-Experts (MoE). Открытые варианты распространяются под лицензией Apache 2.0 с разрешением коммерческого использования; закрытые флагманские модели (Yi-Large, Yi-Lightning) доступны через API.[1][2][3]
История и хронология развития
Компания 01.AI основана в марте 2023 года Кай-Фу Ли, бывшим руководителем Microsoft Research Asia и Google China, со штаб-квартирой в Пекине. Фокус компании — разработка эффективных LLM с акцентом на качество данных и инженерную оптимизацию инфраструктуры. К ноябрю 2023 года 01.AI достигла статуса «единорога» (оценка свыше 1 млрд долларов) после раунда финансирования с участием Alibaba.[4][5]
Первое поколение (2023–2024)
Первые открытые модели Yi-6B и Yi-34B были представлены 2 ноября 2023 года. В течение последующих недель линейка была дополнена вариантами с контекстом 200 тыс. токенов (5 ноября 2023), чат-вариантами и квантованными моделями (23 ноября 2023). В январе 2024 года вышли мультимодальные Yi-VL-6B и Yi-VL-34B. В марте 2024 года представлена модель Yi-9B, полученная методом глубинного масштабирования (depth upscaling) из Yi-6B, и опубликован технический отчёт arXiv:2403.04652.[1][2]
Yi-1.5 и специализированные модели (2024)
13 мая 2024 года выпущена серия Yi-1.5 (6B/9B/34B) — результат непрерывного предобучения на дополнительных 500 млрд токенов и дообучения на 3 млн примеров инструкций. В мае–июне 2024 года представлена закрытая проприетарная модель Yi-Large с API-доступом, позиционируемая как SOTA. В сентябре 2024 года вышла специализированная серия Yi-Coder (1.5B/9B) для кодогенерации с контекстом 128 тыс. токенов и поддержкой 52 языков программирования.[1][6][7]
Yi-Lightning (2024)
В октябре 2024 года представлена флагманская модель Yi-Lightning на основе архитектуры Mixture-of-Experts (MoE), оптимизированная для скорости и эффективности вывода. Yi-Lightning заняла 6-е место в общем рейтинге LMSYS Chatbot Arena (Elo 1287), 2-е место по китайскому языку и 3–4-е место по математике и кодированию. Технический отчёт опубликован в декабре 2024 года (arXiv:2412.01253).[8]
Смена стратегии (2025)
В марте 2025 года компания 01.AI объявила о прекращении предобучения новых крупных языковых моделей и сосредоточилась на корпоративных приложениях, многоагентных системах и платформе WorldWise LLM Platform 2.5 на базе сторонних моделей (включая DeepSeek).[4]
Сводная хронология
| Дата | Событие |
|---|---|
| Ноябрь 2023 | Релиз Yi-6B и Yi-34B (base, chat, 200K-варианты) |
| Январь 2024 | Мультимодальные Yi-VL-6B и Yi-VL-34B |
| Март 2024 | Yi-9B (depth-upscaled); публикация технического отчёта arXiv:2403.04652 |
| Май 2024 | Yi-1.5 (6B/9B/34B); Yi-Large (закрытая, API) |
| Сентябрь 2024 | Yi-Coder-1.5B/9B (специализация на коде, контекст 128K) |
| Октябрь 2024 | Yi-Lightning (MoE-архитектура, флагманская модель) |
| Декабрь 2024 | Публикация технического отчёта Yi-Lightning (arXiv:2412.01253) |
| Март 2025 | Прекращение предобучения новых LLM; фокус на корпоративных решениях |
Теоретические основы и архитектура
Базовая архитектура
Все модели семейства Yi основаны на архитектуре декодерного трансформера (decoder-only Transformer), описанной в работе Vaswani et al.[9] Модели обучены с нуля и не являются производными от LLaMA, несмотря на сходство реализации.[1]
Базовый механизм многоголового самовнимания (Multi-Head Self-Attention) описывается формулой:
где , , — матрицы запросов (queries), ключей (keys) и значений (values) соответственно, — размерность ключей.[9]
Ключевые архитектурные модификации Yi:[1]
- Grouped-Query Attention (GQA) — разделение query-голов на группы с общими key/value-головами, что снижает потребление памяти при сохранении качества.
- SwiGLU-активация — замена стандартной ReLU/GELU; уменьшает размер активаций до 8/3 от размерности скрытого слоя (hidden size).
- Rotary Position Embedding (RoPE) с адаптированной базовой частотой (adjusted base frequency, ABF), обеспечивающей расширение контекста без архитектурных изменений.
- Словарь (vocabulary): 64 000 токенов на основе BPE (SentencePiece) с разделением чисел на цифры и unicode-byte fallback для редких символов.
Конфигурации базовых моделей
Параметры архитектуры из технического отчёта arXiv:2403.04652:[1]
| Параметр | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| Число слоёв | 32 | 60 |
| Длина предобучения (Pretrain Seq. Len) | 4096 | 4096 |
| Макс. скорость обучения (Max LR) | 3×10⁻⁴ | 1,5×10⁻⁴ |
Источник: arXiv:2403.04652, таблица параметров.[1]
Архитектура Yi-Lightning (MoE)
Yi-Lightning (2024) использует улучшенную архитектуру Mixture-of-Experts (MoE) со следующими особенностями:[8]
- Fine-grained expert segmentation — мелкогранулярное разделение FFN-блоков на экспертов для повышения специализации.
- Многоуровневая балансировка нагрузки — комбинация Switch-Transformer (ST), Expert Parallel (EP) и Partitioned EP (PEP) losses для равномерного распределения токенов между экспертами.
- Гибридное внимание — чередование 3 слоёв со скользящим окном (sliding window) и 1 слоя с полным вниманием (full attention), с повторным использованием KV-кэша между слоями.
- Снижение памяти KV-кэша на 82,8 % по сравнению со стандартным подходом при обработке длинных последовательностей.
- Контекстное окно расширено до 64 тыс. токенов.
Точное число экспертов и общее количество параметров Yi-Lightning в публичных источниках не раскрыто.[8]
Мультимодальные варианты (Yi-VL)
В мультимодальных моделях Yi-VL языковая модель соединяется с визуальным энкодером CLIP ViT-H/14 через MLP-проекцию. Изображение преобразуется визуальным энкодером в последовательность эмбеддингов , которые подаются в языковую модель совместно с текстовыми токенами. Обучение проходит в три стадии с увеличением разрешения: 224×224 → 448×448 пикселей.[1]
Пайплайн обучения и выравнивание
Предварительное обучение (Pre-training)
Базовые модели Yi-6B и Yi-34B предобучены на билингвальном корпусе объёмом 3,1 трлн токенов. Данные проходят каскадный пайплайн фильтрации и дедупликации: эвристические фильтры, обученные скореры (perplexity, quality, coherence, safety), кластеризация и MinHash-дедупликация. Источники — Common Crawl, книги и научные статьи.[1]
Для Yi-1.5 выполнено непрерывное предобучение (continued pre-training) на дополнительных 500 млрд токенов высококачественного корпуса.[7]
Контролируемое дообучение (Supervised Fine-Tuning, SFT)
Чат-варианты первого поколения дообучены на малом, но тщательно выверенном наборе — менее 10 тыс. многооборотных (multi-turn) примеров, каждый из которых вручную проверен и отредактирован инженерами машинного обучения. Для Yi-1.5 объём SFT-данных увеличен до 3 млн примеров.[1][7]
Выравнивание с помощью обучения с подкреплением
Для Yi-Lightning применяется многоэтапный процесс выравнивания: SFT с последующим RLHF/DPO. Синтетические данные генерируются с использованием Monte Carlo Tree Search (MCTS). Фреймворк безопасности RAISE реализует четырёхуровневую защиту: фильтрация данных предобучения, safety fine-tuning, входной контроль промптов и выходной контроль ответов.[8]
Расширение контекста
Расширение контекстного окна до 200 тыс. токенов реализовано через лёгкое непрерывное предобучение на 5 млрд токенов (книги + синтетические вопрос-ответ) с использованием техники RoPE ABF. После доработки точность в задаче Needle-in-a-Haystack (поиск целевого фрагмента в длинном тексте) достигает 99,8 %.[1][2]
Глубинное масштабирование (Depth Upscaling)
Yi-9B получена путём дублирования слоёв 12–28 базовой модели Yi-6B с последующим предобучением на 800 млрд токенов. Метод обеспечивает увеличение ёмкости модели без обучения с нуля.[1]
Состав семейства моделей
Основные языковые модели
| Модель | Параметры | Тип | Контекст | Дата релиза | Лицензия | Примечание |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | 6 млрд / 34 млрд | Base / Chat | 4K (расш. до 32K) | Ноябрь 2023 | Apache 2.0 | Базовые модели, обученные с нуля |
| Yi-6B-200K / Yi-34B-200K | 6 млрд / 34 млрд | Base | 200K | Ноябрь 2023 | Apache 2.0 | Непрерывное предобучение на длинных последовательностях |
| Yi-9B | 9 млрд | Base | 4K (расш. до 200K) | Март 2024 | Apache 2.0 | Depth-upscale из Yi-6B + 800 млрд токенов |
| Yi-1.5-6B/9B/34B | 6 / 9 / 34 млрд | Base / Chat | 4K / 16K / 32K | Май 2024 | Apache 2.0 | +500 млрд токенов + 3 млн SFT-примеров |
| Yi-Large | ~1 трлн (MoE, активных не раскрыто) | LLM | Не раскрыт | Май 2024 | Закрытая (API) | Позиционируется как SOTA |
| Yi-Lightning | MoE (число экспертов не раскрыто) | LLM | 64K | Октябрь 2024 | API | 6-е место LMSYS Chatbot Arena |
Источники: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]
Специализированные модели
| Модель | Параметры | Модальности | Контекст | Дата релиза | Примечание |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | 6 / 34 млрд | Текст + изображения (448×448) | Стандартный базовой модели | Январь 2024 | ViT-энкодер (CLIP ViT-H/14), трёхстадийное обучение |
| Yi-Coder-1.5B / Yi-Coder-9B | 1,5 / 9 млрд | Текст (код) | 128K | Сентябрь 2024 | 52 языка программирования |
Источники: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]
Идентификаторы API
Примеры на платформе 01.AI и сторонних провайдерах: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]
Оценка и бенчмарки
Результаты базовых моделей
Данные из технического отчёта arXiv:2403.04652 (условия: 0-shot / 5-shot, в зависимости от бенчмарка):[1]
| Бенчмарк | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63,2 | 76,3 | 62,6 | 69,7 | 66,7 | — |
| BBH | 42,8 | 54,3 | 44,1 | — | 53,4 | — |
| C-Eval | 72,0 | 81,4 | — | 50,1 | 72,1 | 70,1 |
| CMMLU | 75,5 | 83,7 | — | 53,3 | 71,0 | 52,5 |
| GSM8K | 32,5 | 67,2 | 42,2 | 56,8 | 61,3 | 57,1 |
| HumanEval | 15,9 | 23,2 | 22,6 | 31,7 | 32,3 | 48,1 |
Источник: arXiv:2403.04652, таблицы результатов.[1]
Yi-34B продемонстрировала результаты, превосходящие Llama 2-70B (при вдвое меньшем размере) на большинстве бенчмарков и лидирующие среди открытых моделей на C-Eval и CMMLU на момент релиза.[1][12]
Результаты Yi-Lightning
Данные из технического отчёта arXiv:2412.01253 (условия: 0-shot, где не указано иное):[8]
| Бенчмарк | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50,9 | 49,1 | 45,1 |
| MATH | 76,4 | 82,7 | 67,1 |
| HumanEval | 83,5 | 86,0 | 76,2 |
| WildBench | 65,1 | 59,9 | 49,0 |
| Arena-Hard | 91,8 | 90,5 | 74,0 |
Источник: arXiv:2412.01253.[8]
Пользовательские рейтинги
Yi-34B-Chat занимала 2-е место на AlpacaEval (94,08 %, после GPT-4 Turbo) в декабре 2023 — январе 2024 года, с рейтингом Elo ~1110 на LMSYS Chatbot Arena. Yi-34B лидировала среди открытых моделей на Hugging Face Open LLM Leaderboard и C-Eval на момент релиза.[2][1]
Yi-Lightning заняла 6-е общее место на LMSYS Chatbot Arena (score 1287), 2-е место по китайскому языку и 3–4-е места в подкатегориях «математика», «кодирование», «hard prompts» и «multi-turn» на момент публикации отчёта.[8]
Примечание. Прямое сравнение моделей из разных релизов и конфигураций требует единообразных условий тестирования (одни и те же версии бенчмарков, одинаковые параметры генерации). Субъективные оценки на краудсорсинговых платформах зависят от состава участников и текущего набора моделей в системе.[12]
Применение
Семейство Yi применяется в широком диапазоне задач обработки естественного языка и мультимодального анализа:[3][13]
- Чат-ассистенты и диалоговые системы — на базе чат-вариантов Yi-34B-Chat и Yi-1.5.
- Генерация и анализ кода — Yi-Coder поддерживает 52 языка программирования.
- Анализ длинных документов — варианты с контекстом 200K для юридических, технических и аналитических задач.
- Мультимодальный анализ — описание изображений и визуальный вопрос-ответ через Yi-VL.
- Корпоративные агенты — RAG-системы, поиск знаний и классификация данных через платформу 01.AI.
- Локальное развёртывание — через vLLM, llama.cpp, Hugging Face Transformers; квантованные версии (AWQ/GPTQ 4/8-bit) доступны для развёртывания на потребительских GPU (например, RTX 4090 для Yi-34B-4bit).
API-варианты (Yi-Large, Yi-Lightning) используются для чат-ботов, мультиязычных сервисов и low-cost inference. Стоимость инференса Yi-Lightning составляла 14 центов за миллион токенов по состоянию на 2024 год.[8]
Ограничения и открытые проблемы
- Галлюцинации. Модели подвержены типичным для LLM фактическим ошибкам в генерируемых ответах, особенно в сложных рассуждениях и длинных цепочках вывода.[1]
- Математика и код в ранних версиях. Базовые модели Yi-34B показывают более слабые результаты в сложном кодировании и математике по сравнению со специализированными frontier-моделями (например, MATH Yi-34B в 4-shot — 14,4). Эта проблема частично решена в Yi-1.5 и Yi-Lightning.[1][8]
- Длинный контекст. Расширение до 200K требует дополнительного предобучения и вычислительных ресурсов; возможна незначительная деградация производительности на коротком контексте.[1]
- Закрытые модели. Yi-Large и Yi-Lightning не предоставляют весов для скачивания, что ограничивает независимую верификацию архитектуры и данных.[8]
- Разрыв между Arena и бенчмарками. Yi-Lightning демонстрирует сильные результаты в пользовательских оценках (Chatbot Arena), но отстаёт от некоторых конкурентов на статических академических бенчмарках — отражение общей проблемы несоответствия метрик.[8]
- Воспроизводимость. Не все детали обучения (точный состав датасета, распределение доменов, гиперпараметры) полностью раскрыты.[13]
- Чувствительность к промптам. Как и другие LLM, модели Yi чувствительны к формулировке промпта, что влияет на стабильность выводов.[1]
Известных серьёзных регрессий после релизов не зафиксировано; сообщество отмечает стабильность квантованных версий.[2]
Этические и регуляторные аспекты
В Yi-Lightning внедрён фреймворк безопасности RAISE, реализующий четырёхуровневую защиту:[8]
- Фильтрация токсичного контента, PII и вредоносных материалов на этапе предобучения.
- Safety fine-tuning с примерами корректной обработки чувствительных запросов.
- Входной контроль (классификация промптов).
- Выходной контроль (фильтрация ответов).
Лицензия Apache 2.0 для открытых моделей разрешает коммерческое использование; отдельные хостинги могут предъявлять дополнительные требования. Модели соответствуют китайским регуляторным нормам в области ИИ (сертификация CAICT для корпоративных решений).[1][3]
Перспективы и направления исследований
Серия Yi демонстрирует эффективность подхода, ставящего качество данных выше объёма параметров, а также лёгкого масштабирования (continual pretraining, depth upscaling, MoE-оптимизации).[1]
После 2025 года акцент 01.AI сместился на прикладные решения:[4]
- Многоагентные системы и enterprise-платформа WorldWise LLM Platform 2.5.
- Интеграция сторонних моделей (включая DeepSeek) в корпоративные workflow.
- Оптимизация инференса (квантование, FP8) для снижения стоимости развёртывания.
Открытые модели продолжают использоваться сообществом для исследований, fine-tuning и дистилляции.[6]
См. также
Ссылки
- https://github.com/01-ai/Yi — Официальный GitHub-репозиторий Yi
- https://github.com/01-ai/Yi-1.5 — Репозиторий Yi-1.5
- https://www.01.ai/yi-models — Официальная страница моделей Yi
- https://huggingface.co/01-ai — Организация 01-ai на Hugging Face
- https://en.wikipedia.org/wiki/01.AI — Статья Wikipedia о компании 01.AI
Литература
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
Примечания
- ↑ 1,00 1,01 1,02 1,03 1,04 1,05 1,06 1,07 1,08 1,09 1,10 1,11 1,12 1,13 1,14 1,15 1,16 1,17 1,18 1,19 1,20 1,21 1,22 1,23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2,0 2,1 2,2 2,3 2,4 2,5 2,6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3,0 3,1 3,2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4,0 4,1 4,2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6,0 6,1 6,2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7,0 7,1 7,2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8,00 8,01 8,02 8,03 8,04 8,05 8,06 8,07 8,08 8,09 8,10 8,11 8,12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9,0 9,1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12,0 12,1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13,0 13,1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms