Yi (01.AI) (BG)
Yi — семейство от големи езикови модели (Large Language Model, LLM) и визуално-езикови модели (Vision-Language Model, VLM), разработено от компанията 01.AI (零一万物) под ръководството на Кай-Фу Ли (Kai-Fu Lee). Моделите са обучени от нулата върху висококачествен двуезичен корпус (английски и китайски език) с обем 3,1 трлн токена и включват варианти за генериране на текст, обработка на дълъг контекст (до 200 хил. токена), мултимодален вход (текст + изображения), генериране на код и ефективен извод на базата на архитектурата Mixture-of-Experts (MoE). Отворените варианти се разпространяват под лиценз Apache 2.0 с разрешение за търговска употреба; затворените флагмански модели (Yi-Large, Yi-Lightning) са достъпни чрез API.[1][2][3]
История и хронология на развитието
Компанията 01.AI е основана през март 2023 година от Кай-Фу Ли, бивш ръководител на Microsoft Research Asia и Google China, с централа в Пекин. Фокусът на компанията е разработване на ефективни LLM с акцент върху качеството на данните и инженерната оптимизация на инфраструктурата. До ноември 2023 година 01.AI достига статут на „еднорог" (оценка над 1 млрд. долара) след рунд на финансиране с участието на Alibaba.[4][5]
Първо поколение (2023–2024)
Първите отворени модели Yi-6B и Yi-34B бяха представени на 2 ноември 2023 година. През следващите седмици линията беше допълнена с варианти с контекст от 200 хил. токена (5 ноември 2023), чат-варианти и квантизирани модели (23 ноември 2023). През януари 2024 година излязоха мултимодалните Yi-VL-6B и Yi-VL-34B. През март 2024 година беше представен моделът Yi-9B, получен чрез метода на дълбочинно мащабиране (depth upscaling) от Yi-6B, и беше публикуван технически доклад arXiv:2403.04652.[1][2]
Yi-1.5 и специализирани модели (2024)
На 13 май 2024 година беше пусната серията Yi-1.5 (6B/9B/34B) — резултат от непрекъснато предобучение върху допълнителни 500 млрд. токена и дообучение върху 3 млн. примера с инструкции. През май–юни 2024 година беше представен затвореният проприетарен модел Yi-Large с API-достъп, позициониран като SOTA. През септември 2024 година излезе специализираната серия Yi-Coder (1.5B/9B) за генериране на код с контекст от 128 хил. токена и поддръжка на 52 езика за програмиране.[1][6][7]
Yi-Lightning (2024)
През октомври 2024 година беше представен флагманският модел Yi-Lightning на базата на архитектурата Mixture-of-Experts (MoE), оптимизиран за скорост и ефективност на извода. Yi-Lightning зае 6-то място в общата класация на LMSYS Chatbot Arena (Elo 1287), 2-ро място по китайски език и 3–4-то място по математика и кодиране. Техническият доклад беше публикуван през декември 2024 година (arXiv:2412.01253).[8]
Промяна на стратегията (2025)
През март 2025 година компанията 01.AI обяви прекратяване на предобучението на нови големи езикови модели и се съсредоточи върху корпоративни приложения, многоагентни системи и платформата WorldWise LLM Platform 2.5 на базата на модели на трети страни (включително DeepSeek).[4]
Обобщена хронология
| Дата | Събитие |
|---|---|
| Ноември 2023 | Пускане на Yi-6B и Yi-34B (base, chat, 200K-варианти) |
| Януари 2024 | Мултимодални Yi-VL-6B и Yi-VL-34B |
| Март 2024 | Yi-9B (depth-upscaled); публикуване на технически доклад arXiv:2403.04652 |
| Май 2024 | Yi-1.5 (6B/9B/34B); Yi-Large (затворена, API) |
| Септември 2024 | Yi-Coder-1.5B/9B (специализация в код, контекст 128K) |
| Октомври 2024 | Yi-Lightning (MoE-архитектура, флагмански модел) |
| Декември 2024 | Публикуване на технически доклад Yi-Lightning (arXiv:2412.01253) |
| Март 2025 | Прекратяване на предобучението на нови LLM; фокус върху корпоративни решения |
Теоретични основи и архитектура
Базова архитектура
Всички модели от семейството Yi се основават на архитектурата на декодерен transformer (decoder-only Transformer), описана в работата на Vaswani et al.[9] Моделите са обучени от нулата и не са производни от LLaMA, въпреки сходството в реализацията.[1]
Базовият механизъм на многоглавото самовнимание (Multi-Head Self-Attention) се описва с формулата:
където , , — матрици на заявките (queries), ключовете (keys) и стойностите (values) съответно, — размерност на ключовете.[9]
Ключови архитектурни модификации на Yi:[1]
- Grouped-Query Attention (GQA) — разделяне на query-главите на групи с общи key/value-глави, което намалява потреблението на памет при запазване на качеството.
- SwiGLU-активация — замяна на стандартния ReLU/GELU; намалява размера на активациите до 8/3 от размерността на скрития слой (hidden size).
- Rotary Position Embedding (RoPE) с адаптирана базова честота (adjusted base frequency, ABF), осигуряваща разширяване на контекста без архитектурни промени.
- Речник (vocabulary): 64 000 токена на основата на BPE (SentencePiece) с разделяне на числата на цифри и unicode-byte fallback за редки символи.
Конфигурации на базовите модели
Параметри на архитектурата от техническия доклад arXiv:2403.04652:[1]
| Параметър | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| Брой слоеве | 32 | 60 |
| Дължина на предобучение (Pretrain Seq. Len) | 4096 | 4096 |
| Макс. скорост на обучение (Max LR) | 3×10⁻⁴ | 1,5×10⁻⁴ |
Източник: arXiv:2403.04652, таблица с параметри.[1]
Архитектура на Yi-Lightning (MoE)
Yi-Lightning (2024) използва подобрена архитектура Mixture-of-Experts (MoE) със следните особености:[8]
- Fine-grained expert segmentation — дребнозърнесто разделяне на FFN-блоковете на експерти за повишаване на специализацията.
- Многостепенно балансиране на натоварването — комбинация от Switch-Transformer (ST), Expert Parallel (EP) и Partitioned EP (PEP) загуби за равномерно разпределение на токените между експертите.
- Хибридно внимание — редуване на 3 слоя с плъзгащ се прозорец (sliding window) и 1 слой с пълно внимание (full attention), с повторно използване на KV-кэш между слоевете.
- Намаляване на паметта за KV-кэш с 82,8 % в сравнение со стандартния подход при обработка на дълги последователности.
- Контекстен прозорец разширен до 64 хил. токена.
Точният брой на експертите и общият брой параметри на Yi-Lightning не са разкрити в публичните източници.[8]
Мултимодални варианти (Yi-VL)
В мултимодалните модели Yi-VL езиковият модел се свързва с визуален енкодер CLIP ViT-H/14 чрез MLP-проекция. Изображението се преобразува от визуалния енкодер в последователност от embedding-и , които се подават в езиковия модел заедно с текстовите токени. Обучението протича в три етапа с увеличаване на разделителната способност: 224×224 → 448×448 пиксела.[1]
Конвейер на обучението и изравняване
Предварително обучение (Pre-training)
Базовите модели Yi-6B и Yi-34B са предобучени върху двуезичен корпус с обем 3,1 трлн. токена. Данните преминават каскаден конвейер за филтриране и дедупликация: евристични филтри, обучени скорери (perplexity, quality, coherence, safety), клъстеризация и MinHash-дедупликация. Източници — Common Crawl, книги и научни статии.[1]
За Yi-1.5 е извършено непрекъснато предобучение (continued pre-training) върху допълнителни 500 млрд. токена висококачествен корпус.[7]
Контролирано дообучение (Supervised Fine-Tuning, SFT)
Чат-вариантите на първото поколение са дообучени върху малък, но внимателно проверен набор — по-малко от 10 хил. многооборотни (multi-turn) примера, всеки от които е ръчно проверен и редактиран от инженери по машинно обучение. За Yi-1.5 обемът на SFT-данните е увеличен до 3 млн. примера.[1][7]
Изравняване чрез обучение с подкрепление
За Yi-Lightning се прилага многоетапен процес на изравняване: SFT с последващ RLHF/DPO. Синтетични данни се генерират с използване на Monte Carlo Tree Search (MCTS). Рамката за безопасност RAISE реализира четиристепенна защита: филтриране на данните от предобучението, safety fine-tuning, входен контрол на prompt-овете и изходен контрол на отговорите.[8]
Разширяване на контекста
Разширяването на контекстния прозорец до 200 хил. токена е реализирано чрез леко непрекъснато предобучение върху 5 млрд. токена (книги + синтетични въпроси-отговори) с използване на техниката RoPE ABF. След доработката точността в задачата Needle-in-a-Haystack (търсене на целеви фрагмент в дълъг текст) достига 99,8 %.[1][2]
Дълбочинно мащабиране (Depth Upscaling)
Yi-9B е получен чрез дублиране на слоеве 12–28 от базовия модел Yi-6B с последващо предобучение върху 800 млрд. токена. Методът осигурява увеличаване на капацитета на модела без обучение от нулата.[1]
Състав на семейството от модели
Основни езикови модели
| Модел | Параметри | Тип | Контекст | Дата на пускане | Лиценз | Забележка |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | 6 млрд. / 34 млрд. | Base / Chat | 4K (разш. до 32K) | Ноември 2023 | Apache 2.0 | Базови модели, обучени от нулата |
| Yi-6B-200K / Yi-34B-200K | 6 млрд. / 34 млрд. | Base | 200K | Ноември 2023 | Apache 2.0 | Непрекъснато предобучение върху дълги последователности |
| Yi-9B | 9 млрд. | Base | 4K (разш. до 200K) | Март 2024 | Apache 2.0 | Depth-upscale от Yi-6B + 800 млрд. токена |
| Yi-1.5-6B/9B/34B | 6 / 9 / 34 млрд. | Base / Chat | 4K / 16K / 32K | Май 2024 | Apache 2.0 | +500 млрд. токена + 3 млн. SFT-примера |
| Yi-Large | ~1 трлн. (MoE, активните не са разкрити) | LLM | Не е разкрит | Май 2024 | Затворен (API) | Позициониран като SOTA |
| Yi-Lightning | MoE (броят на експертите не е разкрит) | LLM | 64K | Октомври 2024 | API | 6-то място LMSYS Chatbot Arena |
Източници: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]
Специализирани модели
| Модел | Параметри | Модалности | Контекст | Дата на пускане | Забележка |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | 6 / 34 млрд. | Текст + изображения (448×448) | Стандартен за базовия модел | Януари 2024 | ViT-енкодер (CLIP ViT-H/14), триетапно обучение |
| Yi-Coder-1.5B / Yi-Coder-9B | 1,5 / 9 млрд. | Текст (код) | 128K | Септември 2024 | 52 езика за програмиране |
Източници: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]
Идентификатори на API
Примери на платформата 01.AI и при доставчици на трети страни: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]
Оценка и benchmark-ове
Резултати на базовите модели
Данни от техническия доклад arXiv:2403.04652 (условия: 0-shot / 5-shot, в зависимост от benchmark-а):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63,2 | 76,3 | 62,6 | 69,7 | 66,7 | — |
| BBH | 42,8 | 54,3 | 44,1 | — | 53,4 | — |
| C-Eval | 72,0 | 81,4 | — | 50,1 | 72,1 | 70,1 |
| CMMLU | 75,5 | 83,7 | — | 53,3 | 71,0 | 52,5 |
| GSM8K | 32,5 | 67,2 | 42,2 | 56,8 | 61,3 | 57,1 |
| HumanEval | 15,9 | 23,2 | 22,6 | 31,7 | 32,3 | 48,1 |
Източник: arXiv:2403.04652, таблици с резултати.[1]
Yi-34B демонстрира резултати, надвишаващи тези на Llama 2-70B (при двойно по-малък размер) на повечето benchmark-ове, и водещи сред отворените модели на C-Eval и CMMLU към момента на пускане.[1][12]
Резултати на Yi-Lightning
Данни от техническия доклад arXiv:2412.01253 (условия: 0-shot, където не е посочено друго):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50,9 | 49,1 | 45,1 |
| MATH | 76,4 | 82,7 | 67,1 |
| HumanEval | 83,5 | 86,0 | 76,2 |
| WildBench | 65,1 | 59,9 | 49,0 |
| Arena-Hard | 91,8 | 90,5 | 74,0 |
Източник: arXiv:2412.01253.[8]
Потребителски рейтинги
Yi-34B-Chat заемаше 2-ро място на AlpacaEval (94,08 %, след GPT-4 Turbo) през декември 2023 — януари 2024 година, с рейтинг Elo ~1110 на LMSYS Chatbot Arena. Yi-34B водеше сред отворените модели на Hugging Face Open LLM Leaderboard и C-Eval към момента на пускане.[2][1]
Yi-Lightning зае 6-то общо място на LMSYS Chatbot Arena (score 1287), 2-ро място по китайски език и 3–4-то места в подкатегориите „математика", „кодиране", „hard prompts" и „multi-turn" към момента на публикуване на доклада.[8]
Забележка. Прякото сравнение на модели от различни пускания и конфигурации изисква единни условия за тестване (едни и същи версии на benchmark-овете, еднакви параметри на генериране). Субективните оценки на платформи с краудсорсинг зависят от състава на участниците и текущия набор от модели в системата.[12]
Приложение
Семейството Yi се прилага в широк диапазон от задачи за обработка на естествен език и мултимодален анализ:[3][13]
- Чат-асистенти и диалогови системи — на базата на чат-вариантите Yi-34B-Chat и Yi-1.5.
- Генериране и анализ на код — Yi-Coder поддържа 52 езика за програмиране.
- Анализ на дълги документи — варианти с контекст 200K за юридически, технически и аналитични задачи.
- Мултимодален анализ — описание на изображения и визуален въпрос-отговор чрез Yi-VL.
- Корпоративни агенти — RAG-системи, търсене на знания и класификация на данни чрез платформата 01.AI.
- Локално разгръщане — чрез vLLM, llama.cpp, Hugging Face Transformers; квантизирани версии (AWQ/GPTQ 4/8-bit) са достъпни за разгръщане на потребителски GPU (например RTX 4090 за Yi-34B-4bit).
API-вариантите (Yi-Large, Yi-Lightning) се използват за чат-ботове, многоезични услуги и нискозатратен inference. Стойността на inference на Yi-Lightning възлизаше на 14 цента за милион токена към 2024 година.[8]
Ограничения и открити проблеми
- Халюцинации. Моделите са подложени на типичните за LLM фактически грешки в генерираните отговори, особено при сложни разсъждения и дълги вериги на извод.[1]
- Математика и код в ранните версии. Базовите модели Yi-34B показват по-слаби резултати при сложно кодиране и математика в сравнение със специализираните frontier-модели (например MATH Yi-34B в 4-shot — 14,4). Този проблем е частично решен в Yi-1.5 и Yi-Lightning.[1][8]
- Дълъг контекст. Разширяването до 200K изисква допълнително предобучение и изчислителни ресурси; възможна е незначителна деградация на производителността при кратък контекст.[1]
- Затворени модели. Yi-Large и Yi-Lightning не предоставят тегла за изтегляне, което ограничава независимата верификация на архитектурата и данните.[8]
- Разрив между Arena и benchmark-овете. Yi-Lightning демонстрира силни резултати в потребителските оценки (Chatbot Arena), но изостава от някои конкуренти на статичните академични benchmark-ове — отражение на общия проблем за несъответствие на метриките.[8]
- Възпроизводимост. Не всички детайли на обучението (точен състав на dataset-а, разпределение на домейните, хиперпараметри) са напълно разкрити.[13]
- Чувствителност към prompt-овете. Както и другите LLM, моделите Yi са чувствителни към формулировката на prompt-а, което влияе върху стабилността на изводите.[1]
Известни сериозни регресии след пусканията не са регистрирани; общността отбелязва стабилността на квантизираните версии.[2]
Етични и регулаторни аспекти
В Yi-Lightning е внедрена рамката за безопасност RAISE, реализираща четиристепенна защита:[8]
- Филтриране на токсично съдържание, PII и вредоносни материали на етапа на предобучението.
- Safety fine-tuning с примери за правилна обработка на чувствителни заявки.
- Входен контрол (класификация на prompt-овете).
- Изходен контрол (филтриране на отговорите).
Лицензът Apache 2.0 за отворените модели разрешава търговска употреба; отделните хостинги могат да предявяват допълнителни изисквания. Моделите отговарят на китайските регулаторни норми в областта на ИИ (сертификация CAICT за корпоративни решения).[1][3]
Перспективи и направления на изследванията
Серията Yi демонстрира ефективността на подхода, поставящ качеството на данните над обема на параметрите, както и на лекото мащабиране (continual pretraining, depth upscaling, MoE-оптимизации).[1]
След 2025 година акцентът на 01.AI се измести към приложни решения:[4]
- Многоагентни системи и enterprise-платформа WorldWise LLM Platform 2.5.
- Интегриране на модели на трети страни (включително DeepSeek) в корпоративни workflow.
- Оптимизация на inference (квантизация, FP8) за намаляване на разходите за разгръщане.
Отворените модели продължават да се използват от общността за изследвания, fine-tuning и дистилация.[6]
Литература
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
Връзки
- https://github.com/01-ai/Yi — Официално GitHub-хранилище на Yi
- https://github.com/01-ai/Yi-1.5 — Хранилище на Yi-1.5
- https://www.01.ai/yi-models — Официална страница на моделите Yi
- https://huggingface.co/01-ai — Организация 01-ai в Hugging Face
- https://en.wikipedia.org/wiki/01.AI — Статия в Wikipedia за компанията 01.AI
Бележки
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms