Yi (01.AI) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — семейство от големи езикови модели (Large Language Model, LLM) и визуално-езикови модели (Vision-Language Model, VLM), разработено от компанията 01.AI (零一万物) под ръководството на Кай-Фу Ли (Kai-Fu Lee). Моделите са обучени от нулата върху висококачествен двуезичен корпус (английски и китайски език) с обем 3,1 трлн токена и включват варианти за генериране на текст, обработка на дълъг контекст (до 200 хил. токена), мултимодален вход (текст + изображения), генериране на код и ефективен извод на базата на архитектурата Mixture-of-Experts (MoE). Отворените варианти се разпространяват под лиценз Apache 2.0 с разрешение за търговска употреба; затворените флагмански модели (Yi-Large, Yi-Lightning) са достъпни чрез API.[1][2][3]

История и хронология на развитието

Компанията 01.AI е основана през март 2023 година от Кай-Фу Ли, бивш ръководител на Microsoft Research Asia и Google China, с централа в Пекин. Фокусът на компанията е разработване на ефективни LLM с акцент върху качеството на данните и инженерната оптимизация на инфраструктурата. До ноември 2023 година 01.AI достига статут на „еднорог" (оценка над 1 млрд. долара) след рунд на финансиране с участието на Alibaba.[4][5]

Първо поколение (2023–2024)

Първите отворени модели Yi-6B и Yi-34B бяха представени на 2 ноември 2023 година. През следващите седмици линията беше допълнена с варианти с контекст от 200 хил. токена (5 ноември 2023), чат-варианти и квантизирани модели (23 ноември 2023). През януари 2024 година излязоха мултимодалните Yi-VL-6B и Yi-VL-34B. През март 2024 година беше представен моделът Yi-9B, получен чрез метода на дълбочинно мащабиране (depth upscaling) от Yi-6B, и беше публикуван технически доклад arXiv:2403.04652.[1][2]

Yi-1.5 и специализирани модели (2024)

На 13 май 2024 година беше пусната серията Yi-1.5 (6B/9B/34B) — резултат от непрекъснато предобучение върху допълнителни 500 млрд. токена и дообучение върху 3 млн. примера с инструкции. През май–юни 2024 година беше представен затвореният проприетарен модел Yi-Large с API-достъп, позициониран като SOTA. През септември 2024 година излезе специализираната серия Yi-Coder (1.5B/9B) за генериране на код с контекст от 128 хил. токена и поддръжка на 52 езика за програмиране.[1][6][7]

Yi-Lightning (2024)

През октомври 2024 година беше представен флагманският модел Yi-Lightning на базата на архитектурата Mixture-of-Experts (MoE), оптимизиран за скорост и ефективност на извода. Yi-Lightning зае 6-то място в общата класация на LMSYS Chatbot Arena (Elo 1287), 2-ро място по китайски език и 3–4-то място по математика и кодиране. Техническият доклад беше публикуван през декември 2024 година (arXiv:2412.01253).[8]

Промяна на стратегията (2025)

През март 2025 година компанията 01.AI обяви прекратяване на предобучението на нови големи езикови модели и се съсредоточи върху корпоративни приложения, многоагентни системи и платформата WorldWise LLM Platform 2.5 на базата на модели на трети страни (включително DeepSeek).[4]

Обобщена хронология

Дата Събитие
Ноември 2023 Пускане на Yi-6B и Yi-34B (base, chat, 200K-варианти)
Януари 2024 Мултимодални Yi-VL-6B и Yi-VL-34B
Март 2024 Yi-9B (depth-upscaled); публикуване на технически доклад arXiv:2403.04652
Май 2024 Yi-1.5 (6B/9B/34B); Yi-Large (затворена, API)
Септември 2024 Yi-Coder-1.5B/9B (специализация в код, контекст 128K)
Октомври 2024 Yi-Lightning (MoE-архитектура, флагмански модел)
Декември 2024 Публикуване на технически доклад Yi-Lightning (arXiv:2412.01253)
Март 2025 Прекратяване на предобучението на нови LLM; фокус върху корпоративни решения

Теоретични основи и архитектура

Базова архитектура

Всички модели от семейството Yi се основават на архитектурата на декодерен transformer (decoder-only Transformer), описана в работата на Vaswani et al.[9] Моделите са обучени от нулата и не са производни от LLaMA, въпреки сходството в реализацията.[1]

Базовият механизъм на многоглавото самовнимание (Multi-Head Self-Attention) се описва с формулата:

Attention(Q,K,V)=softmax(QKopdk)V

където Q, K, V — матрици на заявките (queries), ключовете (keys) и стойностите (values) съответно, dk — размерност на ключовете.[9]

Ключови архитектурни модификации на Yi:[1]

  • Grouped-Query Attention (GQA) — разделяне на query-главите на групи с общи key/value-глави, което намалява потреблението на памет при запазване на качеството.
  • SwiGLU-активация — замяна на стандартния ReLU/GELU; намалява размера на активациите до 8/3 от размерността на скрития слой (hidden size).
  • Rotary Position Embedding (RoPE) с адаптирана базова честота (adjusted base frequency, ABF), осигуряваща разширяване на контекста без архитектурни промени.
  • Речник (vocabulary): 64 000 токена на основата на BPE (SentencePiece) с разделяне на числата на цифри и unicode-byte fallback за редки символи.

Конфигурации на базовите модели

Параметри на архитектурата от техническия доклад arXiv:2403.04652:[1]

Параметър Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
Брой слоеве 32 60
Дължина на предобучение (Pretrain Seq. Len) 4096 4096
Макс. скорост на обучение (Max LR) 3×10⁻⁴ 1,5×10⁻⁴

Източник: arXiv:2403.04652, таблица с параметри.[1]

Архитектура на Yi-Lightning (MoE)

Yi-Lightning (2024) използва подобрена архитектура Mixture-of-Experts (MoE) със следните особености:[8]

  • Fine-grained expert segmentation — дребнозърнесто разделяне на FFN-блоковете на експерти за повишаване на специализацията.
  • Многостепенно балансиране на натоварването — комбинация от Switch-Transformer (ST), Expert Parallel (EP) и Partitioned EP (PEP) загуби за равномерно разпределение на токените между експертите.
  • Хибридно внимание — редуване на 3 слоя с плъзгащ се прозорец (sliding window) и 1 слой с пълно внимание (full attention), с повторно използване на KV-кэш между слоевете.
  • Намаляване на паметта за KV-кэш с 82,8 % в сравнение со стандартния подход при обработка на дълги последователности.
  • Контекстен прозорец разширен до 64 хил. токена.

Точният брой на експертите и общият брой параметри на Yi-Lightning не са разкрити в публичните източници.[8]

Мултимодални варианти (Yi-VL)

В мултимодалните модели Yi-VL езиковият модел се свързва с визуален енкодер CLIP ViT-H/14 чрез MLP-проекция. Изображението I се преобразува от визуалния енкодер в последователност от embedding-и {v1,,vK}, които се подават в езиковия модел заедно с текстовите токени. Обучението протича в три етапа с увеличаване на разделителната способност: 224×224 → 448×448 пиксела.[1]

Конвейер на обучението и изравняване

Предварително обучение (Pre-training)

Базовите модели Yi-6B и Yi-34B са предобучени върху двуезичен корпус с обем 3,1 трлн. токена. Данните преминават каскаден конвейер за филтриране и дедупликация: евристични филтри, обучени скорери (perplexity, quality, coherence, safety), клъстеризация и MinHash-дедупликация. Източници — Common Crawl, книги и научни статии.[1]

За Yi-1.5 е извършено непрекъснато предобучение (continued pre-training) върху допълнителни 500 млрд. токена висококачествен корпус.[7]

Контролирано дообучение (Supervised Fine-Tuning, SFT)

Чат-вариантите на първото поколение са дообучени върху малък, но внимателно проверен набор — по-малко от 10 хил. многооборотни (multi-turn) примера, всеки от които е ръчно проверен и редактиран от инженери по машинно обучение. За Yi-1.5 обемът на SFT-данните е увеличен до 3 млн. примера.[1][7]

Изравняване чрез обучение с подкрепление

За Yi-Lightning се прилага многоетапен процес на изравняване: SFT с последващ RLHF/DPO. Синтетични данни се генерират с използване на Monte Carlo Tree Search (MCTS). Рамката за безопасност RAISE реализира четиристепенна защита: филтриране на данните от предобучението, safety fine-tuning, входен контрол на prompt-овете и изходен контрол на отговорите.[8]

Разширяване на контекста

Разширяването на контекстния прозорец до 200 хил. токена е реализирано чрез леко непрекъснато предобучение върху 5 млрд. токена (книги + синтетични въпроси-отговори) с използване на техниката RoPE ABF. След доработката точността в задачата Needle-in-a-Haystack (търсене на целеви фрагмент в дълъг текст) достига 99,8 %.[1][2]

Дълбочинно мащабиране (Depth Upscaling)

Yi-9B е получен чрез дублиране на слоеве 12–28 от базовия модел Yi-6B с последващо предобучение върху 800 млрд. токена. Методът осигурява увеличаване на капацитета на модела без обучение от нулата.[1]

Състав на семейството от модели

Основни езикови модели

Модел Параметри Тип Контекст Дата на пускане Лиценз Забележка
Yi-6B / Yi-34B 6 млрд. / 34 млрд. Base / Chat 4K (разш. до 32K) Ноември 2023 Apache 2.0 Базови модели, обучени от нулата
Yi-6B-200K / Yi-34B-200K 6 млрд. / 34 млрд. Base 200K Ноември 2023 Apache 2.0 Непрекъснато предобучение върху дълги последователности
Yi-9B 9 млрд. Base 4K (разш. до 200K) Март 2024 Apache 2.0 Depth-upscale от Yi-6B + 800 млрд. токена
Yi-1.5-6B/9B/34B 6 / 9 / 34 млрд. Base / Chat 4K / 16K / 32K Май 2024 Apache 2.0 +500 млрд. токена + 3 млн. SFT-примера
Yi-Large ~1 трлн. (MoE, активните не са разкрити) LLM Не е разкрит Май 2024 Затворен (API) Позициониран като SOTA
Yi-Lightning MoE (броят на експертите не е разкрит) LLM 64K Октомври 2024 API 6-то място LMSYS Chatbot Arena

Източници: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]

Специализирани модели

Модел Параметри Модалности Контекст Дата на пускане Забележка
Yi-VL-6B / Yi-VL-34B 6 / 34 млрд. Текст + изображения (448×448) Стандартен за базовия модел Януари 2024 ViT-енкодер (CLIP ViT-H/14), триетапно обучение
Yi-Coder-1.5B / Yi-Coder-9B 1,5 / 9 млрд. Текст (код) 128K Септември 2024 52 езика за програмиране

Източници: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]

Идентификатори на API

Примери на платформата 01.AI и при доставчици на трети страни: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]

Оценка и benchmark-ове

Резултати на базовите модели

Данни от техническия доклад arXiv:2403.04652 (условия: 0-shot / 5-shot, в зависимост от benchmark-а):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63,2 76,3 62,6 69,7 66,7
BBH 42,8 54,3 44,1 53,4
C-Eval 72,0 81,4 50,1 72,1 70,1
CMMLU 75,5 83,7 53,3 71,0 52,5
GSM8K 32,5 67,2 42,2 56,8 61,3 57,1
HumanEval 15,9 23,2 22,6 31,7 32,3 48,1

Източник: arXiv:2403.04652, таблици с резултати.[1]

Yi-34B демонстрира резултати, надвишаващи тези на Llama 2-70B (при двойно по-малък размер) на повечето benchmark-ове, и водещи сред отворените модели на C-Eval и CMMLU към момента на пускане.[1][12]

Резултати на Yi-Lightning

Данни от техническия доклад arXiv:2412.01253 (условия: 0-shot, където не е посочено друго):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50,9 49,1 45,1
MATH 76,4 82,7 67,1
HumanEval 83,5 86,0 76,2
WildBench 65,1 59,9 49,0
Arena-Hard 91,8 90,5 74,0

Източник: arXiv:2412.01253.[8]

Потребителски рейтинги

Yi-34B-Chat заемаше 2-ро място на AlpacaEval (94,08 %, след GPT-4 Turbo) през декември 2023 — януари 2024 година, с рейтинг Elo ~1110 на LMSYS Chatbot Arena. Yi-34B водеше сред отворените модели на Hugging Face Open LLM Leaderboard и C-Eval към момента на пускане.[2][1]

Yi-Lightning зае 6-то общо място на LMSYS Chatbot Arena (score 1287), 2-ро място по китайски език и 3–4-то места в подкатегориите „математика", „кодиране", „hard prompts" и „multi-turn" към момента на публикуване на доклада.[8]

Забележка. Прякото сравнение на модели от различни пускания и конфигурации изисква единни условия за тестване (едни и същи версии на benchmark-овете, еднакви параметри на генериране). Субективните оценки на платформи с краудсорсинг зависят от състава на участниците и текущия набор от модели в системата.[12]

Приложение

Семейството Yi се прилага в широк диапазон от задачи за обработка на естествен език и мултимодален анализ:[3][13]

  • Чат-асистенти и диалогови системи — на базата на чат-вариантите Yi-34B-Chat и Yi-1.5.
  • Генериране и анализ на код — Yi-Coder поддържа 52 езика за програмиране.
  • Анализ на дълги документи — варианти с контекст 200K за юридически, технически и аналитични задачи.
  • Мултимодален анализ — описание на изображения и визуален въпрос-отговор чрез Yi-VL.
  • Корпоративни агенти — RAG-системи, търсене на знания и класификация на данни чрез платформата 01.AI.
  • Локално разгръщане — чрез vLLM, llama.cpp, Hugging Face Transformers; квантизирани версии (AWQ/GPTQ 4/8-bit) са достъпни за разгръщане на потребителски GPU (например RTX 4090 за Yi-34B-4bit).

API-вариантите (Yi-Large, Yi-Lightning) се използват за чат-ботове, многоезични услуги и нискозатратен inference. Стойността на inference на Yi-Lightning възлизаше на 14 цента за милион токена към 2024 година.[8]

Ограничения и открити проблеми

  • Халюцинации. Моделите са подложени на типичните за LLM фактически грешки в генерираните отговори, особено при сложни разсъждения и дълги вериги на извод.[1]
  • Математика и код в ранните версии. Базовите модели Yi-34B показват по-слаби резултати при сложно кодиране и математика в сравнение със специализираните frontier-модели (например MATH Yi-34B в 4-shot — 14,4). Този проблем е частично решен в Yi-1.5 и Yi-Lightning.[1][8]
  • Дълъг контекст. Разширяването до 200K изисква допълнително предобучение и изчислителни ресурси; възможна е незначителна деградация на производителността при кратък контекст.[1]
  • Затворени модели. Yi-Large и Yi-Lightning не предоставят тегла за изтегляне, което ограничава независимата верификация на архитектурата и данните.[8]
  • Разрив между Arena и benchmark-овете. Yi-Lightning демонстрира силни резултати в потребителските оценки (Chatbot Arena), но изостава от някои конкуренти на статичните академични benchmark-ове — отражение на общия проблем за несъответствие на метриките.[8]
  • Възпроизводимост. Не всички детайли на обучението (точен състав на dataset-а, разпределение на домейните, хиперпараметри) са напълно разкрити.[13]
  • Чувствителност към prompt-овете. Както и другите LLM, моделите Yi са чувствителни към формулировката на prompt-а, което влияе върху стабилността на изводите.[1]

Известни сериозни регресии след пусканията не са регистрирани; общността отбелязва стабилността на квантизираните версии.[2]

Етични и регулаторни аспекти

В Yi-Lightning е внедрена рамката за безопасност RAISE, реализираща четиристепенна защита:[8]

  • Филтриране на токсично съдържание, PII и вредоносни материали на етапа на предобучението.
  • Safety fine-tuning с примери за правилна обработка на чувствителни заявки.
  • Входен контрол (класификация на prompt-овете).
  • Изходен контрол (филтриране на отговорите).

Лицензът Apache 2.0 за отворените модели разрешава търговска употреба; отделните хостинги могат да предявяват допълнителни изисквания. Моделите отговарят на китайските регулаторни норми в областта на ИИ (сертификация CAICT за корпоративни решения).[1][3]

Перспективи и направления на изследванията

Серията Yi демонстрира ефективността на подхода, поставящ качеството на данните над обема на параметрите, както и на лекото мащабиране (continual pretraining, depth upscaling, MoE-оптимизации).[1]

След 2025 година акцентът на 01.AI се измести към приложни решения:[4]

  • Многоагентни системи и enterprise-платформа WorldWise LLM Platform 2.5.
  • Интегриране на модели на трети страни (включително DeepSeek) в корпоративни workflow.
  • Оптимизация на inference (квантизация, FP8) за намаляване на разходите за разгръщане.

Отворените модели продължават да се използват от общността за изследвания, fine-tuning и дистилация.[6]

Литература

Връзки

Бележки

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms