Yi (01.AI) (CS)
Yi — rodina velkých jazykových modelů (Large Language Model, LLM) a vizuálně-jazykových modelů (Vision-Language Model, VLM), vyvinutá společností 01.AI (零一万物) pod vedením Kai-Fu Leeho (Kai-Fu Lee). Modely jsou trénovány od základu na vysoce kvalitním dvojjazyčném korpusu (anglický a čínský jazyk) o objemu 3,1 bilionu tokenů a zahrnují varianty pro generování textu, zpracování dlouhého kontextu (až 200 tisíc tokenů), multimodální vstup (text + obrázky), generování kódu a efektivní inference na základě architektury Mixture-of-Experts (MoE). Otevřené varianty jsou šířeny pod licencí Apache 2.0 s povolením komerčního využití; uzavřené vlajkové modely (Yi-Large, Yi-Lightning) jsou dostupné prostřednictvím API.[1][2][3]
Historie a chronologie vývoje
Společnost 01.AI byla založena v březnu 2023 Kai-Fu Leem, bývalým vedoucím Microsoft Research Asia a Google China, se sídlem v Pekingu. Zaměření společnosti — vývoj efektivních LLM s důrazem na kvalitu dat a inženýrskou optimalizaci infrastruktury. Do listopadu 2023 dosáhla 01.AI statusu „jednorožce" (ocenění přes 1 miliardu dolarů) po investičním kole za účasti Alibaba.[4][5]
První generace (2023–2024)
První otevřené modely Yi-6B a Yi-34B byly představeny 2. listopadu 2023. Během následujících týdnů byla řada doplněna o varianty s kontextem 200 tisíc tokenů (5. listopadu 2023), chatovací varianty a kvantované modely (23. listopadu 2023). V lednu 2024 vyšly multimodální Yi-VL-6B a Yi-VL-34B. V březnu 2024 byl představen model Yi-9B, získaný metodou hloubkového škálování (depth upscaling) z Yi-6B, a byl zveřejněn technický report arXiv:2403.04652.[1][2]
Yi-1.5 a specializované modely (2024)
13. května 2024 byla vydána série Yi-1.5 (6B/9B/34B) — výsledek kontinuálního předtrénování na dalších 500 miliardách tokenů a doladění na 3 milionech příkladů instrukcí. V květnu–červnu 2024 byl představen uzavřený proprietární model Yi-Large s API přístupem, prezentovaný jako SOTA. V září 2024 vyšla specializovaná série Yi-Coder (1.5B/9B) pro generování kódu s kontextem 128 tisíc tokenů a podporou 52 programovacích jazyků.[1][6][7]
Yi-Lightning (2024)
V říjnu 2024 byl představen vlajkový model Yi-Lightning na základě architektury Mixture-of-Experts (MoE), optimalizovaný pro rychlost a efektivitu inference. Yi-Lightning obsadil 6. místo v celkovém žebříčku LMSYS Chatbot Arena (Elo 1287), 2. místo v čínštině a 3.–4. místo v matematice a kódování. Technický report byl zveřejněn v prosinci 2024 (arXiv:2412.01253).[8]
Změna strategie (2025)
V březnu 2025 společnost 01.AI oznámila ukončení předtrénování nových velkých jazykových modelů a soustředila se na podnikové aplikace, multiagentní systémy a platformu WorldWise LLM Platform 2.5 postavenou na základě modelů třetích stran (včetně DeepSeek).[4]
Souhrnná chronologie
| Datum | Událost |
|---|---|
| Listopad 2023 | Vydání Yi-6B a Yi-34B (base, chat, varianty 200K) |
| Leden 2024 | Multimodální Yi-VL-6B a Yi-VL-34B |
| Březen 2024 | Yi-9B (depth-upscaled); zveřejnění technického reportu arXiv:2403.04652 |
| Květen 2024 | Yi-1.5 (6B/9B/34B); Yi-Large (uzavřený, API) |
| Září 2024 | Yi-Coder-1.5B/9B (specializace na kód, kontext 128K) |
| Říjen 2024 | Yi-Lightning (architektura MoE, vlajkový model) |
| Prosinec 2024 | Zveřejnění technického reportu Yi-Lightning (arXiv:2412.01253) |
| Březen 2025 | Ukončení předtrénování nových LLM; zaměření na podniková řešení |
Teoretické základy a architektura
Základní architektura
Všechny modely rodiny Yi jsou založeny na architektuře dekodérového transformeru (decoder-only Transformer), popsané v práci Vaswani et al.[9] Modely jsou trénovány od základu a nejsou odvozeny od LLaMA, navzdory podobnosti implementace.[1]
Základní mechanismus vícehlasé vlastní pozornosti (Multi-Head Self-Attention) je popsán vzorcem:
kde , , — matice dotazů (queries), klíčů (keys) a hodnot (values), — dimenze klíčů.[9]
Klíčové architektonické modifikace Yi:[1]
- Grouped-Query Attention (GQA) — rozdělení query-hlav do skupin se sdílenými key/value-hlavami, což snižuje spotřebu paměti při zachování kvality.
- SwiGLU aktivace — náhrada standardní ReLU/GELU; zmenšuje velikost aktivací na 8/3 dimenze skryté vrstvy (hidden size).
- Rotary Position Embedding (RoPE) s upravenou základní frekvencí (adjusted base frequency, ABF), zajišťující rozšíření kontextu bez architektonických změn.
- Slovník (vocabulary): 64 000 tokenů na základě BPE (SentencePiece) s rozdělením čísel na cifry a unicode-byte fallback pro vzácné znaky.
Konfigurace základních modelů
Parametry architektury z technického reportu arXiv:2403.04652:[1]
| Parametr | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| Počet vrstev | 32 | 60 |
| Délka předtrénování (Pretrain Seq. Len) | 4096 | 4096 |
| Max. rychlost učení (Max LR) | 3×10⁻⁴ | 1,5×10⁻⁴ |
Zdroj: arXiv:2403.04652, tabulka parametrů.[1]
Architektura Yi-Lightning (MoE)
Yi-Lightning (2024) využívá vylepšenou architekturu Mixture-of-Experts (MoE) s následujícími vlastnostmi:[8]
- Fine-grained expert segmentation — jemnozrnné rozdělení FFN bloků na experty pro zvýšení specializace.
- Víceúrovňové vyvažování zátěže — kombinace ztrát Switch-Transformer (ST), Expert Parallel (EP) a Partitioned EP (PEP) pro rovnoměrné rozdělení tokenů mezi experty.
- Hybridní pozornost — střídání 3 vrstev s posuvným oknem (sliding window) a 1 vrstvy s úplnou pozorností (full attention), s opakovaným využitím KV-cache mezi vrstvami.
- Snížení paměti KV-cache o 82,8 % oproti standardnímu přístupu při zpracování dlouhých sekvencí.
- Kontextové okno rozšířeno na 64 tisíc tokenů.
Přesný počet expertů a celkový počet parametrů Yi-Lightning není ve veřejných zdrojích zveřejněn.[8]
Multimodální varianty (Yi-VL)
V multimodálních modelech Yi-VL je jazykový model spojen s vizuálním enkodérem CLIP ViT-H/14 prostřednictvím MLP projekce. Obrázek je vizuálním enkodérem převeden na sekvenci embeddingů , které jsou spolu s textovými tokeny předány jazykovému modelu. Trénování probíhá ve třech fázích s rostoucím rozlišením: 224×224 → 448×448 pixelů.[1]
Pipeline trénování a zarovnání
Předtrénování (Pre-training)
Základní modely Yi-6B a Yi-34B jsou předtrénovány na dvojjazyčném korpusu o objemu 3,1 bilionu tokenů. Data procházejí kaskádním pipeline filtrování a deduplikace: heuristické filtry, trénované skórovače (perplexity, quality, coherence, safety), shlukování a MinHash deduplikace. Zdroje — Common Crawl, knihy a vědecké články.[1]
Pro Yi-1.5 bylo provedeno kontinuální předtrénování (continued pre-training) na dalších 500 miliardách tokenů vysoce kvalitního korpusu.[7]
Dohlížené doladění (Supervised Fine-Tuning, SFT)
Chatovací varianty první generace jsou doladěny na malé, ale pečlivě ověřené sadě — méně než 10 tisíc vícekolových (multi-turn) příkladů, z nichž každý byl ručně zkontrolován a upraven inženýry strojového učení. Pro Yi-1.5 byl objem SFT dat zvýšen na 3 miliony příkladů.[1][7]
Zarovnání pomocí zpětnovazebního učení
Pro Yi-Lightning je použit vícefázový proces zarovnání: SFT s následným RLHF/DPO. Syntetická data jsou generována pomocí Monte Carlo Tree Search (MCTS). Framework bezpečnosti RAISE implementuje čtyřúrovňovou ochranu: filtrování dat předtrénování, safety fine-tuning, vstupní kontrolu promptů a výstupní kontrolu odpovědí.[8]
Rozšíření kontextu
Rozšíření kontextového okna na 200 tisíc tokenů je realizováno prostřednictvím lehkého kontinuálního předtrénování na 5 miliardách tokenů (knihy + syntetické otázky a odpovědi) s využitím techniky RoPE ABF. Po doladění dosahuje přesnost v úloze Needle-in-a-Haystack (vyhledání cílového fragmentu v dlouhém textu) 99,8 %.[1][2]
Hloubkové škálování (Depth Upscaling)
Yi-9B byl získán zdvojením vrstev 12–28 základního modelu Yi-6B s následným předtrénováním na 800 miliardách tokenů. Metoda umožňuje zvýšení kapacity modelu bez trénování od základu.[1]
Složení rodiny modelů
Hlavní jazykové modely
| Model | Parametry | Typ | Kontext | Datum vydání | Licence | Poznámka |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | 6 mld / 34 mld | Base / Chat | 4K (rozš. na 32K) | Listopad 2023 | Apache 2.0 | Základní modely trénované od základu |
| Yi-6B-200K / Yi-34B-200K | 6 mld / 34 mld | Base | 200K | Listopad 2023 | Apache 2.0 | Kontinuální předtrénování na dlouhých sekvencích |
| Yi-9B | 9 mld | Base | 4K (rozš. na 200K) | Březen 2024 | Apache 2.0 | Depth-upscale z Yi-6B + 800 mld tokenů |
| Yi-1.5-6B/9B/34B | 6 / 9 / 34 mld | Base / Chat | 4K / 16K / 32K | Květen 2024 | Apache 2.0 | +500 mld tokenů + 3 mil. SFT příkladů |
| Yi-Large | ~1 bil. (MoE, počet aktivních nezveřejněn) | LLM | Nezveřejněn | Květen 2024 | Uzavřená (API) | Prezentován jako SOTA |
| Yi-Lightning | MoE (počet expertů nezveřejněn) | LLM | 64K | Říjen 2024 | API | 6. místo LMSYS Chatbot Arena |
Zdroje: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]
Specializované modely
| Model | Parametry | Modality | Kontext | Datum vydání | Poznámka |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | 6 / 34 mld | Text + obrázky (448×448) | Standardní základního modelu | Leden 2024 | ViT enkodér (CLIP ViT-H/14), třífázové trénování |
| Yi-Coder-1.5B / Yi-Coder-9B | 1,5 / 9 mld | Text (kód) | 128K | Září 2024 | 52 programovacích jazyků |
Zdroje: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]
Identifikátory API
Příklady na platformě 01.AI a u externích poskytovatelů: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]
Hodnocení a benchmarky
Výsledky základních modelů
Data z technického reportu arXiv:2403.04652 (podmínky: 0-shot / 5-shot, podle benchmarku):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63,2 | 76,3 | 62,6 | 69,7 | 66,7 | — |
| BBH | 42,8 | 54,3 | 44,1 | — | 53,4 | — |
| C-Eval | 72,0 | 81,4 | — | 50,1 | 72,1 | 70,1 |
| CMMLU | 75,5 | 83,7 | — | 53,3 | 71,0 | 52,5 |
| GSM8K | 32,5 | 67,2 | 42,2 | 56,8 | 61,3 | 57,1 |
| HumanEval | 15,9 | 23,2 | 22,6 | 31,7 | 32,3 | 48,1 |
Zdroj: arXiv:2403.04652, tabulky výsledků.[1]
Yi-34B dosáhl výsledků překonávajících Llama 2-70B (při dvojnásobně menší velikosti) na většině benchmarků a vedoucích mezi otevřenými modely na C-Eval a CMMLU v době vydání.[1][12]
Výsledky Yi-Lightning
Data z technického reportu arXiv:2412.01253 (podmínky: 0-shot, není-li uvedeno jinak):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50,9 | 49,1 | 45,1 |
| MATH | 76,4 | 82,7 | 67,1 |
| HumanEval | 83,5 | 86,0 | 76,2 |
| WildBench | 65,1 | 59,9 | 49,0 |
| Arena-Hard | 91,8 | 90,5 | 74,0 |
Zdroj: arXiv:2412.01253.[8]
Uživatelské žebříčky
Yi-34B-Chat obsadil 2. místo na AlpacaEval (94,08 %, za GPT-4 Turbo) v prosinci 2023 — lednu 2024, s hodnocením Elo ~1110 na LMSYS Chatbot Arena. Yi-34B vedl mezi otevřenými modely na Hugging Face Open LLM Leaderboard a C-Eval v době vydání.[2][1]
Yi-Lightning obsadil 6. celkové místo na LMSYS Chatbot Arena (skóre 1287), 2. místo v čínštině a 3.–4. místo v podkategoriích „matematika", „kódování", „hard prompts" a „multi-turn" v době zveřejnění reportu.[8]
Poznámka. Přímé srovnání modelů z různých vydání a konfigurací vyžaduje jednotné podmínky testování (stejné verze benchmarků, stejné parametry generování). Subjektivní hodnocení na crowdsourcingových platformách závisí na složení účastníků a aktuální sadě modelů v systému.[12]
Použití
Rodina Yi se uplatňuje v širokém spektru úloh zpracování přirozeného jazyka a multimodální analýzy:[3][13]
- Chatovací asistenti a dialogové systémy — na základě chatovacích variant Yi-34B-Chat a Yi-1.5.
- Generování a analýza kódu — Yi-Coder podporuje 52 programovacích jazyků.
- Analýza dlouhých dokumentů — varianty s kontextem 200K pro právní, technické a analytické úlohy.
- Multimodální analýza — popis obrázků a vizuální otázky a odpovědi prostřednictvím Yi-VL.
- Podnikové agenty — RAG systémy, vyhledávání znalostí a klasifikace dat prostřednictvím platformy 01.AI.
- Lokální nasazení — prostřednictvím vLLM, llama.cpp, Hugging Face Transformers; kvantované verze (AWQ/GPTQ 4/8-bit) jsou dostupné pro nasazení na spotřebitelských GPU (například RTX 4090 pro Yi-34B-4bit).
API varianty (Yi-Large, Yi-Lightning) jsou využívány pro chatboty, vícejazyčné služby a nízkonákladový inference. Náklady na inference Yi-Lightning činily 14 centů za milion tokenů k roku 2024.[8]
Omezení a otevřené problémy
- Halucinace. Modely jsou náchylné k typickým faktickým chybám LLM v generovaných odpovědích, zejména při složitém uvažování a dlouhých řetězcích inference.[1]
- Matematika a kód v raných verzích. Základní modely Yi-34B vykazují slabší výsledky ve složitém kódování a matematice ve srovnání se specializovanými frontier modely (například MATH Yi-34B v 4-shot — 14,4). Tento problém byl částečně vyřešen v Yi-1.5 a Yi-Lightning.[1][8]
- Dlouhý kontext. Rozšíření na 200K vyžaduje dodatečné předtrénování a výpočetní zdroje; možná je mírná degradace výkonu na krátkém kontextu.[1]
- Uzavřené modely. Yi-Large a Yi-Lightning neposkytují váhy ke stažení, což omezuje nezávislou verifikaci architektury a dat.[8]
- Rozdíl mezi Arena a benchmarky. Yi-Lightning vykazuje silné výsledky v uživatelských hodnoceních (Chatbot Arena), ale zaostává za některými konkurenty na statických akademických benchmarcích — odraz obecného problému nekonzistence metrik.[8]
- Reprodukovatelnost. Ne všechny detaily trénování (přesné složení datasetu, rozložení domén, hyperparametry) jsou plně zveřejněny.[13]
- Citlivost na prompt. Stejně jako ostatní LLM jsou modely Yi citlivé na formulaci promptu, což ovlivňuje stabilitu výstupů.[1]
Žádné závažné regrese po vydáních nebyly zaznamenány; komunita zaznamenává stabilitu kvantovaných verzí.[2]
Etické a regulatorní aspekty
V Yi-Lightning je implementován framework bezpečnosti RAISE, zajišťující čtyřúrovňovou ochranu:[8]
- Filtrování toxického obsahu, PII a škodlivých materiálů ve fázi předtrénování.
- Safety fine-tuning s příklady správného zpracování citlivých požadavků.
- Vstupní kontrola (klasifikace promptů).
- Výstupní kontrola (filtrování odpovědí).
Licence Apache 2.0 pro otevřené modely povoluje komerční využití; jednotlivé hostingové služby mohou klást dodatečné požadavky. Modely splňují čínské regulatorní normy v oblasti AI (certifikace CAICT pro podniková řešení).[1][3]
Perspektivy a směry výzkumu
Série Yi demonstruje účinnost přístupu, který klade kvalitu dat nad objem parametrů, a také lehkého škálování (continual pretraining, depth upscaling, MoE optimalizace).[1]
Po roce 2025 se zaměření 01.AI přesunulo na aplikovaná řešení:[4]
- Multiagentní systémy a podniková platforma WorldWise LLM Platform 2.5.
- Integrace modelů třetích stran (včetně DeepSeek) do podnikových workflow.
- Optimalizace inference (kvantování, FP8) pro snížení nákladů na nasazení.
Otevřené modely jsou nadále využívány komunitou pro výzkum, fine-tuning a destilaci.[6]
Literatura
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
Odkazy
- https://github.com/01-ai/Yi — Oficiální GitHub repozitář Yi
- https://github.com/01-ai/Yi-1.5 — Repozitář Yi-1.5
- https://www.01.ai/yi-models — Oficiální stránka modelů Yi
- https://huggingface.co/01-ai — Organizace 01-ai na Hugging Face
- https://en.wikipedia.org/wiki/01.AI — Článek Wikipedia o společnosti 01.AI
Poznámky
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms