Yi (01.AI) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — rodina velkých jazykových modelů (Large Language Model, LLM) a vizuálně-jazykových modelů (Vision-Language Model, VLM), vyvinutá společností 01.AI (零一万物) pod vedením Kai-Fu Leeho (Kai-Fu Lee). Modely jsou trénovány od základu na vysoce kvalitním dvojjazyčném korpusu (anglický a čínský jazyk) o objemu 3,1 bilionu tokenů a zahrnují varianty pro generování textu, zpracování dlouhého kontextu (až 200 tisíc tokenů), multimodální vstup (text + obrázky), generování kódu a efektivní inference na základě architektury Mixture-of-Experts (MoE). Otevřené varianty jsou šířeny pod licencí Apache 2.0 s povolením komerčního využití; uzavřené vlajkové modely (Yi-Large, Yi-Lightning) jsou dostupné prostřednictvím API.[1][2][3]

Historie a chronologie vývoje

Společnost 01.AI byla založena v březnu 2023 Kai-Fu Leem, bývalým vedoucím Microsoft Research Asia a Google China, se sídlem v Pekingu. Zaměření společnosti — vývoj efektivních LLM s důrazem na kvalitu dat a inženýrskou optimalizaci infrastruktury. Do listopadu 2023 dosáhla 01.AI statusu „jednorožce" (ocenění přes 1 miliardu dolarů) po investičním kole za účasti Alibaba.[4][5]

První generace (2023–2024)

První otevřené modely Yi-6B a Yi-34B byly představeny 2. listopadu 2023. Během následujících týdnů byla řada doplněna o varianty s kontextem 200 tisíc tokenů (5. listopadu 2023), chatovací varianty a kvantované modely (23. listopadu 2023). V lednu 2024 vyšly multimodální Yi-VL-6B a Yi-VL-34B. V březnu 2024 byl představen model Yi-9B, získaný metodou hloubkového škálování (depth upscaling) z Yi-6B, a byl zveřejněn technický report arXiv:2403.04652.[1][2]

Yi-1.5 a specializované modely (2024)

13. května 2024 byla vydána série Yi-1.5 (6B/9B/34B) — výsledek kontinuálního předtrénování na dalších 500 miliardách tokenů a doladění na 3 milionech příkladů instrukcí. V květnu–červnu 2024 byl představen uzavřený proprietární model Yi-Large s API přístupem, prezentovaný jako SOTA. V září 2024 vyšla specializovaná série Yi-Coder (1.5B/9B) pro generování kódu s kontextem 128 tisíc tokenů a podporou 52 programovacích jazyků.[1][6][7]

Yi-Lightning (2024)

V říjnu 2024 byl představen vlajkový model Yi-Lightning na základě architektury Mixture-of-Experts (MoE), optimalizovaný pro rychlost a efektivitu inference. Yi-Lightning obsadil 6. místo v celkovém žebříčku LMSYS Chatbot Arena (Elo 1287), 2. místo v čínštině a 3.–4. místo v matematice a kódování. Technický report byl zveřejněn v prosinci 2024 (arXiv:2412.01253).[8]

Změna strategie (2025)

V březnu 2025 společnost 01.AI oznámila ukončení předtrénování nových velkých jazykových modelů a soustředila se na podnikové aplikace, multiagentní systémy a platformu WorldWise LLM Platform 2.5 postavenou na základě modelů třetích stran (včetně DeepSeek).[4]

Souhrnná chronologie

Datum Událost
Listopad 2023 Vydání Yi-6B a Yi-34B (base, chat, varianty 200K)
Leden 2024 Multimodální Yi-VL-6B a Yi-VL-34B
Březen 2024 Yi-9B (depth-upscaled); zveřejnění technického reportu arXiv:2403.04652
Květen 2024 Yi-1.5 (6B/9B/34B); Yi-Large (uzavřený, API)
Září 2024 Yi-Coder-1.5B/9B (specializace na kód, kontext 128K)
Říjen 2024 Yi-Lightning (architektura MoE, vlajkový model)
Prosinec 2024 Zveřejnění technického reportu Yi-Lightning (arXiv:2412.01253)
Březen 2025 Ukončení předtrénování nových LLM; zaměření na podniková řešení

Teoretické základy a architektura

Základní architektura

Všechny modely rodiny Yi jsou založeny na architektuře dekodérového transformeru (decoder-only Transformer), popsané v práci Vaswani et al.[9] Modely jsou trénovány od základu a nejsou odvozeny od LLaMA, navzdory podobnosti implementace.[1]

Základní mechanismus vícehlasé vlastní pozornosti (Multi-Head Self-Attention) je popsán vzorcem:

Attention(Q,K,V)=softmax(QKopdk)V

kde Q, K, V — matice dotazů (queries), klíčů (keys) a hodnot (values), dk — dimenze klíčů.[9]

Klíčové architektonické modifikace Yi:[1]

  • Grouped-Query Attention (GQA) — rozdělení query-hlav do skupin se sdílenými key/value-hlavami, což snižuje spotřebu paměti při zachování kvality.
  • SwiGLU aktivace — náhrada standardní ReLU/GELU; zmenšuje velikost aktivací na 8/3 dimenze skryté vrstvy (hidden size).
  • Rotary Position Embedding (RoPE) s upravenou základní frekvencí (adjusted base frequency, ABF), zajišťující rozšíření kontextu bez architektonických změn.
  • Slovník (vocabulary): 64 000 tokenů na základě BPE (SentencePiece) s rozdělením čísel na cifry a unicode-byte fallback pro vzácné znaky.

Konfigurace základních modelů

Parametry architektury z technického reportu arXiv:2403.04652:[1]

Parametr Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
Počet vrstev 32 60
Délka předtrénování (Pretrain Seq. Len) 4096 4096
Max. rychlost učení (Max LR) 3×10⁻⁴ 1,5×10⁻⁴

Zdroj: arXiv:2403.04652, tabulka parametrů.[1]

Architektura Yi-Lightning (MoE)

Yi-Lightning (2024) využívá vylepšenou architekturu Mixture-of-Experts (MoE) s následujícími vlastnostmi:[8]

  • Fine-grained expert segmentation — jemnozrnné rozdělení FFN bloků na experty pro zvýšení specializace.
  • Víceúrovňové vyvažování zátěže — kombinace ztrát Switch-Transformer (ST), Expert Parallel (EP) a Partitioned EP (PEP) pro rovnoměrné rozdělení tokenů mezi experty.
  • Hybridní pozornost — střídání 3 vrstev s posuvným oknem (sliding window) a 1 vrstvy s úplnou pozorností (full attention), s opakovaným využitím KV-cache mezi vrstvami.
  • Snížení paměti KV-cache o 82,8 % oproti standardnímu přístupu při zpracování dlouhých sekvencí.
  • Kontextové okno rozšířeno na 64 tisíc tokenů.

Přesný počet expertů a celkový počet parametrů Yi-Lightning není ve veřejných zdrojích zveřejněn.[8]

Multimodální varianty (Yi-VL)

V multimodálních modelech Yi-VL je jazykový model spojen s vizuálním enkodérem CLIP ViT-H/14 prostřednictvím MLP projekce. Obrázek I je vizuálním enkodérem převeden na sekvenci embeddingů {v1,,vK}, které jsou spolu s textovými tokeny předány jazykovému modelu. Trénování probíhá ve třech fázích s rostoucím rozlišením: 224×224 → 448×448 pixelů.[1]

Pipeline trénování a zarovnání

Předtrénování (Pre-training)

Základní modely Yi-6B a Yi-34B jsou předtrénovány na dvojjazyčném korpusu o objemu 3,1 bilionu tokenů. Data procházejí kaskádním pipeline filtrování a deduplikace: heuristické filtry, trénované skórovače (perplexity, quality, coherence, safety), shlukování a MinHash deduplikace. Zdroje — Common Crawl, knihy a vědecké články.[1]

Pro Yi-1.5 bylo provedeno kontinuální předtrénování (continued pre-training) na dalších 500 miliardách tokenů vysoce kvalitního korpusu.[7]

Dohlížené doladění (Supervised Fine-Tuning, SFT)

Chatovací varianty první generace jsou doladěny na malé, ale pečlivě ověřené sadě — méně než 10 tisíc vícekolových (multi-turn) příkladů, z nichž každý byl ručně zkontrolován a upraven inženýry strojového učení. Pro Yi-1.5 byl objem SFT dat zvýšen na 3 miliony příkladů.[1][7]

Zarovnání pomocí zpětnovazebního učení

Pro Yi-Lightning je použit vícefázový proces zarovnání: SFT s následným RLHF/DPO. Syntetická data jsou generována pomocí Monte Carlo Tree Search (MCTS). Framework bezpečnosti RAISE implementuje čtyřúrovňovou ochranu: filtrování dat předtrénování, safety fine-tuning, vstupní kontrolu promptů a výstupní kontrolu odpovědí.[8]

Rozšíření kontextu

Rozšíření kontextového okna na 200 tisíc tokenů je realizováno prostřednictvím lehkého kontinuálního předtrénování na 5 miliardách tokenů (knihy + syntetické otázky a odpovědi) s využitím techniky RoPE ABF. Po doladění dosahuje přesnost v úloze Needle-in-a-Haystack (vyhledání cílového fragmentu v dlouhém textu) 99,8 %.[1][2]

Hloubkové škálování (Depth Upscaling)

Yi-9B byl získán zdvojením vrstev 12–28 základního modelu Yi-6B s následným předtrénováním na 800 miliardách tokenů. Metoda umožňuje zvýšení kapacity modelu bez trénování od základu.[1]

Složení rodiny modelů

Hlavní jazykové modely

Model Parametry Typ Kontext Datum vydání Licence Poznámka
Yi-6B / Yi-34B 6 mld / 34 mld Base / Chat 4K (rozš. na 32K) Listopad 2023 Apache 2.0 Základní modely trénované od základu
Yi-6B-200K / Yi-34B-200K 6 mld / 34 mld Base 200K Listopad 2023 Apache 2.0 Kontinuální předtrénování na dlouhých sekvencích
Yi-9B 9 mld Base 4K (rozš. na 200K) Březen 2024 Apache 2.0 Depth-upscale z Yi-6B + 800 mld tokenů
Yi-1.5-6B/9B/34B 6 / 9 / 34 mld Base / Chat 4K / 16K / 32K Květen 2024 Apache 2.0 +500 mld tokenů + 3 mil. SFT příkladů
Yi-Large ~1 bil. (MoE, počet aktivních nezveřejněn) LLM Nezveřejněn Květen 2024 Uzavřená (API) Prezentován jako SOTA
Yi-Lightning MoE (počet expertů nezveřejněn) LLM 64K Říjen 2024 API 6. místo LMSYS Chatbot Arena

Zdroje: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]

Specializované modely

Model Parametry Modality Kontext Datum vydání Poznámka
Yi-VL-6B / Yi-VL-34B 6 / 34 mld Text + obrázky (448×448) Standardní základního modelu Leden 2024 ViT enkodér (CLIP ViT-H/14), třífázové trénování
Yi-Coder-1.5B / Yi-Coder-9B 1,5 / 9 mld Text (kód) 128K Září 2024 52 programovacích jazyků

Zdroje: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]

Identifikátory API

Příklady na platformě 01.AI a u externích poskytovatelů: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]

Hodnocení a benchmarky

Výsledky základních modelů

Data z technického reportu arXiv:2403.04652 (podmínky: 0-shot / 5-shot, podle benchmarku):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63,2 76,3 62,6 69,7 66,7
BBH 42,8 54,3 44,1 53,4
C-Eval 72,0 81,4 50,1 72,1 70,1
CMMLU 75,5 83,7 53,3 71,0 52,5
GSM8K 32,5 67,2 42,2 56,8 61,3 57,1
HumanEval 15,9 23,2 22,6 31,7 32,3 48,1

Zdroj: arXiv:2403.04652, tabulky výsledků.[1]

Yi-34B dosáhl výsledků překonávajících Llama 2-70B (při dvojnásobně menší velikosti) na většině benchmarků a vedoucích mezi otevřenými modely na C-Eval a CMMLU v době vydání.[1][12]

Výsledky Yi-Lightning

Data z technického reportu arXiv:2412.01253 (podmínky: 0-shot, není-li uvedeno jinak):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50,9 49,1 45,1
MATH 76,4 82,7 67,1
HumanEval 83,5 86,0 76,2
WildBench 65,1 59,9 49,0
Arena-Hard 91,8 90,5 74,0

Zdroj: arXiv:2412.01253.[8]

Uživatelské žebříčky

Yi-34B-Chat obsadil 2. místo na AlpacaEval (94,08 %, za GPT-4 Turbo) v prosinci 2023 — lednu 2024, s hodnocením Elo ~1110 na LMSYS Chatbot Arena. Yi-34B vedl mezi otevřenými modely na Hugging Face Open LLM Leaderboard a C-Eval v době vydání.[2][1]

Yi-Lightning obsadil 6. celkové místo na LMSYS Chatbot Arena (skóre 1287), 2. místo v čínštině a 3.–4. místo v podkategoriích „matematika", „kódování", „hard prompts" a „multi-turn" v době zveřejnění reportu.[8]

Poznámka. Přímé srovnání modelů z různých vydání a konfigurací vyžaduje jednotné podmínky testování (stejné verze benchmarků, stejné parametry generování). Subjektivní hodnocení na crowdsourcingových platformách závisí na složení účastníků a aktuální sadě modelů v systému.[12]

Použití

Rodina Yi se uplatňuje v širokém spektru úloh zpracování přirozeného jazyka a multimodální analýzy:[3][13]

  • Chatovací asistenti a dialogové systémy — na základě chatovacích variant Yi-34B-Chat a Yi-1.5.
  • Generování a analýza kódu — Yi-Coder podporuje 52 programovacích jazyků.
  • Analýza dlouhých dokumentů — varianty s kontextem 200K pro právní, technické a analytické úlohy.
  • Multimodální analýza — popis obrázků a vizuální otázky a odpovědi prostřednictvím Yi-VL.
  • Podnikové agenty — RAG systémy, vyhledávání znalostí a klasifikace dat prostřednictvím platformy 01.AI.
  • Lokální nasazení — prostřednictvím vLLM, llama.cpp, Hugging Face Transformers; kvantované verze (AWQ/GPTQ 4/8-bit) jsou dostupné pro nasazení na spotřebitelských GPU (například RTX 4090 pro Yi-34B-4bit).

API varianty (Yi-Large, Yi-Lightning) jsou využívány pro chatboty, vícejazyčné služby a nízkonákladový inference. Náklady na inference Yi-Lightning činily 14 centů za milion tokenů k roku 2024.[8]

Omezení a otevřené problémy

  • Halucinace. Modely jsou náchylné k typickým faktickým chybám LLM v generovaných odpovědích, zejména při složitém uvažování a dlouhých řetězcích inference.[1]
  • Matematika a kód v raných verzích. Základní modely Yi-34B vykazují slabší výsledky ve složitém kódování a matematice ve srovnání se specializovanými frontier modely (například MATH Yi-34B v 4-shot — 14,4). Tento problém byl částečně vyřešen v Yi-1.5 a Yi-Lightning.[1][8]
  • Dlouhý kontext. Rozšíření na 200K vyžaduje dodatečné předtrénování a výpočetní zdroje; možná je mírná degradace výkonu na krátkém kontextu.[1]
  • Uzavřené modely. Yi-Large a Yi-Lightning neposkytují váhy ke stažení, což omezuje nezávislou verifikaci architektury a dat.[8]
  • Rozdíl mezi Arena a benchmarky. Yi-Lightning vykazuje silné výsledky v uživatelských hodnoceních (Chatbot Arena), ale zaostává za některými konkurenty na statických akademických benchmarcích — odraz obecného problému nekonzistence metrik.[8]
  • Reprodukovatelnost. Ne všechny detaily trénování (přesné složení datasetu, rozložení domén, hyperparametry) jsou plně zveřejněny.[13]
  • Citlivost na prompt. Stejně jako ostatní LLM jsou modely Yi citlivé na formulaci promptu, což ovlivňuje stabilitu výstupů.[1]

Žádné závažné regrese po vydáních nebyly zaznamenány; komunita zaznamenává stabilitu kvantovaných verzí.[2]

Etické a regulatorní aspekty

V Yi-Lightning je implementován framework bezpečnosti RAISE, zajišťující čtyřúrovňovou ochranu:[8]

  • Filtrování toxického obsahu, PII a škodlivých materiálů ve fázi předtrénování.
  • Safety fine-tuning s příklady správného zpracování citlivých požadavků.
  • Vstupní kontrola (klasifikace promptů).
  • Výstupní kontrola (filtrování odpovědí).

Licence Apache 2.0 pro otevřené modely povoluje komerční využití; jednotlivé hostingové služby mohou klást dodatečné požadavky. Modely splňují čínské regulatorní normy v oblasti AI (certifikace CAICT pro podniková řešení).[1][3]

Perspektivy a směry výzkumu

Série Yi demonstruje účinnost přístupu, který klade kvalitu dat nad objem parametrů, a také lehkého škálování (continual pretraining, depth upscaling, MoE optimalizace).[1]

Po roce 2025 se zaměření 01.AI přesunulo na aplikovaná řešení:[4]

  • Multiagentní systémy a podniková platforma WorldWise LLM Platform 2.5.
  • Integrace modelů třetích stran (včetně DeepSeek) do podnikových workflow.
  • Optimalizace inference (kvantování, FP8) pro snížení nákladů na nasazení.

Otevřené modely jsou nadále využívány komunitou pro výzkum, fine-tuning a destilaci.[6]

Literatura

Odkazy

Poznámky

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms