Yi (01.AI) (PL)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — rodzina dużych modeli językowych (Large Language Model, LLM) i wizualno-językowych modeli (Vision-Language Model, VLM), opracowana przez firmę 01.AI (零一万物) pod kierownictwem Kai-Fu Lee. Modele zostały wytrenowane od podstaw na wysokiej jakości dwujęzycznym korpusie (język angielski i chiński) liczącym 3,1 bln tokenów i obejmują warianty do generowania tekstu, przetwarzania długiego kontekstu (do 200 tys. tokenów), multimodalnego wejścia (tekst + obrazy), generowania kodu oraz wydajnego wnioskowania w oparciu o architekturę Mixture-of-Experts (MoE). Otwarte warianty są dystrybuowane na licencji Apache 2.0 z zezwoleniem na użytek komercyjny; zamknięte flagowe modele (Yi-Large, Yi-Lightning) są dostępne przez API.[1][2][3]

Historia i chronologia rozwoju

Firma 01.AI została założona w marcu 2023 roku przez Kai-Fu Lee, byłego dyrektora Microsoft Research Asia i Google China, z siedzibą w Pekinie. Celem firmy jest tworzenie wydajnych LLM z naciskiem na jakość danych i inżynierską optymalizację infrastruktury. Do listopada 2023 roku 01.AI osiągnęła status „jednorożca" (wycena powyżej 1 mld dolarów) po rundzie finansowania z udziałem Alibaba.[4][5]

Pierwsze pokolenie (2023–2024)

Pierwsze otwarte modele Yi-6B i Yi-34B zostały zaprezentowane 2 listopada 2023 roku. W ciągu kolejnych tygodni linia została uzupełniona wariantami z kontekstem 200 tys. tokenów (5 listopada 2023), wariantami czatowymi i modelami skwantyzowanymi (23 listopada 2023). W styczniu 2024 roku ukazały się multimodalne Yi-VL-6B i Yi-VL-34B. W marcu 2024 roku przedstawiono model Yi-9B, uzyskany metodą głębokiego skalowania (depth upscaling) z Yi-6B, i opublikowano raport techniczny arXiv:2403.04652.[1][2]

Yi-1.5 i modele specjalizowane (2024)

13 maja 2024 roku wydano serię Yi-1.5 (6B/9B/34B) — wynik ciągłego wstępnego trenowania na dodatkowych 500 mld tokenów i dostrajania na 3 mln przykładów instrukcji. W maju–czerwcu 2024 roku zaprezentowano zamknięty, własnościowy model Yi-Large z dostępem przez API, pozycjonowany jako SOTA. We wrześniu 2024 roku ukazała się specjalizowana seria Yi-Coder (1.5B/9B) do generowania kodu z kontekstem 128 tys. tokenów i obsługą 52 języków programowania.[1][6][7]

Yi-Lightning (2024)

W październiku 2024 roku zaprezentowano flagowy model Yi-Lightning oparty na architekturze Mixture-of-Experts (MoE), zoptymalizowany pod kątem szybkości i wydajności wnioskowania. Yi-Lightning zajął 6. miejsce w ogólnym rankingu LMSYS Chatbot Arena (Elo 1287), 2. miejsce w kategorii języka chińskiego oraz 3.–4. miejsce w kategoriach matematyki i programowania. Raport techniczny został opublikowany w grudniu 2024 roku (arXiv:2412.01253).[8]

Zmiana strategii (2025)

W marcu 2025 roku firma 01.AI ogłosiła zaprzestanie wstępnego trenowania nowych dużych modeli językowych i skupiła się na aplikacjach korporacyjnych, systemach wieloagentowych oraz platformie WorldWise LLM Platform 2.5 opartej na modelach zewnętrznych (w tym DeepSeek).[4]

Zbiorcza chronologia

Data Wydarzenie
Listopad 2023 Wydanie Yi-6B i Yi-34B (base, chat, warianty 200K)
Styczeń 2024 Multimodalne Yi-VL-6B i Yi-VL-34B
Marzec 2024 Yi-9B (depth-upscaled); publikacja raportu technicznego arXiv:2403.04652
Maj 2024 Yi-1.5 (6B/9B/34B); Yi-Large (zamknięty, API)
Wrzesień 2024 Yi-Coder-1.5B/9B (specjalizacja w kodzie, kontekst 128K)
Październik 2024 Yi-Lightning (architektura MoE, model flagowy)
Grudzień 2024 Publikacja raportu technicznego Yi-Lightning (arXiv:2412.01253)
Marzec 2025 Zaprzestanie wstępnego trenowania nowych LLM; fokus na rozwiązaniach korporacyjnych

Podstawy teoretyczne i architektura

Architektura bazowa

Wszystkie modele rodziny Yi opierają się na architekturze dekoderowego transformera (decoder-only Transformer) opisanej w pracy Vaswani et al.[9] Modele zostały wytrenowane od podstaw i nie są pochodnymi LLaMA, mimo podobieństwa implementacji.[1]

Podstawowy mechanizm wielogłowej samouwagi (Multi-Head Self-Attention) opisuje wzór:

Attention(Q,K,V)=softmax(QKopdk)V

gdzie Q, K, V — macierze zapytań (queries), kluczy (keys) i wartości (values) odpowiednio, dk — wymiarowość kluczy.[9]

Kluczowe modyfikacje architektoniczne Yi:[1]

  • Grouped-Query Attention (GQA) — podział głów query na grupy ze wspólnymi głowami key/value, co zmniejsza zużycie pamięci przy zachowaniu jakości.
  • Aktywacja SwiGLU — zastąpienie standardowej ReLU/GELU; zmniejsza rozmiar aktywacji do 8/3 wymiaru ukrytej warstwy (hidden size).
  • Rotary Position Embedding (RoPE) z dostosowaną częstotliwością bazową (adjusted base frequency, ABF), zapewniającą rozszerzenie kontekstu bez zmian architektonicznych.
  • Słownik (vocabulary): 64 000 tokenów oparty na BPE (SentencePiece) z podziałem liczb na cyfry i zapasowym mechanizmem unicode-byte dla rzadkich znaków.

Konfiguracje modeli bazowych

Parametry architektury z raportu technicznego arXiv:2403.04652:[1]

Parametr Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
Liczba warstw 32 60
Długość wstępnego trenowania (Pretrain Seq. Len) 4096 4096
Maks. współczynnik uczenia (Max LR) 3×10⁻⁴ 1,5×10⁻⁴

Źródło: arXiv:2403.04652, tabela parametrów.[1]

Architektura Yi-Lightning (MoE)

Yi-Lightning (2024) wykorzystuje ulepszoną architekturę Mixture-of-Experts (MoE) z następującymi cechami:[8]

  • Fine-grained expert segmentation — drobnoziarnisty podział bloków FFN na ekspertów w celu zwiększenia specjalizacji.
  • Wielopoziomowe równoważenie obciążenia — kombinacja strat Switch-Transformer (ST), Expert Parallel (EP) i Partitioned EP (PEP) dla równomiernego rozkładu tokenów między ekspertami.
  • Hybrydowa uwaga — naprzemienne stosowanie 3 warstw z przesuwnym oknem (sliding window) i 1 warstwy z pełną uwagą (full attention), z ponownym wykorzystaniem pamięci podręcznej KV między warstwami.
  • Redukcja pamięci KV cache o 82,8% w porównaniu ze standardowym podejściem przy przetwarzaniu długich sekwencji.
  • Okno kontekstowe rozszerzone do 64 tys. tokenów.

Dokładna liczba ekspertów i całkowita liczba parametrów Yi-Lightning nie została ujawniona w źródłach publicznych.[8]

Warianty multimodalne (Yi-VL)

W multimodalnych modelach Yi-VL model językowy jest połączony z wizualnym enkoderem CLIP ViT-H/14 przez projekcję MLP. Obraz I jest przekształcany przez wizualny enkoder w sekwencję embeddingów {v1,,vK}, które są podawane do modelu językowego razem z tokenami tekstowymi. Trenowanie przebiega w trzech etapach ze zwiększającą się rozdzielczością: 224×224 → 448×448 pikseli.[1]

Pipeline trenowania i wyrównywanie

Wstępne trenowanie (Pre-training)

Modele bazowe Yi-6B i Yi-34B zostały wstępnie wytrenowane na dwujęzycznym korpusie liczącym 3,1 bln tokenów. Dane przechodzą kaskadowy pipeline filtrowania i deduplikacji: filtry heurystyczne, wytrenowane skórery (perplexity, quality, coherence, safety), klastrowanie i deduplikacja MinHash. Źródła — Common Crawl, książki i artykuły naukowe.[1]

Dla Yi-1.5 przeprowadzono ciągłe wstępne trenowanie (continued pre-training) na dodatkowych 500 mld tokenach wysokiej jakości korpusu.[7]

Nadzorowane dostrajanie (Supervised Fine-Tuning, SFT)

Warianty czatowe pierwszego pokolenia zostały dostrojone na małym, lecz starannie dobranym zestawie — mniej niż 10 tys. wieloturowych (multi-turn) przykładów, z których każdy był ręcznie sprawdzony i zredagowany przez inżynierów uczenia maszynowego. Dla Yi-1.5 liczba danych SFT wzrosła do 3 mln przykładów.[1][7]

Wyrównywanie za pomocą uczenia ze wzmocnieniem

Dla Yi-Lightning stosowany jest wieloetapowy proces wyrównywania: SFT, a następnie RLHF/DPO. Dane syntetyczne są generowane z wykorzystaniem Monte Carlo Tree Search (MCTS). Framework bezpieczeństwa RAISE implementuje czteropoliomową ochronę: filtrowanie danych wstępnego trenowania, safety fine-tuning, kontrolę wejściową promptów i kontrolę wyjściową odpowiedzi.[8]

Rozszerzanie kontekstu

Rozszerzenie okna kontekstowego do 200 tys. tokenów zostało zrealizowane przez lekkie ciągłe wstępne trenowanie na 5 mld tokenach (książki + syntetyczne pytania-odpowiedzi) z wykorzystaniem techniki RoPE ABF. Po dostrojeniu dokładność w zadaniu Needle-in-a-Haystack (wyszukiwanie docelowego fragmentu w długim tekście) osiąga 99,8%.[1][2]

Głębokie skalowanie (Depth Upscaling)

Yi-9B został uzyskany przez powielenie warstw 12–28 modelu bazowego Yi-6B z następującym wstępnym trenowaniem na 800 mld tokenach. Metoda ta zapewnia zwiększenie pojemności modelu bez trenowania od podstaw.[1]

Skład rodziny modeli

Główne modele językowe

Model Parametry Typ Kontekst Data wydania Licencja Uwaga
Yi-6B / Yi-34B 6 mld / 34 mld Base / Chat 4K (rozszerz. do 32K) Listopad 2023 Apache 2.0 Modele bazowe trenowane od podstaw
Yi-6B-200K / Yi-34B-200K 6 mld / 34 mld Base 200K Listopad 2023 Apache 2.0 Ciągłe wstępne trenowanie na długich sekwencjach
Yi-9B 9 mld Base 4K (rozszerz. do 200K) Marzec 2024 Apache 2.0 Depth-upscale z Yi-6B + 800 mld tokenów
Yi-1.5-6B/9B/34B 6 / 9 / 34 mld Base / Chat 4K / 16K / 32K Maj 2024 Apache 2.0 +500 mld tokenów + 3 mln przykładów SFT
Yi-Large ~1 bln (MoE, liczba aktywnych nie ujawniona) LLM Nie ujawniony Maj 2024 Zamknięta (API) Pozycjonowany jako SOTA
Yi-Lightning MoE (liczba ekspertów nie ujawniona) LLM 64K Październik 2024 API 6. miejsce LMSYS Chatbot Arena

Źródła: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]

Modele specjalizowane

Model Parametry Modalności Kontekst Data wydania Uwaga
Yi-VL-6B / Yi-VL-34B 6 / 34 mld Tekst + obrazy (448×448) Standardowy modelu bazowego Styczeń 2024 Enkoder ViT (CLIP ViT-H/14), trenowanie trzyetapowe
Yi-Coder-1.5B / Yi-Coder-9B 1,5 / 9 mld Tekst (kod) 128K Wrzesień 2024 52 języki programowania

Źródła: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]

Identyfikatory API

Przykłady na platformie 01.AI i u zewnętrznych dostawców: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]

Ocena i benchmarki

Wyniki modeli bazowych

Dane z raportu technicznego arXiv:2403.04652 (warunki: 0-shot / 5-shot, w zależności od benchmarku):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63,2 76,3 62,6 69,7 66,7
BBH 42,8 54,3 44,1 53,4
C-Eval 72,0 81,4 50,1 72,1 70,1
CMMLU 75,5 83,7 53,3 71,0 52,5
GSM8K 32,5 67,2 42,2 56,8 61,3 57,1
HumanEval 15,9 23,2 22,6 31,7 32,3 48,1

Źródło: arXiv:2403.04652, tabele wyników.[1]

Yi-34B wykazał wyniki przewyższające Llama 2-70B (przy dwukrotnie mniejszym rozmiarze) na większości benchmarków i wiodące wśród otwartych modeli na C-Eval i CMMLU w momencie wydania.[1][12]

Wyniki Yi-Lightning

Dane z raportu technicznego arXiv:2412.01253 (warunki: 0-shot, o ile nie zaznaczono inaczej):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50,9 49,1 45,1
MATH 76,4 82,7 67,1
HumanEval 83,5 86,0 76,2
WildBench 65,1 59,9 49,0
Arena-Hard 91,8 90,5 74,0

Źródło: arXiv:2412.01253.[8]

Rankingi użytkowników

Yi-34B-Chat zajmował 2. miejsce na AlpacaEval (94,08%, po GPT-4 Turbo) w grudniu 2023 – styczniu 2024 roku, z ratingiem Elo ~1110 na LMSYS Chatbot Arena. Yi-34B był liderem wśród otwartych modeli na Hugging Face Open LLM Leaderboard i C-Eval w momencie wydania.[2][1]

Yi-Lightning zajął 6. ogólne miejsce na LMSYS Chatbot Arena (wynik 1287), 2. miejsce w kategorii języka chińskiego oraz 3.–4. miejsca w podkategoriach „matematyka", „programowanie", „hard prompts" i „multi-turn" w momencie publikacji raportu.[8]

Uwaga. Bezpośrednie porównanie modeli z różnych wydań i konfiguracji wymaga jednolitych warunków testowania (te same wersje benchmarków, identyczne parametry generowania). Subiektywne oceny na platformach crowdsourcingowych zależą od składu uczestników i bieżącego zestawu modeli w systemie.[12]

Zastosowania

Rodzina Yi jest stosowana w szerokim zakresie zadań przetwarzania języka naturalnego i analizy multimodalnej:[3][13]

  • Asystenci czatowi i systemy dialogowe — na bazie wariantów czatowych Yi-34B-Chat i Yi-1.5.
  • Generowanie i analiza kodu — Yi-Coder obsługuje 52 języki programowania.
  • Analiza długich dokumentów — warianty z kontekstem 200K do zadań prawniczych, technicznych i analitycznych.
  • Analiza multimodalna — opis obrazów i wizualne pytania-odpowiedzi przez Yi-VL.
  • Agenci korporacyjni — systemy RAG, wyszukiwanie wiedzy i klasyfikacja danych przez platformę 01.AI.
  • Lokalne wdrożenie — przez vLLM, llama.cpp, Hugging Face Transformers; skwantyzowane wersje (AWQ/GPTQ 4/8-bit) dostępne do wdrożenia na konsumenckich GPU (np. RTX 4090 dla Yi-34B-4bit).

Warianty API (Yi-Large, Yi-Lightning) są używane do chatbotów, usług wielojęzycznych i wnioskowania o niskim koszcie. Koszt wnioskowania Yi-Lightning wynosił 14 centów za milion tokenów według stanu na 2024 rok.[8]

Ograniczenia i otwarte problemy

  • Halucynacje. Modele są podatne na typowe dla LLM błędy faktyczne w generowanych odpowiedziach, szczególnie w złożonym rozumowaniu i długich łańcuchach wnioskowania.[1]
  • Matematyka i kod we wczesnych wersjach. Modele bazowe Yi-34B wykazują słabsze wyniki w złożonym programowaniu i matematyce w porównaniu ze specjalizowanymi modelami frontier (np. MATH Yi-34B w 4-shot — 14,4). Problem ten został częściowo rozwiązany w Yi-1.5 i Yi-Lightning.[1][8]
  • Długi kontekst. Rozszerzenie do 200K wymaga dodatkowego wstępnego trenowania i zasobów obliczeniowych; możliwa jest nieznaczna degradacja wydajności przy krótkim kontekście.[1]
  • Zamknięte modele. Yi-Large i Yi-Lightning nie udostępniają wag do pobrania, co ogranicza niezależną weryfikację architektury i danych.[8]
  • Rozbieżność między Arena a benchmarkami. Yi-Lightning wykazuje silne wyniki w ocenach użytkowników (Chatbot Arena), lecz ustępuje niektórym konkurentom na statycznych benchmarkach akademickich — odzwierciedlenie ogólnego problemu niespójności metryk.[8]
  • Odtwarzalność. Nie wszystkie szczegóły trenowania (dokładny skład datasetu, rozkład dziedzin, hiperparametry) zostały w pełni ujawnione.[13]
  • Wrażliwość na prompt. Podobnie jak inne LLM, modele Yi są wrażliwe na sformułowanie promptu, co wpływa na stabilność wyników.[1]

Nie odnotowano żadnych poważnych regresji po wydaniach; społeczność wskazuje na stabilność skwantyzowanych wersji.[2]

Aspekty etyczne i regulacyjne

W Yi-Lightning wdrożono framework bezpieczeństwa RAISE, implementujący czterostopniową ochronę:[8]

  • Filtrowanie toksycznych treści, PII i materiałów szkodliwych na etapie wstępnego trenowania.
  • Safety fine-tuning z przykładami prawidłowej obsługi wrażliwych zapytań.
  • Kontrola wejściowa (klasyfikacja promptów).
  • Kontrola wyjściowa (filtrowanie odpowiedzi).

Licencja Apache 2.0 dla otwartych modeli zezwala na użytek komercyjny; poszczególne platformy hostingowe mogą stawiać dodatkowe wymagania. Modele spełniają chińskie normy regulacyjne w obszarze AI (certyfikacja CAICT dla rozwiązań korporacyjnych).[1][3]

Perspektywy i kierunki badań

Seria Yi demonstruje skuteczność podejścia stawiającego jakość danych ponad liczbę parametrów, a także lekkiego skalowania (continual pretraining, depth upscaling, optymalizacje MoE).[1]

Po 2025 roku akcent 01.AI przesunął się na rozwiązania aplikacyjne:[4]

  • Systemy wieloagentowe i platforma korporacyjna WorldWise LLM Platform 2.5.
  • Integracja zewnętrznych modeli (w tym DeepSeek) w korporacyjne workflow.
  • Optymalizacja wnioskowania (kwantyzacja, FP8) w celu obniżenia kosztów wdrożenia.

Otwarte modele są nadal wykorzystywane przez społeczność do badań, fine-tuningu i destylacji.[6]

Literatura

Odnośniki

Przypisy

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms