Yi (01.AI) (PL)
Yi — rodzina dużych modeli językowych (Large Language Model, LLM) i wizualno-językowych modeli (Vision-Language Model, VLM), opracowana przez firmę 01.AI (零一万物) pod kierownictwem Kai-Fu Lee. Modele zostały wytrenowane od podstaw na wysokiej jakości dwujęzycznym korpusie (język angielski i chiński) liczącym 3,1 bln tokenów i obejmują warianty do generowania tekstu, przetwarzania długiego kontekstu (do 200 tys. tokenów), multimodalnego wejścia (tekst + obrazy), generowania kodu oraz wydajnego wnioskowania w oparciu o architekturę Mixture-of-Experts (MoE). Otwarte warianty są dystrybuowane na licencji Apache 2.0 z zezwoleniem na użytek komercyjny; zamknięte flagowe modele (Yi-Large, Yi-Lightning) są dostępne przez API.[1][2][3]
Historia i chronologia rozwoju
Firma 01.AI została założona w marcu 2023 roku przez Kai-Fu Lee, byłego dyrektora Microsoft Research Asia i Google China, z siedzibą w Pekinie. Celem firmy jest tworzenie wydajnych LLM z naciskiem na jakość danych i inżynierską optymalizację infrastruktury. Do listopada 2023 roku 01.AI osiągnęła status „jednorożca" (wycena powyżej 1 mld dolarów) po rundzie finansowania z udziałem Alibaba.[4][5]
Pierwsze pokolenie (2023–2024)
Pierwsze otwarte modele Yi-6B i Yi-34B zostały zaprezentowane 2 listopada 2023 roku. W ciągu kolejnych tygodni linia została uzupełniona wariantami z kontekstem 200 tys. tokenów (5 listopada 2023), wariantami czatowymi i modelami skwantyzowanymi (23 listopada 2023). W styczniu 2024 roku ukazały się multimodalne Yi-VL-6B i Yi-VL-34B. W marcu 2024 roku przedstawiono model Yi-9B, uzyskany metodą głębokiego skalowania (depth upscaling) z Yi-6B, i opublikowano raport techniczny arXiv:2403.04652.[1][2]
Yi-1.5 i modele specjalizowane (2024)
13 maja 2024 roku wydano serię Yi-1.5 (6B/9B/34B) — wynik ciągłego wstępnego trenowania na dodatkowych 500 mld tokenów i dostrajania na 3 mln przykładów instrukcji. W maju–czerwcu 2024 roku zaprezentowano zamknięty, własnościowy model Yi-Large z dostępem przez API, pozycjonowany jako SOTA. We wrześniu 2024 roku ukazała się specjalizowana seria Yi-Coder (1.5B/9B) do generowania kodu z kontekstem 128 tys. tokenów i obsługą 52 języków programowania.[1][6][7]
Yi-Lightning (2024)
W październiku 2024 roku zaprezentowano flagowy model Yi-Lightning oparty na architekturze Mixture-of-Experts (MoE), zoptymalizowany pod kątem szybkości i wydajności wnioskowania. Yi-Lightning zajął 6. miejsce w ogólnym rankingu LMSYS Chatbot Arena (Elo 1287), 2. miejsce w kategorii języka chińskiego oraz 3.–4. miejsce w kategoriach matematyki i programowania. Raport techniczny został opublikowany w grudniu 2024 roku (arXiv:2412.01253).[8]
Zmiana strategii (2025)
W marcu 2025 roku firma 01.AI ogłosiła zaprzestanie wstępnego trenowania nowych dużych modeli językowych i skupiła się na aplikacjach korporacyjnych, systemach wieloagentowych oraz platformie WorldWise LLM Platform 2.5 opartej na modelach zewnętrznych (w tym DeepSeek).[4]
Zbiorcza chronologia
| Data | Wydarzenie |
|---|---|
| Listopad 2023 | Wydanie Yi-6B i Yi-34B (base, chat, warianty 200K) |
| Styczeń 2024 | Multimodalne Yi-VL-6B i Yi-VL-34B |
| Marzec 2024 | Yi-9B (depth-upscaled); publikacja raportu technicznego arXiv:2403.04652 |
| Maj 2024 | Yi-1.5 (6B/9B/34B); Yi-Large (zamknięty, API) |
| Wrzesień 2024 | Yi-Coder-1.5B/9B (specjalizacja w kodzie, kontekst 128K) |
| Październik 2024 | Yi-Lightning (architektura MoE, model flagowy) |
| Grudzień 2024 | Publikacja raportu technicznego Yi-Lightning (arXiv:2412.01253) |
| Marzec 2025 | Zaprzestanie wstępnego trenowania nowych LLM; fokus na rozwiązaniach korporacyjnych |
Podstawy teoretyczne i architektura
Architektura bazowa
Wszystkie modele rodziny Yi opierają się na architekturze dekoderowego transformera (decoder-only Transformer) opisanej w pracy Vaswani et al.[9] Modele zostały wytrenowane od podstaw i nie są pochodnymi LLaMA, mimo podobieństwa implementacji.[1]
Podstawowy mechanizm wielogłowej samouwagi (Multi-Head Self-Attention) opisuje wzór:
gdzie , , — macierze zapytań (queries), kluczy (keys) i wartości (values) odpowiednio, — wymiarowość kluczy.[9]
Kluczowe modyfikacje architektoniczne Yi:[1]
- Grouped-Query Attention (GQA) — podział głów query na grupy ze wspólnymi głowami key/value, co zmniejsza zużycie pamięci przy zachowaniu jakości.
- Aktywacja SwiGLU — zastąpienie standardowej ReLU/GELU; zmniejsza rozmiar aktywacji do 8/3 wymiaru ukrytej warstwy (hidden size).
- Rotary Position Embedding (RoPE) z dostosowaną częstotliwością bazową (adjusted base frequency, ABF), zapewniającą rozszerzenie kontekstu bez zmian architektonicznych.
- Słownik (vocabulary): 64 000 tokenów oparty na BPE (SentencePiece) z podziałem liczb na cyfry i zapasowym mechanizmem unicode-byte dla rzadkich znaków.
Konfiguracje modeli bazowych
Parametry architektury z raportu technicznego arXiv:2403.04652:[1]
| Parametr | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| Liczba warstw | 32 | 60 |
| Długość wstępnego trenowania (Pretrain Seq. Len) | 4096 | 4096 |
| Maks. współczynnik uczenia (Max LR) | 3×10⁻⁴ | 1,5×10⁻⁴ |
Źródło: arXiv:2403.04652, tabela parametrów.[1]
Architektura Yi-Lightning (MoE)
Yi-Lightning (2024) wykorzystuje ulepszoną architekturę Mixture-of-Experts (MoE) z następującymi cechami:[8]
- Fine-grained expert segmentation — drobnoziarnisty podział bloków FFN na ekspertów w celu zwiększenia specjalizacji.
- Wielopoziomowe równoważenie obciążenia — kombinacja strat Switch-Transformer (ST), Expert Parallel (EP) i Partitioned EP (PEP) dla równomiernego rozkładu tokenów między ekspertami.
- Hybrydowa uwaga — naprzemienne stosowanie 3 warstw z przesuwnym oknem (sliding window) i 1 warstwy z pełną uwagą (full attention), z ponownym wykorzystaniem pamięci podręcznej KV między warstwami.
- Redukcja pamięci KV cache o 82,8% w porównaniu ze standardowym podejściem przy przetwarzaniu długich sekwencji.
- Okno kontekstowe rozszerzone do 64 tys. tokenów.
Dokładna liczba ekspertów i całkowita liczba parametrów Yi-Lightning nie została ujawniona w źródłach publicznych.[8]
Warianty multimodalne (Yi-VL)
W multimodalnych modelach Yi-VL model językowy jest połączony z wizualnym enkoderem CLIP ViT-H/14 przez projekcję MLP. Obraz jest przekształcany przez wizualny enkoder w sekwencję embeddingów , które są podawane do modelu językowego razem z tokenami tekstowymi. Trenowanie przebiega w trzech etapach ze zwiększającą się rozdzielczością: 224×224 → 448×448 pikseli.[1]
Pipeline trenowania i wyrównywanie
Wstępne trenowanie (Pre-training)
Modele bazowe Yi-6B i Yi-34B zostały wstępnie wytrenowane na dwujęzycznym korpusie liczącym 3,1 bln tokenów. Dane przechodzą kaskadowy pipeline filtrowania i deduplikacji: filtry heurystyczne, wytrenowane skórery (perplexity, quality, coherence, safety), klastrowanie i deduplikacja MinHash. Źródła — Common Crawl, książki i artykuły naukowe.[1]
Dla Yi-1.5 przeprowadzono ciągłe wstępne trenowanie (continued pre-training) na dodatkowych 500 mld tokenach wysokiej jakości korpusu.[7]
Nadzorowane dostrajanie (Supervised Fine-Tuning, SFT)
Warianty czatowe pierwszego pokolenia zostały dostrojone na małym, lecz starannie dobranym zestawie — mniej niż 10 tys. wieloturowych (multi-turn) przykładów, z których każdy był ręcznie sprawdzony i zredagowany przez inżynierów uczenia maszynowego. Dla Yi-1.5 liczba danych SFT wzrosła do 3 mln przykładów.[1][7]
Wyrównywanie za pomocą uczenia ze wzmocnieniem
Dla Yi-Lightning stosowany jest wieloetapowy proces wyrównywania: SFT, a następnie RLHF/DPO. Dane syntetyczne są generowane z wykorzystaniem Monte Carlo Tree Search (MCTS). Framework bezpieczeństwa RAISE implementuje czteropoliomową ochronę: filtrowanie danych wstępnego trenowania, safety fine-tuning, kontrolę wejściową promptów i kontrolę wyjściową odpowiedzi.[8]
Rozszerzanie kontekstu
Rozszerzenie okna kontekstowego do 200 tys. tokenów zostało zrealizowane przez lekkie ciągłe wstępne trenowanie na 5 mld tokenach (książki + syntetyczne pytania-odpowiedzi) z wykorzystaniem techniki RoPE ABF. Po dostrojeniu dokładność w zadaniu Needle-in-a-Haystack (wyszukiwanie docelowego fragmentu w długim tekście) osiąga 99,8%.[1][2]
Głębokie skalowanie (Depth Upscaling)
Yi-9B został uzyskany przez powielenie warstw 12–28 modelu bazowego Yi-6B z następującym wstępnym trenowaniem na 800 mld tokenach. Metoda ta zapewnia zwiększenie pojemności modelu bez trenowania od podstaw.[1]
Skład rodziny modeli
Główne modele językowe
| Model | Parametry | Typ | Kontekst | Data wydania | Licencja | Uwaga |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | 6 mld / 34 mld | Base / Chat | 4K (rozszerz. do 32K) | Listopad 2023 | Apache 2.0 | Modele bazowe trenowane od podstaw |
| Yi-6B-200K / Yi-34B-200K | 6 mld / 34 mld | Base | 200K | Listopad 2023 | Apache 2.0 | Ciągłe wstępne trenowanie na długich sekwencjach |
| Yi-9B | 9 mld | Base | 4K (rozszerz. do 200K) | Marzec 2024 | Apache 2.0 | Depth-upscale z Yi-6B + 800 mld tokenów |
| Yi-1.5-6B/9B/34B | 6 / 9 / 34 mld | Base / Chat | 4K / 16K / 32K | Maj 2024 | Apache 2.0 | +500 mld tokenów + 3 mln przykładów SFT |
| Yi-Large | ~1 bln (MoE, liczba aktywnych nie ujawniona) | LLM | Nie ujawniony | Maj 2024 | Zamknięta (API) | Pozycjonowany jako SOTA |
| Yi-Lightning | MoE (liczba ekspertów nie ujawniona) | LLM | 64K | Październik 2024 | API | 6. miejsce LMSYS Chatbot Arena |
Źródła: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]
Modele specjalizowane
| Model | Parametry | Modalności | Kontekst | Data wydania | Uwaga |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | 6 / 34 mld | Tekst + obrazy (448×448) | Standardowy modelu bazowego | Styczeń 2024 | Enkoder ViT (CLIP ViT-H/14), trenowanie trzyetapowe |
| Yi-Coder-1.5B / Yi-Coder-9B | 1,5 / 9 mld | Tekst (kod) | 128K | Wrzesień 2024 | 52 języki programowania |
Źródła: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]
Identyfikatory API
Przykłady na platformie 01.AI i u zewnętrznych dostawców: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]
Ocena i benchmarki
Wyniki modeli bazowych
Dane z raportu technicznego arXiv:2403.04652 (warunki: 0-shot / 5-shot, w zależności od benchmarku):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63,2 | 76,3 | 62,6 | 69,7 | 66,7 | — |
| BBH | 42,8 | 54,3 | 44,1 | — | 53,4 | — |
| C-Eval | 72,0 | 81,4 | — | 50,1 | 72,1 | 70,1 |
| CMMLU | 75,5 | 83,7 | — | 53,3 | 71,0 | 52,5 |
| GSM8K | 32,5 | 67,2 | 42,2 | 56,8 | 61,3 | 57,1 |
| HumanEval | 15,9 | 23,2 | 22,6 | 31,7 | 32,3 | 48,1 |
Źródło: arXiv:2403.04652, tabele wyników.[1]
Yi-34B wykazał wyniki przewyższające Llama 2-70B (przy dwukrotnie mniejszym rozmiarze) na większości benchmarków i wiodące wśród otwartych modeli na C-Eval i CMMLU w momencie wydania.[1][12]
Wyniki Yi-Lightning
Dane z raportu technicznego arXiv:2412.01253 (warunki: 0-shot, o ile nie zaznaczono inaczej):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50,9 | 49,1 | 45,1 |
| MATH | 76,4 | 82,7 | 67,1 |
| HumanEval | 83,5 | 86,0 | 76,2 |
| WildBench | 65,1 | 59,9 | 49,0 |
| Arena-Hard | 91,8 | 90,5 | 74,0 |
Źródło: arXiv:2412.01253.[8]
Rankingi użytkowników
Yi-34B-Chat zajmował 2. miejsce na AlpacaEval (94,08%, po GPT-4 Turbo) w grudniu 2023 – styczniu 2024 roku, z ratingiem Elo ~1110 na LMSYS Chatbot Arena. Yi-34B był liderem wśród otwartych modeli na Hugging Face Open LLM Leaderboard i C-Eval w momencie wydania.[2][1]
Yi-Lightning zajął 6. ogólne miejsce na LMSYS Chatbot Arena (wynik 1287), 2. miejsce w kategorii języka chińskiego oraz 3.–4. miejsca w podkategoriach „matematyka", „programowanie", „hard prompts" i „multi-turn" w momencie publikacji raportu.[8]
Uwaga. Bezpośrednie porównanie modeli z różnych wydań i konfiguracji wymaga jednolitych warunków testowania (te same wersje benchmarków, identyczne parametry generowania). Subiektywne oceny na platformach crowdsourcingowych zależą od składu uczestników i bieżącego zestawu modeli w systemie.[12]
Zastosowania
Rodzina Yi jest stosowana w szerokim zakresie zadań przetwarzania języka naturalnego i analizy multimodalnej:[3][13]
- Asystenci czatowi i systemy dialogowe — na bazie wariantów czatowych Yi-34B-Chat i Yi-1.5.
- Generowanie i analiza kodu — Yi-Coder obsługuje 52 języki programowania.
- Analiza długich dokumentów — warianty z kontekstem 200K do zadań prawniczych, technicznych i analitycznych.
- Analiza multimodalna — opis obrazów i wizualne pytania-odpowiedzi przez Yi-VL.
- Agenci korporacyjni — systemy RAG, wyszukiwanie wiedzy i klasyfikacja danych przez platformę 01.AI.
- Lokalne wdrożenie — przez vLLM, llama.cpp, Hugging Face Transformers; skwantyzowane wersje (AWQ/GPTQ 4/8-bit) dostępne do wdrożenia na konsumenckich GPU (np. RTX 4090 dla Yi-34B-4bit).
Warianty API (Yi-Large, Yi-Lightning) są używane do chatbotów, usług wielojęzycznych i wnioskowania o niskim koszcie. Koszt wnioskowania Yi-Lightning wynosił 14 centów za milion tokenów według stanu na 2024 rok.[8]
Ograniczenia i otwarte problemy
- Halucynacje. Modele są podatne na typowe dla LLM błędy faktyczne w generowanych odpowiedziach, szczególnie w złożonym rozumowaniu i długich łańcuchach wnioskowania.[1]
- Matematyka i kod we wczesnych wersjach. Modele bazowe Yi-34B wykazują słabsze wyniki w złożonym programowaniu i matematyce w porównaniu ze specjalizowanymi modelami frontier (np. MATH Yi-34B w 4-shot — 14,4). Problem ten został częściowo rozwiązany w Yi-1.5 i Yi-Lightning.[1][8]
- Długi kontekst. Rozszerzenie do 200K wymaga dodatkowego wstępnego trenowania i zasobów obliczeniowych; możliwa jest nieznaczna degradacja wydajności przy krótkim kontekście.[1]
- Zamknięte modele. Yi-Large i Yi-Lightning nie udostępniają wag do pobrania, co ogranicza niezależną weryfikację architektury i danych.[8]
- Rozbieżność między Arena a benchmarkami. Yi-Lightning wykazuje silne wyniki w ocenach użytkowników (Chatbot Arena), lecz ustępuje niektórym konkurentom na statycznych benchmarkach akademickich — odzwierciedlenie ogólnego problemu niespójności metryk.[8]
- Odtwarzalność. Nie wszystkie szczegóły trenowania (dokładny skład datasetu, rozkład dziedzin, hiperparametry) zostały w pełni ujawnione.[13]
- Wrażliwość na prompt. Podobnie jak inne LLM, modele Yi są wrażliwe na sformułowanie promptu, co wpływa na stabilność wyników.[1]
Nie odnotowano żadnych poważnych regresji po wydaniach; społeczność wskazuje na stabilność skwantyzowanych wersji.[2]
Aspekty etyczne i regulacyjne
W Yi-Lightning wdrożono framework bezpieczeństwa RAISE, implementujący czterostopniową ochronę:[8]
- Filtrowanie toksycznych treści, PII i materiałów szkodliwych na etapie wstępnego trenowania.
- Safety fine-tuning z przykładami prawidłowej obsługi wrażliwych zapytań.
- Kontrola wejściowa (klasyfikacja promptów).
- Kontrola wyjściowa (filtrowanie odpowiedzi).
Licencja Apache 2.0 dla otwartych modeli zezwala na użytek komercyjny; poszczególne platformy hostingowe mogą stawiać dodatkowe wymagania. Modele spełniają chińskie normy regulacyjne w obszarze AI (certyfikacja CAICT dla rozwiązań korporacyjnych).[1][3]
Perspektywy i kierunki badań
Seria Yi demonstruje skuteczność podejścia stawiającego jakość danych ponad liczbę parametrów, a także lekkiego skalowania (continual pretraining, depth upscaling, optymalizacje MoE).[1]
Po 2025 roku akcent 01.AI przesunął się na rozwiązania aplikacyjne:[4]
- Systemy wieloagentowe i platforma korporacyjna WorldWise LLM Platform 2.5.
- Integracja zewnętrznych modeli (w tym DeepSeek) w korporacyjne workflow.
- Optymalizacja wnioskowania (kwantyzacja, FP8) w celu obniżenia kosztów wdrożenia.
Otwarte modele są nadal wykorzystywane przez społeczność do badań, fine-tuningu i destylacji.[6]
Literatura
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
Odnośniki
- https://github.com/01-ai/Yi — Oficjalne repozytorium GitHub Yi
- https://github.com/01-ai/Yi-1.5 — Repozytorium Yi-1.5
- https://www.01.ai/yi-models — Oficjalna strona modeli Yi
- https://huggingface.co/01-ai — Organizacja 01-ai na Hugging Face
- https://en.wikipedia.org/wiki/01.AI — Artykuł Wikipedia o firmie 01.AI
Przypisy
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms