Yi (01.AI) (HU)
Yi — nagy nyelvi modellek (Large Language Model, LLM) és vizuális-nyelvi modellek (Vision-Language Model, VLM) családja, amelyet a 01.AI (零一万物) vállalat fejlesztett Kai-Fu Lee irányítása alatt. A modelleket nulláról tanították be egy 3,1 billió tokent tartalmazó, magas minőségű kétnyelvű korpuszon (angol és kínai nyelven), és tartalmazzák a szöveggenerálásra, hosszú kontextus feldolgozására (akár 200 ezer tokenig), multimodális bevitelre (szöveg + képek), kódgenerálásra és Mixture-of-Experts (MoE) architektúrán alapuló hatékony következtetésre szánt változatokat. A nyílt változatok Apache 2.0 licenc alatt kerülnek terjesztésre kereskedelmi felhasználási engedéllyel; a zárt, zászlóshajó modellek (Yi-Large, Yi-Lightning) API-n keresztül érhetők el.[1][2][3]
Történet és fejlődési kronológia
A 01.AI vállalatot 2023 márciusában alapította Kai-Fu Lee, a Microsoft Research Asia és a Google China egykori vezetője, pekingi székhellyel. A vállalat fókusza hatékony LLM-ek fejlesztése, az adatminőségre és az infrastruktúra mérnöki optimalizálására helyezve a hangsúlyt. 2023 novemberére a 01.AI elérte az „egyszarvú" státuszt (egymilliárd dollárt meghaladó értékelt tőke) az Alibaba részvételével lezajlott finanszírozási kör után.[4][5]
Első generáció (2023–2024)
Az első nyílt modellek, a Yi-6B és a Yi-34B, 2023. november 2-án kerültek bemutatásra. Az azt követő hetekben a termékcsalád 200 ezer tokenes kontextusú változatokkal (2023. november 5.), csatvariánsokkal és kvantált modellekkel (2023. november 23.) bővült. 2024 januárjában megjelentek a multimodális Yi-VL-6B és Yi-VL-34B modellek. 2024 márciusában bemutatkozott a Yi-9B modell, amelyet mélységi skálázással (depth upscaling) nyertek a Yi-6B-ből, és megjelent az arXiv:2403.04652 műszaki jelentés.[1][2]
Yi-1.5 és specializált modellek (2024)
2024. május 13-án kiadták a Yi-1.5 sorozatot (6B/9B/34B) — amely további 500 milliárd tokenen végzett folyamatos előtanítás és 3 millió utasítási példán végzett finomhangolás eredménye. 2024 május–júniusában bemutatkozott a zárt, proprietáris Yi-Large modell API-hozzáféréssel, amelyet SOTA-ként pozicionáltak. 2024 szeptemberében megjelent a specializált Yi-Coder sorozat (1,5B/9B) kódgeneráláshoz, 128 ezer tokenes kontextussal és 52 programozási nyelv támogatásával.[1][6][7]
Yi-Lightning (2024)
2024 októberében bemutatkozott a zászlóshajó Yi-Lightning modell, amely Mixture-of-Experts (MoE) architektúrán alapul, és a következtetés sebességére és hatékonyságára van optimalizálva. A Yi-Lightning a 6. helyet szerezte meg az LMSYS Chatbot Arena általános ranglistáján (Elo 1287), a 2. helyet kínai nyelven, és a 3–4. helyet matematikában és kódolásban. A műszaki jelentés 2024 decemberében jelent meg (arXiv:2412.01253).[8]
Stratégiaváltás (2025)
2025 márciusában a 01.AI bejelentette, hogy leállítja az új nagy nyelvi modellek előtanítását, és a vállalati alkalmazásokra, a többügynöki rendszerekre és a harmadik féltől származó modelleken (köztük DeepSeeken) alapuló WorldWise LLM Platform 2.5 platformra összpontosít.[4]
Összefoglaló kronológia
| Dátum | Esemény |
|---|---|
| 2023. november | Yi-6B és Yi-34B kiadása (alap-, chat- és 200K-variánsok) |
| 2024. január | Multimodális Yi-VL-6B és Yi-VL-34B |
| 2024. március | Yi-9B (depth-upscaled); arXiv:2403.04652 műszaki jelentés megjelenése |
| 2024. május | Yi-1.5 (6B/9B/34B); Yi-Large (zárt, API) |
| 2024. szeptember | Yi-Coder-1.5B/9B (kódspecializáció, 128K kontextus) |
| 2024. október | Yi-Lightning (MoE-architektúra, zászlóshajó modell) |
| 2024. december | Yi-Lightning műszaki jelentés megjelenése (arXiv:2412.01253) |
| 2025. március | Új LLM-ek előtanításának leállítása; fókusz vállalati megoldásokra |
Elméleti alapok és architektúra
Alaparchitektúra
A Yi-család összes modellje a decoder-only Transformer architektúrán alapul, amelyet Vaswani és munkatársai írtak le.[9] A modellek nulláról kerültek betanításra, és nem a LLaMA derivátumai, az implementáció hasonlósága ellenére sem.[1]
A többfejű önfigyelem (Multi-Head Self-Attention) alapmechanizmusát a következő képlet írja le:
ahol , , rendre a lekérdezések (queries), kulcsok (keys) és értékek (values) mátrixai, pedig a kulcsok dimenziója.[9]
A Yi legfontosabb architekturális módosításai:[1]
- Grouped-Query Attention (GQA) — a query-fejek csoportokra osztása közös key/value-fejekkel, ami csökkenti a memóriahasználatot a minőség megőrzése mellett.
- SwiGLU-aktiváció — a standard ReLU/GELU helyettesítése; az aktivációk méretét a rejtett réteg (hidden size) méretének 8/3-ára csökkenti.
- Rotary Position Embedding (RoPE) adaptált alapfrekvenciával (adjusted base frequency, ABF), amely architekturális változtatások nélkül teszi lehetővé a kontextus bővítését.
- Szótár (vocabulary): 64 000 token BPE alapon (SentencePiece), a számok számjegyekre bontásával és unicode-byte fallbackkel a ritka karakterekhez.
Alapmodellek konfigurációi
Az arXiv:2403.04652 műszaki jelentésből származó architektúraparaméterek:[1]
| Paraméter | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| Rétegek száma | 32 | 60 |
| Előtanítási szekvenciahossz (Pretrain Seq. Len) | 4096 | 4096 |
| Max. tanulási ráta (Max LR) | 3×10⁻⁴ | 1,5×10⁻⁴ |
Forrás: arXiv:2403.04652, paramétertáblázat.[1]
Yi-Lightning architektúra (MoE)
A Yi-Lightning (2024) továbbfejlesztett Mixture-of-Experts (MoE) architektúrát használ, a következő jellemzőkkel:[8]
- Fine-grained expert segmentation — az FFN-blokkok finomgranulárú szakértőkre osztása a specializáció fokozása érdekében.
- Többszintű terheléselosztás — Switch-Transformer (ST), Expert Parallel (EP) és Partitioned EP (PEP) veszteségek kombinációja a tokenek egyenletes elosztásához a szakértők között.
- Hibrid figyelem — 3 csúszóablakos (sliding window) és 1 teljes figyelmet (full attention) alkalmazó réteg váltakozása, a KV-gyorsítótár rétegek közötti újrafelhasználásával.
- KV-gyorsítótár memóriaigényének csökkentése 82,8%-kal a standard megközelítéshez képest hosszú szekvenciák feldolgozásakor.
- Kontextusablak 64 ezer tokenre bővítve.
A Yi-Lightning szakértőinek pontos száma és a teljes paraméterszám nyilvános forrásokban nem kerül közzétételre.[8]
Multimodális változatok (Yi-VL)
A Yi-VL multimodális modellekben a nyelvi modell a CLIP ViT-H/14 vizuális enkóderhez kapcsolódik MLP-projekción keresztül. A kép a vizuális enkóder által embedding-szekvenciává alakul, amelyet a szöveges tokenekkel együtt táplálnak a nyelvi modellbe. A tanítás három szakaszban zajlik, növekvő felbontással: 224×224 → 448×448 pixel.[1]
Tanítási folyamat és igazítás
Előtanítás (Pre-training)
A Yi-6B és Yi-34B alapmodellek 3,1 billió tokenes kétnyelvű korpuszon kerültek előtanításra. Az adatok kaszkádos szűrési és deduplikációs folyamaton mennek át: heurisztikus szűrők, betanított pontozók (perplexity, minőség, koherencia, biztonság), klaszterezés és MinHash-deduplikáció. Forrásai: Common Crawl, könyvek és tudományos cikkek.[1]
A Yi-1.5 esetében folyamatos előtanítást (continued pre-training) végeztek további 500 milliárd token magas minőségű korpuszon.[7]
Felügyelt finomhangolás (Supervised Fine-Tuning, SFT)
Az első generációs chatváltozatokat egy kis, de gondosan összeállított készleten hangolták finomra — kevesebb mint 10 ezer többfordulatos (multi-turn) példán, amelyek mindegyikét gépi tanulással foglalkozó mérnökök ellenőriztek és szerkesztettek kézzel. A Yi-1.5 esetében az SFT-adatok mennyisége 3 millió példányra nőtt.[1][7]
Igazítás megerősítéses tanulással
A Yi-Lightning esetében többlépéses igazítási folyamatot alkalmaznak: SFT-t követő RLHF/DPO. A szintetikus adatok Monte Carlo Tree Search (MCTS) segítségével generálódnak. A RAISE biztonsági keretrendszer négyszintű védelmet valósít meg: az előtanítási adatok szűrése, safety fine-tuning, a promptok bemeneti ellenőrzése és a válaszok kimeneti ellenőrzése.[8]
Kontextus bővítése
A kontextusablak 200 ezer tokenre való bővítése könnyű folyamatos előtanítással valósul meg 5 milliárd tokenen (könyvek + szintetikus kérdés-válasz párok), RoPE ABF technika alkalmazásával. A finomítás után a Needle-in-a-Haystack feladatban (célfragmentum keresése hosszú szövegben) elért pontosság eléri a 99,8%-ot.[1][2]
Mélységi skálázás (Depth Upscaling)
A Yi-9B a Yi-6B alapmodell 12–28. rétegeinek megkettőzésével, majd 800 milliárd tokenen végzett előtanítással készült. A módszer lehetővé teszi a modell kapacitásának növelését nulláról való tanítás nélkül.[1]
A modellek családjának összetétele
Fő nyelvi modellek
| Modell | Paraméterek | Típus | Kontextus | Kiadás dátuma | Licenc | Megjegyzés |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | 6 mrd / 34 mrd | Base / Chat | 4K (bővítve 32K-ra) | 2023. november | Apache 2.0 | Nulláról tanított alapmodellek |
| Yi-6B-200K / Yi-34B-200K | 6 mrd / 34 mrd | Base | 200K | 2023. november | Apache 2.0 | Folyamatos előtanítás hosszú szekvenciákon |
| Yi-9B | 9 mrd | Base | 4K (bővítve 200K-ra) | 2024. március | Apache 2.0 | Depth-upscale a Yi-6B-ből + 800 mrd token |
| Yi-1.5-6B/9B/34B | 6 / 9 / 34 mrd | Base / Chat | 4K / 16K / 32K | 2024. május | Apache 2.0 | +500 mrd token + 3 millió SFT-példa |
| Yi-Large | ~1 billió (MoE, aktív paraméterek nem nyilvánosan ismert) | LLM | Nem nyilvános | 2024. május | Zárt (API) | SOTA-ként pozicionált |
| Yi-Lightning | MoE (szakértők száma nem nyilvános) | LLM | 64K | 2024. október | API | 6. hely az LMSYS Chatbot Arénán |
Források: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]
Specializált modellek
| Modell | Paraméterek | Modalitások | Kontextus | Kiadás dátuma | Megjegyzés |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | 6 / 34 mrd | Szöveg + képek (448×448) | Az alapmodell standard kontextusa | 2024. január | ViT-enkóder (CLIP ViT-H/14), háromszakaszos tanítás |
| Yi-Coder-1.5B / Yi-Coder-9B | 1,5 / 9 mrd | Szöveg (kód) | 128K | 2024. szeptember | 52 programozási nyelv |
Források: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]
API-azonosítók
Példák a 01.AI platformon és harmadik fél szolgáltatóknál: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]
Kiértékelés és benchmarkok
Alapmodellek eredményei
Adatok az arXiv:2403.04652 műszaki jelentésből (feltételek: 0-shot / 5-shot, a benchmarktól függően):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63,2 | 76,3 | 62,6 | 69,7 | 66,7 | — |
| BBH | 42,8 | 54,3 | 44,1 | — | 53,4 | — |
| C-Eval | 72,0 | 81,4 | — | 50,1 | 72,1 | 70,1 |
| CMMLU | 75,5 | 83,7 | — | 53,3 | 71,0 | 52,5 |
| GSM8K | 32,5 | 67,2 | 42,2 | 56,8 | 61,3 | 57,1 |
| HumanEval | 15,9 | 23,2 | 22,6 | 31,7 | 32,3 | 48,1 |
Forrás: arXiv:2403.04652, eredménytáblázatok.[1]
A Yi-34B a legtöbb benchmarkon felülmúlta a Llama 2-70B-t (kétszer kisebb méret mellett), és a kiadás idején vezető helyen állt a nyílt modellek között a C-Eval és CMMLU benchmarkokon.[1][12]
Yi-Lightning eredményei
Adatok az arXiv:2412.01253 műszaki jelentésből (feltételek: 0-shot, ahol másképp nem jelölt):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50,9 | 49,1 | 45,1 |
| MATH | 76,4 | 82,7 | 67,1 |
| HumanEval | 83,5 | 86,0 | 76,2 |
| WildBench | 65,1 | 59,9 | 49,0 |
| Arena-Hard | 91,8 | 90,5 | 74,0 |
Forrás: arXiv:2412.01253.[8]
Felhasználói rangsorok
A Yi-34B-Chat 2023 decemberében – 2024 januárjában a 2. helyen állt az AlpacaEval ranglistán (94,08%, a GPT-4 Turbo mögött), az LMSYS Chatbot Arénán Elo ~1110-es értékelést ért el. A Yi-34B a kiadás idején vezető helyen állt a nyílt modellek között a Hugging Face Open LLM Leaderboardon és a C-Eval-on.[2][1]
A Yi-Lightning a 6. általános helyet szerezte meg az LMSYS Chatbot Arénán (pontszám: 1287), a 2. helyet kínai nyelven, és a 3–4. helyet a „matematika", „kódolás", „hard prompts" és „multi-turn\" alkategóriákban a jelentés megjelenésekor.[8]
Megjegyzés. A különböző kiadásokból és konfigurációkból származó modellek közvetlen összehasonlítása egységes tesztelési feltételeket igényel (ugyanazok a benchmark-verziók, azonos generálási paraméterek). A közösségi alapú platformokon végzett szubjektív értékelések a résztvevők összetételétől és a rendszerben lévő aktuális modellkészlettől függnek.[12]
Alkalmazások
A Yi-család a természetes nyelvfeldolgozás és a multimodális elemzés feladatainak széles körében alkalmazható:[3][13]
- Csatasszisztensek és párbeszédes rendszerek — a Yi-34B-Chat és Yi-1.5 chatváltozatai alapján.
- Kódgenerálás és -elemzés — a Yi-Coder 52 programozási nyelvet támogat.
- Hosszú dokumentumok elemzése — 200K kontextusú változatok jogi, műszaki és elemzési feladatokhoz.
- Multimodális elemzés — képleírás és vizuális kérdés-válasz a Yi-VL segítségével.
- Vállalati ügynökök — RAG-rendszerek, tudáskeresés és adatosztályozás a 01.AI platformon keresztül.
- Helyi telepítés — vLLM, llama.cpp, Hugging Face Transformers segítségével; kvantált verziók (AWQ/GPTQ 4/8-bit) fogyasztói GPU-kon való telepítésre is elérhetők (pl. RTX 4090 a Yi-34B-4bit esetén).
Az API-változatokat (Yi-Large, Yi-Lightning) chatbotokhoz, többnyelvű szolgáltatásokhoz és alacsony költségű következtetéshez használják. A Yi-Lightning következtetési költsége 2024-ben 14 cent volt milliónként tokenként.[8]
Korlátok és nyitott kérdések
- Hallucinációk. A modellek ki vannak téve az LLM-ekre jellemző ténybeli hibáknak a generált válaszokban, különösen összetett következtetésnél és hosszú következtetési láncoknál.[1]
- Matematika és kód a korai verziókban. A Yi-34B alapmodellek gyengébb eredményeket mutatnak összetett kódolásban és matematikában a specializált frontier-modellekhez képest (pl. MATH Yi-34B 4-shot eredménye: 14,4). Ezt a problémát részben megoldotta a Yi-1.5 és a Yi-Lightning.[1][8]
- Hosszú kontextus. A 200K-ra való bővítés további előtanítást és számítási erőforrásokat igényel; kisebb teljesítményromlás lehetséges rövid kontextus esetén.[1]
- Zárt modellek. A Yi-Large és a Yi-Lightning nem teszi elérhetővé a letölthető súlyokat, ami korlátozza az architektúra és az adatok független ellenőrzését.[8]
- Eltérés az Aréna és a benchmarkok között. A Yi-Lightning erős eredményeket mutat a felhasználói értékeléseken (Chatbot Arena), de egyes versenytársaktól elmarad a statikus akadémiai benchmarkokon — ez a metrikák eltérésének általános problémáját tükrözi.[8]
- Reprodukálhatóság. A tanítás nem minden részlete (a dataset pontos összetétele, a tartományok eloszlása, hiperparaméterek) kerül teljes körűen közzétételre.[13]
- Prompt-érzékenység. Mint más LLM-ek esetében, a Yi modellek is érzékenyek a prompt megfogalmazására, ami hatással van a következtetések stabilitására.[1]
Komoly ismert regressziókat a kiadások után nem rögzítettek; a közösség a kvantált verziók stabilitását emeli ki.[2]
Etikai és szabályozási szempontok
A Yi-Lightningba beépítésre került a RAISE biztonsági keretrendszer, amely négyszintű védelmet valósít meg:[8]
- Mérgező tartalom, PII és káros anyagok szűrése az előtanítás szakaszában.
- Safety fine-tuning érzékeny kérések helyes kezelésének példáival.
- Bemeneti ellenőrzés (promptok osztályozása).
- Kimeneti ellenőrzés (válaszok szűrése).
Az Apache 2.0 licenc a nyílt modellekhez kereskedelmi felhasználást is engedélyez; egyes hosztingszolgáltatók további követelményeket támaszthatnak. A modellek megfelelnek a mesterséges intelligenciára vonatkozó kínai szabályozási normáknak (CAICT-tanúsítás vállalati megoldásokhoz).[1][3]
Kilátások és kutatási irányok
A Yi-sorozat igazolja az adatminőséget a paraméterek mennyisége elé helyező megközelítés hatékonyságát, valamint a könnyű skálázási módszerek (continual pretraining, depth upscaling, MoE-optimalizációk) alkalmazhatóságát.[1]
2025 után a 01.AI fókusza alkalmazott megoldásokra tolódott:[4]
- Többügynöki rendszerek és a WorldWise LLM Platform 2.5 vállalati platform.
- Harmadik féltől származó modellek (köztük DeepSeek) integrálása vállalati munkafolyamatokba.
- Következtetési optimalizálás (kvantálás, FP8) a telepítési költségek csökkentése érdekében.
A nyílt modellek a közösség által kutatásra, fine-tuningra és desztillációra kerülnek felhasználásra.[6]
Irodalom
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
Hivatkozások
- https://github.com/01-ai/Yi — A Yi hivatalos GitHub-tárhelye
- https://github.com/01-ai/Yi-1.5 — Yi-1.5 tárhely
- https://www.01.ai/yi-models — A Yi modelljeinek hivatalos oldala
- https://huggingface.co/01-ai — A 01-ai szervezet a Hugging Face-en
- https://en.wikipedia.org/wiki/01.AI — Wikipedia-cikk a 01.AI vállalatról
Megjegyzések
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms