Yi (01.AI) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — nagy nyelvi modellek (Large Language Model, LLM) és vizuális-nyelvi modellek (Vision-Language Model, VLM) családja, amelyet a 01.AI (零一万物) vállalat fejlesztett Kai-Fu Lee irányítása alatt. A modelleket nulláról tanították be egy 3,1 billió tokent tartalmazó, magas minőségű kétnyelvű korpuszon (angol és kínai nyelven), és tartalmazzák a szöveggenerálásra, hosszú kontextus feldolgozására (akár 200 ezer tokenig), multimodális bevitelre (szöveg + képek), kódgenerálásra és Mixture-of-Experts (MoE) architektúrán alapuló hatékony következtetésre szánt változatokat. A nyílt változatok Apache 2.0 licenc alatt kerülnek terjesztésre kereskedelmi felhasználási engedéllyel; a zárt, zászlóshajó modellek (Yi-Large, Yi-Lightning) API-n keresztül érhetők el.[1][2][3]

Történet és fejlődési kronológia

A 01.AI vállalatot 2023 márciusában alapította Kai-Fu Lee, a Microsoft Research Asia és a Google China egykori vezetője, pekingi székhellyel. A vállalat fókusza hatékony LLM-ek fejlesztése, az adatminőségre és az infrastruktúra mérnöki optimalizálására helyezve a hangsúlyt. 2023 novemberére a 01.AI elérte az „egyszarvú" státuszt (egymilliárd dollárt meghaladó értékelt tőke) az Alibaba részvételével lezajlott finanszírozási kör után.[4][5]

Első generáció (2023–2024)

Az első nyílt modellek, a Yi-6B és a Yi-34B, 2023. november 2-án kerültek bemutatásra. Az azt követő hetekben a termékcsalád 200 ezer tokenes kontextusú változatokkal (2023. november 5.), csatvariánsokkal és kvantált modellekkel (2023. november 23.) bővült. 2024 januárjában megjelentek a multimodális Yi-VL-6B és Yi-VL-34B modellek. 2024 márciusában bemutatkozott a Yi-9B modell, amelyet mélységi skálázással (depth upscaling) nyertek a Yi-6B-ből, és megjelent az arXiv:2403.04652 műszaki jelentés.[1][2]

Yi-1.5 és specializált modellek (2024)

2024. május 13-án kiadták a Yi-1.5 sorozatot (6B/9B/34B) — amely további 500 milliárd tokenen végzett folyamatos előtanítás és 3 millió utasítási példán végzett finomhangolás eredménye. 2024 május–júniusában bemutatkozott a zárt, proprietáris Yi-Large modell API-hozzáféréssel, amelyet SOTA-ként pozicionáltak. 2024 szeptemberében megjelent a specializált Yi-Coder sorozat (1,5B/9B) kódgeneráláshoz, 128 ezer tokenes kontextussal és 52 programozási nyelv támogatásával.[1][6][7]

Yi-Lightning (2024)

2024 októberében bemutatkozott a zászlóshajó Yi-Lightning modell, amely Mixture-of-Experts (MoE) architektúrán alapul, és a következtetés sebességére és hatékonyságára van optimalizálva. A Yi-Lightning a 6. helyet szerezte meg az LMSYS Chatbot Arena általános ranglistáján (Elo 1287), a 2. helyet kínai nyelven, és a 3–4. helyet matematikában és kódolásban. A műszaki jelentés 2024 decemberében jelent meg (arXiv:2412.01253).[8]

Stratégiaváltás (2025)

2025 márciusában a 01.AI bejelentette, hogy leállítja az új nagy nyelvi modellek előtanítását, és a vállalati alkalmazásokra, a többügynöki rendszerekre és a harmadik féltől származó modelleken (köztük DeepSeeken) alapuló WorldWise LLM Platform 2.5 platformra összpontosít.[4]

Összefoglaló kronológia

Dátum Esemény
2023. november Yi-6B és Yi-34B kiadása (alap-, chat- és 200K-variánsok)
2024. január Multimodális Yi-VL-6B és Yi-VL-34B
2024. március Yi-9B (depth-upscaled); arXiv:2403.04652 műszaki jelentés megjelenése
2024. május Yi-1.5 (6B/9B/34B); Yi-Large (zárt, API)
2024. szeptember Yi-Coder-1.5B/9B (kódspecializáció, 128K kontextus)
2024. október Yi-Lightning (MoE-architektúra, zászlóshajó modell)
2024. december Yi-Lightning műszaki jelentés megjelenése (arXiv:2412.01253)
2025. március Új LLM-ek előtanításának leállítása; fókusz vállalati megoldásokra

Elméleti alapok és architektúra

Alaparchitektúra

A Yi-család összes modellje a decoder-only Transformer architektúrán alapul, amelyet Vaswani és munkatársai írtak le.[9] A modellek nulláról kerültek betanításra, és nem a LLaMA derivátumai, az implementáció hasonlósága ellenére sem.[1]

A többfejű önfigyelem (Multi-Head Self-Attention) alapmechanizmusát a következő képlet írja le:

Attention(Q,K,V)=softmax(QKopdk)V

ahol Q, K, V rendre a lekérdezések (queries), kulcsok (keys) és értékek (values) mátrixai, dk pedig a kulcsok dimenziója.[9]

A Yi legfontosabb architekturális módosításai:[1]

  • Grouped-Query Attention (GQA) — a query-fejek csoportokra osztása közös key/value-fejekkel, ami csökkenti a memóriahasználatot a minőség megőrzése mellett.
  • SwiGLU-aktiváció — a standard ReLU/GELU helyettesítése; az aktivációk méretét a rejtett réteg (hidden size) méretének 8/3-ára csökkenti.
  • Rotary Position Embedding (RoPE) adaptált alapfrekvenciával (adjusted base frequency, ABF), amely architekturális változtatások nélkül teszi lehetővé a kontextus bővítését.
  • Szótár (vocabulary): 64 000 token BPE alapon (SentencePiece), a számok számjegyekre bontásával és unicode-byte fallbackkel a ritka karakterekhez.

Alapmodellek konfigurációi

Az arXiv:2403.04652 műszaki jelentésből származó architektúraparaméterek:[1]

Paraméter Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
Rétegek száma 32 60
Előtanítási szekvenciahossz (Pretrain Seq. Len) 4096 4096
Max. tanulási ráta (Max LR) 3×10⁻⁴ 1,5×10⁻⁴

Forrás: arXiv:2403.04652, paramétertáblázat.[1]

Yi-Lightning architektúra (MoE)

A Yi-Lightning (2024) továbbfejlesztett Mixture-of-Experts (MoE) architektúrát használ, a következő jellemzőkkel:[8]

  • Fine-grained expert segmentation — az FFN-blokkok finomgranulárú szakértőkre osztása a specializáció fokozása érdekében.
  • Többszintű terheléselosztás — Switch-Transformer (ST), Expert Parallel (EP) és Partitioned EP (PEP) veszteségek kombinációja a tokenek egyenletes elosztásához a szakértők között.
  • Hibrid figyelem — 3 csúszóablakos (sliding window) és 1 teljes figyelmet (full attention) alkalmazó réteg váltakozása, a KV-gyorsítótár rétegek közötti újrafelhasználásával.
  • KV-gyorsítótár memóriaigényének csökkentése 82,8%-kal a standard megközelítéshez képest hosszú szekvenciák feldolgozásakor.
  • Kontextusablak 64 ezer tokenre bővítve.

A Yi-Lightning szakértőinek pontos száma és a teljes paraméterszám nyilvános forrásokban nem kerül közzétételre.[8]

Multimodális változatok (Yi-VL)

A Yi-VL multimodális modellekben a nyelvi modell a CLIP ViT-H/14 vizuális enkóderhez kapcsolódik MLP-projekción keresztül. A I kép a vizuális enkóder által {v1,,vK} embedding-szekvenciává alakul, amelyet a szöveges tokenekkel együtt táplálnak a nyelvi modellbe. A tanítás három szakaszban zajlik, növekvő felbontással: 224×224 → 448×448 pixel.[1]

Tanítási folyamat és igazítás

Előtanítás (Pre-training)

A Yi-6B és Yi-34B alapmodellek 3,1 billió tokenes kétnyelvű korpuszon kerültek előtanításra. Az adatok kaszkádos szűrési és deduplikációs folyamaton mennek át: heurisztikus szűrők, betanított pontozók (perplexity, minőség, koherencia, biztonság), klaszterezés és MinHash-deduplikáció. Forrásai: Common Crawl, könyvek és tudományos cikkek.[1]

A Yi-1.5 esetében folyamatos előtanítást (continued pre-training) végeztek további 500 milliárd token magas minőségű korpuszon.[7]

Felügyelt finomhangolás (Supervised Fine-Tuning, SFT)

Az első generációs chatváltozatokat egy kis, de gondosan összeállított készleten hangolták finomra — kevesebb mint 10 ezer többfordulatos (multi-turn) példán, amelyek mindegyikét gépi tanulással foglalkozó mérnökök ellenőriztek és szerkesztettek kézzel. A Yi-1.5 esetében az SFT-adatok mennyisége 3 millió példányra nőtt.[1][7]

Igazítás megerősítéses tanulással

A Yi-Lightning esetében többlépéses igazítási folyamatot alkalmaznak: SFT-t követő RLHF/DPO. A szintetikus adatok Monte Carlo Tree Search (MCTS) segítségével generálódnak. A RAISE biztonsági keretrendszer négyszintű védelmet valósít meg: az előtanítási adatok szűrése, safety fine-tuning, a promptok bemeneti ellenőrzése és a válaszok kimeneti ellenőrzése.[8]

Kontextus bővítése

A kontextusablak 200 ezer tokenre való bővítése könnyű folyamatos előtanítással valósul meg 5 milliárd tokenen (könyvek + szintetikus kérdés-válasz párok), RoPE ABF technika alkalmazásával. A finomítás után a Needle-in-a-Haystack feladatban (célfragmentum keresése hosszú szövegben) elért pontosság eléri a 99,8%-ot.[1][2]

Mélységi skálázás (Depth Upscaling)

A Yi-9B a Yi-6B alapmodell 12–28. rétegeinek megkettőzésével, majd 800 milliárd tokenen végzett előtanítással készült. A módszer lehetővé teszi a modell kapacitásának növelését nulláról való tanítás nélkül.[1]

A modellek családjának összetétele

Fő nyelvi modellek

Modell Paraméterek Típus Kontextus Kiadás dátuma Licenc Megjegyzés
Yi-6B / Yi-34B 6 mrd / 34 mrd Base / Chat 4K (bővítve 32K-ra) 2023. november Apache 2.0 Nulláról tanított alapmodellek
Yi-6B-200K / Yi-34B-200K 6 mrd / 34 mrd Base 200K 2023. november Apache 2.0 Folyamatos előtanítás hosszú szekvenciákon
Yi-9B 9 mrd Base 4K (bővítve 200K-ra) 2024. március Apache 2.0 Depth-upscale a Yi-6B-ből + 800 mrd token
Yi-1.5-6B/9B/34B 6 / 9 / 34 mrd Base / Chat 4K / 16K / 32K 2024. május Apache 2.0 +500 mrd token + 3 millió SFT-példa
Yi-Large ~1 billió (MoE, aktív paraméterek nem nyilvánosan ismert) LLM Nem nyilvános 2024. május Zárt (API) SOTA-ként pozicionált
Yi-Lightning MoE (szakértők száma nem nyilvános) LLM 64K 2024. október API 6. hely az LMSYS Chatbot Arénán

Források: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]

Specializált modellek

Modell Paraméterek Modalitások Kontextus Kiadás dátuma Megjegyzés
Yi-VL-6B / Yi-VL-34B 6 / 34 mrd Szöveg + képek (448×448) Az alapmodell standard kontextusa 2024. január ViT-enkóder (CLIP ViT-H/14), háromszakaszos tanítás
Yi-Coder-1.5B / Yi-Coder-9B 1,5 / 9 mrd Szöveg (kód) 128K 2024. szeptember 52 programozási nyelv

Források: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]

API-azonosítók

Példák a 01.AI platformon és harmadik fél szolgáltatóknál: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]

Kiértékelés és benchmarkok

Alapmodellek eredményei

Adatok az arXiv:2403.04652 műszaki jelentésből (feltételek: 0-shot / 5-shot, a benchmarktól függően):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63,2 76,3 62,6 69,7 66,7
BBH 42,8 54,3 44,1 53,4
C-Eval 72,0 81,4 50,1 72,1 70,1
CMMLU 75,5 83,7 53,3 71,0 52,5
GSM8K 32,5 67,2 42,2 56,8 61,3 57,1
HumanEval 15,9 23,2 22,6 31,7 32,3 48,1

Forrás: arXiv:2403.04652, eredménytáblázatok.[1]

A Yi-34B a legtöbb benchmarkon felülmúlta a Llama 2-70B-t (kétszer kisebb méret mellett), és a kiadás idején vezető helyen állt a nyílt modellek között a C-Eval és CMMLU benchmarkokon.[1][12]

Yi-Lightning eredményei

Adatok az arXiv:2412.01253 műszaki jelentésből (feltételek: 0-shot, ahol másképp nem jelölt):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50,9 49,1 45,1
MATH 76,4 82,7 67,1
HumanEval 83,5 86,0 76,2
WildBench 65,1 59,9 49,0
Arena-Hard 91,8 90,5 74,0

Forrás: arXiv:2412.01253.[8]

Felhasználói rangsorok

A Yi-34B-Chat 2023 decemberében – 2024 januárjában a 2. helyen állt az AlpacaEval ranglistán (94,08%, a GPT-4 Turbo mögött), az LMSYS Chatbot Arénán Elo ~1110-es értékelést ért el. A Yi-34B a kiadás idején vezető helyen állt a nyílt modellek között a Hugging Face Open LLM Leaderboardon és a C-Eval-on.[2][1]

A Yi-Lightning a 6. általános helyet szerezte meg az LMSYS Chatbot Arénán (pontszám: 1287), a 2. helyet kínai nyelven, és a 3–4. helyet a „matematika", „kódolás", „hard prompts" és „multi-turn\" alkategóriákban a jelentés megjelenésekor.[8]

Megjegyzés. A különböző kiadásokból és konfigurációkból származó modellek közvetlen összehasonlítása egységes tesztelési feltételeket igényel (ugyanazok a benchmark-verziók, azonos generálási paraméterek). A közösségi alapú platformokon végzett szubjektív értékelések a résztvevők összetételétől és a rendszerben lévő aktuális modellkészlettől függnek.[12]

Alkalmazások

A Yi-család a természetes nyelvfeldolgozás és a multimodális elemzés feladatainak széles körében alkalmazható:[3][13]

  • Csatasszisztensek és párbeszédes rendszerek — a Yi-34B-Chat és Yi-1.5 chatváltozatai alapján.
  • Kódgenerálás és -elemzés — a Yi-Coder 52 programozási nyelvet támogat.
  • Hosszú dokumentumok elemzése — 200K kontextusú változatok jogi, műszaki és elemzési feladatokhoz.
  • Multimodális elemzés — képleírás és vizuális kérdés-válasz a Yi-VL segítségével.
  • Vállalati ügynökök — RAG-rendszerek, tudáskeresés és adatosztályozás a 01.AI platformon keresztül.
  • Helyi telepítés — vLLM, llama.cpp, Hugging Face Transformers segítségével; kvantált verziók (AWQ/GPTQ 4/8-bit) fogyasztói GPU-kon való telepítésre is elérhetők (pl. RTX 4090 a Yi-34B-4bit esetén).

Az API-változatokat (Yi-Large, Yi-Lightning) chatbotokhoz, többnyelvű szolgáltatásokhoz és alacsony költségű következtetéshez használják. A Yi-Lightning következtetési költsége 2024-ben 14 cent volt milliónként tokenként.[8]

Korlátok és nyitott kérdések

  • Hallucinációk. A modellek ki vannak téve az LLM-ekre jellemző ténybeli hibáknak a generált válaszokban, különösen összetett következtetésnél és hosszú következtetési láncoknál.[1]
  • Matematika és kód a korai verziókban. A Yi-34B alapmodellek gyengébb eredményeket mutatnak összetett kódolásban és matematikában a specializált frontier-modellekhez képest (pl. MATH Yi-34B 4-shot eredménye: 14,4). Ezt a problémát részben megoldotta a Yi-1.5 és a Yi-Lightning.[1][8]
  • Hosszú kontextus. A 200K-ra való bővítés további előtanítást és számítási erőforrásokat igényel; kisebb teljesítményromlás lehetséges rövid kontextus esetén.[1]
  • Zárt modellek. A Yi-Large és a Yi-Lightning nem teszi elérhetővé a letölthető súlyokat, ami korlátozza az architektúra és az adatok független ellenőrzését.[8]
  • Eltérés az Aréna és a benchmarkok között. A Yi-Lightning erős eredményeket mutat a felhasználói értékeléseken (Chatbot Arena), de egyes versenytársaktól elmarad a statikus akadémiai benchmarkokon — ez a metrikák eltérésének általános problémáját tükrözi.[8]
  • Reprodukálhatóság. A tanítás nem minden részlete (a dataset pontos összetétele, a tartományok eloszlása, hiperparaméterek) kerül teljes körűen közzétételre.[13]
  • Prompt-érzékenység. Mint más LLM-ek esetében, a Yi modellek is érzékenyek a prompt megfogalmazására, ami hatással van a következtetések stabilitására.[1]

Komoly ismert regressziókat a kiadások után nem rögzítettek; a közösség a kvantált verziók stabilitását emeli ki.[2]

Etikai és szabályozási szempontok

A Yi-Lightningba beépítésre került a RAISE biztonsági keretrendszer, amely négyszintű védelmet valósít meg:[8]

  • Mérgező tartalom, PII és káros anyagok szűrése az előtanítás szakaszában.
  • Safety fine-tuning érzékeny kérések helyes kezelésének példáival.
  • Bemeneti ellenőrzés (promptok osztályozása).
  • Kimeneti ellenőrzés (válaszok szűrése).

Az Apache 2.0 licenc a nyílt modellekhez kereskedelmi felhasználást is engedélyez; egyes hosztingszolgáltatók további követelményeket támaszthatnak. A modellek megfelelnek a mesterséges intelligenciára vonatkozó kínai szabályozási normáknak (CAICT-tanúsítás vállalati megoldásokhoz).[1][3]

Kilátások és kutatási irányok

A Yi-sorozat igazolja az adatminőséget a paraméterek mennyisége elé helyező megközelítés hatékonyságát, valamint a könnyű skálázási módszerek (continual pretraining, depth upscaling, MoE-optimalizációk) alkalmazhatóságát.[1]

2025 után a 01.AI fókusza alkalmazott megoldásokra tolódott:[4]

  • Többügynöki rendszerek és a WorldWise LLM Platform 2.5 vállalati platform.
  • Harmadik féltől származó modellek (köztük DeepSeek) integrálása vállalati munkafolyamatokba.
  • Következtetési optimalizálás (kvantálás, FP8) a telepítési költségek csökkentése érdekében.

A nyílt modellek a közösség által kutatásra, fine-tuningra és desztillációra kerülnek felhasználásra.[6]

Irodalom

Hivatkozások

Megjegyzések

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms