Yi (01.AI) (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — familie de modele lingvistice mari (Large Language Model, LLM) și modele vizual-lingvistice (Vision-Language Model, VLM), dezvoltată de compania 01.AI (零一万物) sub conducerea lui Kai-Fu Lee. Modelele au fost antrenate de la zero pe un corpus bilingv de înaltă calitate (engleză și chineză) cu un volum de 3,1 trilioane de tokeni și includ variante pentru generarea de text, procesarea contextului lung (până la 200 de mii de tokeni), intrare multimodală (text + imagini), generare de cod și inferență eficientă bazată pe arhitectura Mixture-of-Experts (MoE). Variantele deschise sunt distribuite sub licența Apache 2.0, cu permisiunea utilizării comerciale; modelele flagship închise (Yi-Large, Yi-Lightning) sunt disponibile prin API.[1][2][3]

Istoric și cronologia dezvoltării

Compania 01.AI a fost fondată în martie 2023 de Kai-Fu Lee, fost director al Microsoft Research Asia și Google China, cu sediul la Beijing. Focusul companiei îl reprezintă dezvoltarea de LLM eficiente, cu accent pe calitatea datelor și optimizarea ingineriei infrastructurii. Până în noiembrie 2023, 01.AI a atins statutul de „unicorn" (evaluare de peste 1 miliard de dolari) după o rundă de finanțare cu participarea Alibaba.[4][5]

Prima generație (2023–2024)

Primele modele deschise Yi-6B și Yi-34B au fost prezentate pe 2 noiembrie 2023. În săptămânile următoare, linia a fost completată cu variante cu un context de 200 de mii de tokeni (5 noiembrie 2023), variante de chat și modele cuantificate (23 noiembrie 2023). În ianuarie 2024 au apărut modelele multimodale Yi-VL-6B și Yi-VL-34B. În martie 2024 a fost prezentat modelul Yi-9B, obținut prin metoda scalării în adâncime (depth upscaling) din Yi-6B, și a fost publicat raportul tehnic arXiv:2403.04652.[1][2]

Yi-1.5 și modele specializate (2024)

Pe 13 mai 2024 a fost lansată seria Yi-1.5 (6B/9B/34B) — rezultatul pre-antrenării continue pe 500 de miliarde de tokeni suplimentari și al fine-tuning-ului pe 3 milioane de exemple de instrucțiuni. În mai–iunie 2024 a fost prezentat modelul proprietar închis Yi-Large cu acces prin API, poziționat ca SOTA. În septembrie 2024 a apărut seria specializată Yi-Coder (1.5B/9B) pentru generarea de cod, cu un context de 128 de mii de tokeni și suport pentru 52 de limbaje de programare.[1][6][7]

Yi-Lightning (2024)

În octombrie 2024 a fost prezentat modelul flagship Yi-Lightning bazat pe arhitectura Mixture-of-Experts (MoE), optimizat pentru viteză și eficiența inferenței. Yi-Lightning a ocupat locul 6 în clasamentul general LMSYS Chatbot Arena (Elo 1287), locul 2 la limba chineză și locurile 3–4 la matematică și programare. Raportul tehnic a fost publicat în decembrie 2024 (arXiv:2412.01253).[8]

Schimbarea strategiei (2025)

În martie 2025, compania 01.AI a anunțat încetarea pre-antrenării noilor modele lingvistice mari și s-a concentrat pe aplicații enterprise, sisteme multi-agent și platforma WorldWise LLM Platform 2.5 bazată pe modele terțe (inclusiv DeepSeek).[4]

Cronologie rezumativă

Dată Eveniment
Noiembrie 2023 Lansarea Yi-6B și Yi-34B (variante base, chat, 200K)
Ianuarie 2024 Modelele multimodale Yi-VL-6B și Yi-VL-34B
Martie 2024 Yi-9B (depth-upscaled); publicarea raportului tehnic arXiv:2403.04652
Mai 2024 Yi-1.5 (6B/9B/34B); Yi-Large (închis, API)
Septembrie 2024 Yi-Coder-1.5B/9B (specializare pe cod, context 128K)
Octombrie 2024 Yi-Lightning (arhitectură MoE, model flagship)
Decembrie 2024 Publicarea raportului tehnic Yi-Lightning (arXiv:2412.01253)
Martie 2025 Încetarea pre-antrenării noilor LLM; focus pe soluții enterprise

Fundamente teoretice și arhitectură

Arhitectura de bază

Toate modelele din familia Yi sunt bazate pe arhitectura transformerului decodor (decoder-only Transformer), descrisă în lucrarea Vaswani et al.[9] Modelele sunt antrenate de la zero și nu sunt derivate din LLaMA, în ciuda similitudinii implementării.[1]

Mecanismul de bază al atenției multiple cu auto-atenție (Multi-Head Self-Attention) este descris prin formula:

Attention(Q,K,V)=softmax(QKopdk)V

unde Q, K, V sunt matricele de interogări (queries), chei (keys) și valori (values), respectiv, iar dk este dimensiunea cheilor.[9]

Modificări arhitecturale cheie ale Yi:[1]

  • Grouped-Query Attention (GQA) — împărțirea capetelor query în grupuri cu capete key/value comune, ceea ce reduce consumul de memorie păstrând calitatea.
  • Activarea SwiGLU — înlocuirea ReLU/GELU standard; reduce dimensiunea activărilor la 8/3 din dimensiunea stratului ascuns (hidden size).
  • Rotary Position Embedding (RoPE) cu frecvență de bază adaptată (adjusted base frequency, ABF), asigurând extinderea contextului fără modificări arhitecturale.
  • Vocabularul (vocabulary): 64 000 de tokeni bazați pe BPE (SentencePiece) cu separarea numerelor în cifre și unicode-byte fallback pentru caractere rare.

Configurațiile modelelor de bază

Parametrii de arhitectură din raportul tehnic arXiv:2403.04652:[1]

Parametru Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
Număr de straturi 32 60
Lungimea pre-antrenării (Pretrain Seq. Len) 4096 4096
Rata maximă de învățare (Max LR) 3×10⁻⁴ 1,5×10⁻⁴

Sursă: arXiv:2403.04652, tabelul parametrilor.[1]

Arhitectura Yi-Lightning (MoE)

Yi-Lightning (2024) utilizează o arhitectură Mixture-of-Experts (MoE) îmbunătățită cu următoarele caracteristici:[8]

  • Fine-grained expert segmentation — segmentarea granulară a blocurilor FFN în experți pentru creșterea specializării.
  • Echilibrarea multi-nivel a sarcinii — combinarea pierderilor Switch-Transformer (ST), Expert Parallel (EP) și Partitioned EP (PEP) pentru distribuirea uniformă a tokenilor între experți.
  • Atenție hibridă — alternarea a 3 straturi cu fereastră glisantă (sliding window) și 1 strat cu atenție completă (full attention), cu reutilizarea cache-ului KV între straturi.
  • Reducerea memoriei cache KV cu 82,8% față de abordarea standard la procesarea secvențelor lungi.
  • Fereastra de context extinsă la 64 de mii de tokeni.

Numărul exact de experți și numărul total de parametri ai Yi-Lightning nu sunt dezvăluite în sursele publice.[8]

Variante multimodale (Yi-VL)

În modelele multimodale Yi-VL, modelul lingvistic este conectat la un encoder vizual CLIP ViT-H/14 printr-o proiecție MLP. Imaginea I este transformată de encoderul vizual într-o secvență de embedding-uri {v1,,vK}, care sunt furnizate modelului lingvistic împreună cu tokenii de text. Antrenarea se desfășoară în trei etape cu creșterea rezoluției: 224×224 → 448×448 pixeli.[1]

Pipeline-ul de antrenare și alinierea

Pre-antrenarea (Pre-training)

Modelele de bază Yi-6B și Yi-34B au fost pre-antrenate pe un corpus bilingv de 3,1 trilioane de tokeni. Datele trec printr-un pipeline în cascadă de filtrare și deduplicare: filtre euristice, scoreri antrenați (perplexity, quality, coherence, safety), clusterizare și deduplicare MinHash. Sursele includ Common Crawl, cărți și articole științifice.[1]

Pentru Yi-1.5 a fost efectuată o pre-antrenare continuă (continued pre-training) pe 500 de miliarde de tokeni suplimentari de înaltă calitate.[7]

Fine-tuning supervizat (Supervised Fine-Tuning, SFT)

Variantele de chat din prima generație au fost fine-tuned pe un set mic, dar atent verificat — mai puțin de 10 mii de exemple multi-turn, fiecare verificat manual și editat de ingineri de machine learning. Pentru Yi-1.5, volumul datelor SFT a crescut la 3 milioane de exemple.[1][7]

Aliniere prin Reinforcement Learning

Pentru Yi-Lightning se aplică un proces de aliniere în mai multe etape: SFT urmat de RLHF/DPO. Datele sintetice sunt generate folosind Monte Carlo Tree Search (MCTS). Framework-ul de siguranță RAISE implementează o protecție pe patru niveluri: filtrarea datelor de pre-antrenare, safety fine-tuning, controlul intrărilor (prompt-uri) și controlul ieșirilor (răspunsuri).[8]

Extinderea contextului

Extinderea ferestrei de context la 200 de mii de tokeni este realizată printr-o pre-antrenare continuă ușoară pe 5 miliarde de tokeni (cărți + întrebări-răspunsuri sintetice) folosind tehnica RoPE ABF. După ajustare, precizia în sarcina Needle-in-a-Haystack (căutarea unui fragment țintă într-un text lung) atinge 99,8%.[1][2]

Scalarea în adâncime (Depth Upscaling)

Yi-9B a fost obținut prin duplicarea straturilor 12–28 ale modelului de bază Yi-6B, urmată de pre-antrenarea pe 800 de miliarde de tokeni. Metoda permite creșterea capacității modelului fără antrenare de la zero.[1]

Componența familiei de modele

Modele lingvistice principale

Model Parametri Tip Context Data lansării Licență Observație
Yi-6B / Yi-34B 6 mld / 34 mld Base / Chat 4K (ext. la 32K) Noiembrie 2023 Apache 2.0 Modele de bază antrenate de la zero
Yi-6B-200K / Yi-34B-200K 6 mld / 34 mld Base 200K Noiembrie 2023 Apache 2.0 Pre-antrenare continuă pe secvențe lungi
Yi-9B 9 mld Base 4K (ext. la 200K) Martie 2024 Apache 2.0 Depth-upscale din Yi-6B + 800 mld tokeni
Yi-1.5-6B/9B/34B 6 / 9 / 34 mld Base / Chat 4K / 16K / 32K Mai 2024 Apache 2.0 +500 mld tokeni + 3 mln exemple SFT
Yi-Large ~1 tril. (MoE, activi nedivulgați) LLM Nedivulgat Mai 2024 Închisă (API) Poziționat ca SOTA
Yi-Lightning MoE (numărul de experți nedivulgat) LLM 64K Octombrie 2024 API Locul 6 LMSYS Chatbot Arena

Surse: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]

Modele specializate

Model Parametri Modalități Context Data lansării Observație
Yi-VL-6B / Yi-VL-34B 6 / 34 mld Text + imagini (448×448) Standard al modelului de bază Ianuarie 2024 Encoder ViT (CLIP ViT-H/14), antrenare în trei etape
Yi-Coder-1.5B / Yi-Coder-9B 1,5 / 9 mld Text (cod) 128K Septembrie 2024 52 de limbaje de programare

Surse: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]

Identificatori API

Exemple pe platforma 01.AI și la furnizori terți: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]

Evaluare și benchmark-uri

Rezultatele modelelor de bază

Date din raportul tehnic arXiv:2403.04652 (condiții: 0-shot / 5-shot, în funcție de benchmark):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63,2 76,3 62,6 69,7 66,7
BBH 42,8 54,3 44,1 53,4
C-Eval 72,0 81,4 50,1 72,1 70,1
CMMLU 75,5 83,7 53,3 71,0 52,5
GSM8K 32,5 67,2 42,2 56,8 61,3 57,1
HumanEval 15,9 23,2 22,6 31,7 32,3 48,1

Sursă: arXiv:2403.04652, tabele cu rezultate.[1]

Yi-34B a demonstrat rezultate superioare față de Llama 2-70B (la o dimensiune de două ori mai mică) pe majoritatea benchmark-urilor și a condus printre modelele deschise la C-Eval și CMMLU la momentul lansării.[1][12]

Rezultatele Yi-Lightning

Date din raportul tehnic arXiv:2412.01253 (condiții: 0-shot, acolo unde nu se specifică altfel):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50,9 49,1 45,1
MATH 76,4 82,7 67,1
HumanEval 83,5 86,0 76,2
WildBench 65,1 59,9 49,0
Arena-Hard 91,8 90,5 74,0

Sursă: arXiv:2412.01253.[8]

Clasamente bazate pe preferințele utilizatorilor

Yi-34B-Chat a ocupat locul 2 pe AlpacaEval (94,08%, după GPT-4 Turbo) în decembrie 2023 — ianuarie 2024, cu un scor Elo de ~1110 pe LMSYS Chatbot Arena. Yi-34B a condus printre modelele deschise pe Hugging Face Open LLM Leaderboard și C-Eval la momentul lansării.[2][1]

Yi-Lightning a ocupat locul 6 în clasamentul general al LMSYS Chatbot Arena (scor 1287), locul 2 la limba chineză și locurile 3–4 în subcategoriile „matematică", „programare", „hard prompts" și „multi-turn" la momentul publicării raportului.[8]

Notă. Compararea directă a modelelor din lansări și configurații diferite necesită condiții de testare uniforme (aceleași versiuni de benchmark-uri, aceiași parametri de generare). Evaluările subiective pe platformele de tip crowdsourcing depind de componența participanților și de setul curent de modele din sistem.[12]

Aplicații

Familia Yi este utilizată într-o gamă largă de sarcini de procesare a limbajului natural și analiză multimodală:[3][13]

  • Asistenți de chat și sisteme de dialog — pe baza variantelor de chat Yi-34B-Chat și Yi-1.5.
  • Generarea și analiza codului — Yi-Coder suportă 52 de limbaje de programare.
  • Analiza documentelor lungi — variante cu context de 200K pentru sarcini juridice, tehnice și analitice.
  • Analiza multimodală — descrierea imaginilor și răspuns vizual la întrebări prin Yi-VL.
  • Agenți enterprise — sisteme RAG, căutare cunoștințe și clasificarea datelor prin platforma 01.AI.
  • Implementare locală — prin vLLM, llama.cpp, Hugging Face Transformers; versiunile cuantificate (AWQ/GPTQ 4/8-bit) sunt disponibile pentru implementare pe GPU-uri de consum (de exemplu, RTX 4090 pentru Yi-34B-4bit).

Variantele API (Yi-Large, Yi-Lightning) sunt utilizate pentru chatbot-uri, servicii multilingve și inferență la cost redus. Costul inferenței Yi-Lightning era de 14 cenți per milion de tokeni în 2024.[8]

Limitări și probleme deschise

  • Halucinații. Modelele sunt susceptibile la erorile factuale tipice LLM în răspunsurile generate, în special în raționamentele complexe și în lanțurile lungi de inferențe.[1]
  • Matematică și cod în versiunile timpurii. Modelele de bază Yi-34B obțin rezultate mai slabe la programare complexă și matematică față de modelele frontier specializate (de exemplu, MATH Yi-34B în 4-shot — 14,4). Această problemă a fost parțial rezolvată în Yi-1.5 și Yi-Lightning.[1][8]
  • Context lung. Extinderea la 200K necesită pre-antrenare suplimentară și resurse de calcul; este posibilă o ușoară degradare a performanței pe context scurt.[1]
  • Modele închise. Yi-Large și Yi-Lightning nu oferă greutăți pentru descărcare, ceea ce limitează verificarea independentă a arhitecturii și datelor.[8]
  • Decalajul dintre Arena și benchmark-uri. Yi-Lightning demonstrează rezultate puternice în evaluările utilizatorilor (Chatbot Arena), dar rămâne în urmă față de unii concurenți la benchmark-urile academice statice — o reflectare a problemei generale de neconcordanță a metricilor.[8]
  • Reproductibilitate. Nu toate detaliile de antrenare (compoziția exactă a dataset-ului, distribuția domeniilor, hiperparametrii) sunt pe deplin divulgate.[13]
  • Sensibilitate la prompt-uri. Ca și alte LLM, modelele Yi sunt sensibile la formularea prompt-ului, ceea ce afectează stabilitatea rezultatelor.[1]

Nu au fost înregistrate regresii grave cunoscute după lansări; comunitatea remarcă stabilitatea versiunilor cuantificate.[2]

Aspecte etice și de reglementare

În Yi-Lightning a fost implementat framework-ul de siguranță RAISE, care realizează o protecție pe patru niveluri:[8]

  • Filtrarea conținutului toxic, a informațiilor de identificare personală (PII) și a materialelor dăunătoare în etapa de pre-antrenare.
  • Safety fine-tuning cu exemple de gestionare corectă a solicitărilor sensibile.
  • Controlul intrărilor (clasificarea prompt-urilor).
  • Controlul ieșirilor (filtrarea răspunsurilor).

Licența Apache 2.0 pentru modelele deschise permite utilizarea comercială; platformele individuale de hosting pot impune cerințe suplimentare. Modelele sunt conforme cu normele de reglementare chineze în domeniul IA (certificare CAICT pentru soluții enterprise).[1][3]

Perspective și direcții de cercetare

Seria Yi demonstrează eficiența abordării care pune calitatea datelor mai presus de volumul parametrilor, precum și a scalării ușoare (continual pretraining, depth upscaling, optimizări MoE).[1]

După 2025, accentul 01.AI s-a deplasat spre soluții aplicative:[4]

  • Sisteme multi-agent și platforma enterprise WorldWise LLM Platform 2.5.
  • Integrarea modelelor terțe (inclusiv DeepSeek) în fluxurile de lucru enterprise.
  • Optimizarea inferenței (cuantificare, FP8) pentru reducerea costurilor de implementare.

Modelele deschise continuă să fie utilizate de comunitate pentru cercetare, fine-tuning și distilare.[6]

Bibliografie

Referințe

Note

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms