Yi (01.AI) (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — en familj av stora språkmodeller (Large Language Model, LLM) och visuellt-språkliga modeller (Vision-Language Model, VLM), utvecklade av företaget 01.AI (零一万物) under ledning av Kai-Fu Lee. Modellerna är tränade från grunden på ett högkvalitativt tvåspråkigt korpus (engelska och kinesiska) med en volym av 3,1 biljoner token och inkluderar varianter för textgenerering, hantering av lång kontext (upp till 200 000 token), multimodal inmatning (text + bilder), kodgenerering samt effektiv inferens baserad på arkitekturen Mixture-of-Experts (MoE). Öppna varianter distribueras under licensen Apache 2.0 med tillstånd för kommersiellt bruk; slutna flaggskeppsmodeller (Yi-Large, Yi-Lightning) är tillgängliga via API.[1][2][3]

Historia och utvecklingstidslinje

Företaget 01.AI grundades i mars 2023 av Kai-Fu Lee, tidigare chef för Microsoft Research Asia och Google China, med huvudkontor i Peking. Företagets fokus ligger på att utveckla effektiva LLM med tonvikt på datakvalitet och teknisk optimering av infrastrukturen. I november 2023 uppnådde 01.AI status som "enhörning" (värdering över 1 miljard dollar) efter en finansieringsrunda med deltagande av Alibaba.[4][5]

Första generationen (2023–2024)

De första öppna modellerna Yi-6B och Yi-34B presenterades den 2 november 2023. Under de följande veckorna utökades serien med varianter med 200 000 tokens kontext (5 november 2023), chattvarianter och kvantiserade modeller (23 november 2023). I januari 2024 lanserades de multimodala Yi-VL-6B och Yi-VL-34B. I mars 2024 presenterades modellen Yi-9B, framtagen genom djupskalning (depth upscaling) från Yi-6B, och en teknisk rapport publicerades: arXiv:2403.04652.[1][2]

Yi-1.5 och specialiserade modeller (2024)

Den 13 maj 2024 släpptes serien Yi-1.5 (6B/9B/34B) — resultatet av kontinuerlig förträning på ytterligare 500 miljarder token och fine-tuning på 3 miljoner instruktionsexempel. I maj–juni 2024 presenterades den slutna proprietära modellen Yi-Large med API-åtkomst, positionerad som SOTA. I september 2024 lanserades den specialiserade serien Yi-Coder (1,5B/9B) för kodgenerering med en kontext på 128 000 token och stöd för 52 programmeringsspråk.[1][6][7]

Yi-Lightning (2024)

I oktober 2024 presenterades flaggskeppsmodellen Yi-Lightning baserad på arkitekturen Mixture-of-Experts (MoE), optimerad för hastighet och inferenseffektivitet. Yi-Lightning intog 6:e plats i den övergripande rankningen på LMSYS Chatbot Arena (Elo 1287), 2:a plats för kinesiska och 3–4:e plats för matematik och kodning. Den tekniska rapporten publicerades i december 2024 (arXiv:2412.01253).[8]

Strategiändring (2025)

I mars 2025 meddelade företaget 01.AI att man avbryter förträningen av nya stora språkmodeller och fokuserar på företagsapplikationer, multiagentsystem och plattformen WorldWise LLM Platform 2.5 baserad på tredjepartsmodeller (inklusive DeepSeek).[4]

Sammanfattande tidslinje

Datum Händelse
November 2023 Lansering av Yi-6B och Yi-34B (base, chat, 200K-varianter)
Januari 2024 Multimodala Yi-VL-6B och Yi-VL-34B
Mars 2024 Yi-9B (depth-upscaled); publicering av teknisk rapport arXiv:2403.04652
Maj 2024 Yi-1.5 (6B/9B/34B); Yi-Large (sluten, API)
September 2024 Yi-Coder-1.5B/9B (specialisering på kod, kontext 128K)
Oktober 2024 Yi-Lightning (MoE-arkitektur, flaggskeppsmodell)
December 2024 Publicering av teknisk rapport Yi-Lightning (arXiv:2412.01253)
Mars 2025 Avbrytande av förträning av nya LLM; fokus på företagslösningar

Teoretiska grunder och arkitektur

Grundläggande arkitektur

Alla modeller i Yi-familjen baseras på arkitekturen decoder-only Transformer, beskriven i arbetet av Vaswani et al.[9] Modellerna är tränade från grunden och är inte derivat av LLaMA, trots likheter i implementering.[1]

Grundmekanismen för Multi-Head Self-Attention beskrivs av formeln:

Attention(Q,K,V)=softmax(QKdk)V

där Q, K, V — matriserna för frågor (queries), nycklar (keys) och värden (values) respektive, dk — nyckelns dimensionalitet.[9]

Viktigaste arkitekturmodifieringarna i Yi:[1]

  • Grouped-Query Attention (GQA) — uppdelning av query-huvuden i grupper med gemensamma key/value-huvuden, vilket minskar minnesförbrukningen utan att förlora kvalitet.
  • SwiGLU-aktivering — ersättning av standard ReLU/GELU; minskar aktiveringarnas storlek till 8/3 av det dolda lagrets dimensionalitet (hidden size).
  • Rotary Position Embedding (RoPE) med anpassad grundfrekvens (adjusted base frequency, ABF), som möjliggör kontextutvidgning utan arkitekturförändringar.
  • Vokabulär (vocabulary): 64 000 token baserade på BPE (SentencePiece) med uppdelning av tal i siffror och unicode-byte fallback för sällsynta tecken.

Konfigurationer för grundmodeller

Arkitekturparametrar från den tekniska rapporten arXiv:2403.04652:[1]

Parameter Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
Antal lager 32 60
Förträningslängd (Pretrain Seq. Len) 4096 4096
Max inlärningshastighet (Max LR) 3×10⁻⁴ 1,5×10⁻⁴

Källa: arXiv:2403.04652, parametertabell.[1]

Arkitektur för Yi-Lightning (MoE)

Yi-Lightning (2024) använder en förbättrad Mixture-of-Experts (MoE)-arkitektur med följande egenskaper:[8]

  • Fine-grained expert segmentation — finkornad uppdelning av FFN-block i experter för ökad specialisering.
  • Flernivåbalansering av belastning — kombination av Switch-Transformer (ST), Expert Parallel (EP) och Partitioned EP (PEP) losses för jämn fördelning av token mellan experter.
  • Hybrid attention — växling mellan 3 lager med skjutfönster (sliding window) och 1 lager med fullständig uppmärksamhet (full attention), med återanvändning av KV-cache mellan lager.
  • Minskning av KV-cache-minne med 82,8 % jämfört med standardmetoden vid bearbetning av långa sekvenser.
  • Kontextfönster utökat till 64 000 token.

Exakt antal experter och det totala antalet parametrar i Yi-Lightning har inte avslöjats i offentliga källor.[8]

Multimodala varianter (Yi-VL)

I de multimodala modellerna Yi-VL kopplas språkmodellen till den visuella encodern CLIP ViT-H/14 via en MLP-projektion. Bilden I omvandlas av den visuella encodern till en sekvens av embeddings {v1,,vK}, som matas in i språkmodellen tillsammans med texttoken. Träningen sker i tre steg med ökande upplösning: 224×224 → 448×448 pixlar.[1]

Träningspipeline och anpassning

Förträning (Pre-training)

Grundmodellerna Yi-6B och Yi-34B är förtränade på ett tvåspråkigt korpus med 3,1 biljoner token. Data genomgår en kaskadpipeline för filtrering och deduplicering: heuristiska filter, tränade skoreringsfunktioner (perplexity, quality, coherence, safety), klustring och MinHash-deduplicering. Källor inkluderar Common Crawl, böcker och vetenskapliga artiklar.[1]

För Yi-1.5 genomfördes kontinuerlig förträning (continued pre-training) på ytterligare 500 miljarder token av högkvalitativt korpus.[7]

Övervakat fine-tuning (Supervised Fine-Tuning, SFT)

Chattvarianter av första generationen är fine-tunade på en liten men noggrant verifierad uppsättning — färre än 10 000 flerturs- (multi-turn) exempel, var och en manuellt kontrollerad och redigerad av maskininlärningsingenjörer. För Yi-1.5 ökades volymen SFT-data till 3 miljoner exempel.[1][7]

Anpassning med förstärkningsinlärning

För Yi-Lightning tillämpas en flerstegsprocess för anpassning: SFT följt av RLHF/DPO. Syntetiska data genereras med hjälp av Monte Carlo Tree Search (MCTS). Säkerhetsramverket RAISE implementerar ett fyrnivåskydd: filtrering av förträningsdata, safety fine-tuning, kontroll av inmatade prompt och kontroll av genererade svar.[8]

Kontextutvidgning

Utvidgningen av kontextfönstret till 200 000 token realiseras genom lätt kontinuerlig förträning på 5 miljarder token (böcker + syntetiska fråge-svar) med tekniken RoPE ABF. Efter finjustering uppnår precisionen i uppgiften Needle-in-a-Haystack (sökning efter ett målfragment i en lång text) 99,8 %.[1][2]

Djupskalning (Depth Upscaling)

Yi-9B togs fram genom duplicering av lager 12–28 i grundmodellen Yi-6B med efterföljande förträning på 800 miljarder token. Metoden möjliggör ökad modellkapacitet utan träning från grunden.[1]

Modellernas sammansättning

Grundläggande språkmodeller

Modell Parametrar Typ Kontext Lanseringsdatum Licens Anmärkning
Yi-6B / Yi-34B 6 miljarder / 34 miljarder Base / Chat 4K (utökad till 32K) November 2023 Apache 2.0 Grundmodeller, tränade från grunden
Yi-6B-200K / Yi-34B-200K 6 miljarder / 34 miljarder Base 200K November 2023 Apache 2.0 Kontinuerlig förträning på långa sekvenser
Yi-9B 9 miljarder Base 4K (utökad till 200K) Mars 2024 Apache 2.0 Depth-upscale från Yi-6B + 800 miljarder token
Yi-1.5-6B/9B/34B 6 / 9 / 34 miljarder Base / Chat 4K / 16K / 32K Maj 2024 Apache 2.0 +500 miljarder token + 3 miljoner SFT-exempel
Yi-Large ~1 biljon (MoE, antal aktiva ej avslöjat) LLM Ej avslöjad Maj 2024 Sluten (API) Positionerad som SOTA
Yi-Lightning MoE (antal experter ej avslöjat) LLM 64K Oktober 2024 API 6:e plats LMSYS Chatbot Arena

Källor: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]

Specialiserade modeller

Modell Parametrar Modaliteter Kontext Lanseringsdatum Anmärkning
Yi-VL-6B / Yi-VL-34B 6 / 34 miljarder Text + bilder (448×448) Standard för grundmodellen Januari 2024 ViT-encoder (CLIP ViT-H/14), trestegig träning
Yi-Coder-1.5B / Yi-Coder-9B 1,5 / 9 miljarder Text (kod) 128K September 2024 52 programmeringsspråk

Källor: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]

API-identifierare

Exempel på plattformen 01.AI och hos tredjepartsleverantörer: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]

Utvärdering och benchmark

Resultat för grundmodeller

Data från den tekniska rapporten arXiv:2403.04652 (villkor: 0-shot / 5-shot, beroende på benchmark):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63,2 76,3 62,6 69,7 66,7
BBH 42,8 54,3 44,1 53,4
C-Eval 72,0 81,4 50,1 72,1 70,1
CMMLU 75,5 83,7 53,3 71,0 52,5
GSM8K 32,5 67,2 42,2 56,8 61,3 57,1
HumanEval 15,9 23,2 22,6 31,7 32,3 48,1

Källa: arXiv:2403.04652, resultattabeller.[1]

Yi-34B uppvisade resultat som överstiger Llama 2-70B (vid hälften av modellstorleken) på de flesta benchmark och ledde bland öppna modeller på C-Eval och CMMLU vid lanseringstillfället.[1][12]

Resultat för Yi-Lightning

Data från den tekniska rapporten arXiv:2412.01253 (villkor: 0-shot om inget annat anges):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50,9 49,1 45,1
MATH 76,4 82,7 67,1
HumanEval 83,5 86,0 76,2
WildBench 65,1 59,9 49,0
Arena-Hard 91,8 90,5 74,0

Källa: arXiv:2412.01253.[8]

Användarrankning

Yi-34B-Chat intog 2:a plats på AlpacaEval (94,08 %, efter GPT-4 Turbo) i december 2023 – januari 2024, med Elo-betyg ~1110 på LMSYS Chatbot Arena. Yi-34B ledde bland öppna modeller på Hugging Face Open LLM Leaderboard och C-Eval vid lanseringstillfället.[2][1]

Yi-Lightning intog 6:e plats totalt på LMSYS Chatbot Arena (poäng 1287), 2:a plats för kinesiska och 3–4:e plats i underkategorierna "matematik", "kodning", "hard prompts" och "multi-turn" vid tidpunkten för rapportens publicering.[8]

Obs. Direkt jämförelse av modeller från olika lanseringar och konfigurationer kräver enhetliga testförhållanden (samma versioner av benchmark, identiska genereringsparametrar). Subjektiva bedömningar på crowdsourcade plattformar beror på deltagarnas sammansättning och den aktuella uppsättningen modeller i systemet.[12]

Tillämpningsområden

Yi-familjen används inom ett brett spektrum av uppgifter inom naturlig språkbehandling och multimodal analys:[3][13]

  • Chattassistenter och dialogsystem — baserade på chattvarianter Yi-34B-Chat och Yi-1.5.
  • Kodgenerering och kodanalys — Yi-Coder stöder 52 programmeringsspråk.
  • Analys av långa dokument — varianter med 200K kontext för juridiska, tekniska och analytiska uppgifter.
  • Multimodal analys — bildbeskrivning och visuell fråge-svar via Yi-VL.
  • Företagsagenter — RAG-system, kunskapssökning och dataklassificering via plattformen 01.AI.
  • Lokal driftsättning — via vLLM, llama.cpp, Hugging Face Transformers; kvantiserade versioner (AWQ/GPTQ 4/8-bit) finns tillgängliga för driftsättning på konsument-GPU (exempelvis RTX 4090 för Yi-34B-4bit).

API-varianter (Yi-Large, Yi-Lightning) används för chattbotar, flerspråkiga tjänster och kostnadseffektiv inferens. Kostnaden för inferens med Yi-Lightning uppgick till 14 cent per miljon token per 2024.[8]

Begränsningar och öppna problem

  • Hallucinationer. Modellerna uppvisar typiska faktafel för LLM i genererade svar, särskilt vid komplexa resonemang och långa slutledningskedjor.[1]
  • Matematik och kod i tidiga versioner. Grundmodellerna Yi-34B uppvisar svagare resultat vid komplex kodning och matematik jämfört med specialiserade frontier-modeller (exempelvis MATH Yi-34B i 4-shot — 14,4). Detta problem har delvis åtgärdats i Yi-1.5 och Yi-Lightning.[1][8]
  • Lång kontext. Utvidgning till 200K kräver ytterligare förträning och beräkningsresurser; en viss prestandaförsämring på kort kontext är möjlig.[1]
  • Slutna modeller. Yi-Large och Yi-Lightning tillhandahåller inte vikter för nedladdning, vilket begränsar oberoende verifiering av arkitektur och data.[8]
  • Skillnad mellan Arena och benchmark. Yi-Lightning uppvisar starka resultat i användarbaserade utvärderingar (Chatbot Arena), men ligger efter vissa konkurrenter på statiska akademiska benchmark — ett uttryck för det allmänna problemet med inkonsekvens hos mätvärden.[8]
  • Reproducerbarhet. Inte alla träningsdetaljer (exakt datauppsättningens sammansättning, domänfördelning, hyperparametrar) är fullständigt offentliggjorda.[13]
  • Promptkänslighet. Liksom andra LLM är Yi-modellerna känsliga för hur prompten formuleras, vilket påverkar stabiliteten i slutsatserna.[1]

Inga kända allvarliga regressioner efter lanseringar har registrerats; communityn noterar stabiliteten hos kvantiserade versioner.[2]

Etiska och regulatoriska aspekter

I Yi-Lightning har säkerhetsramverket RAISE implementerats, vilket ger ett fyrnivåskydd:[8]

  • Filtrering av toxiskt innehåll, PII och skadligt material under förträningsfasen.
  • Safety fine-tuning med exempel på korrekt hantering av känsliga förfrågningar.
  • Kontroll av inmatning (klassificering av prompt).
  • Kontroll av utmatning (filtrering av svar).

Licensen Apache 2.0 för öppna modeller tillåter kommersiellt bruk; enskilda hostar kan ställa ytterligare krav. Modellerna uppfyller kinesiska regulatoriska normer inom AI (CAICT-certifiering för företagslösningar).[1][3]

Framtidsutsikter och forskningsinriktningar

Yi-serien visar på effektiviteten hos ett synsätt som prioriterar datakvalitet framför antalet parametrar, samt enkel skalning (continual pretraining, depth upscaling, MoE-optimeringar).[1]

Efter 2025 har 01.AI:s fokus förskjutits mot tillämpade lösningar:[4]

  • Multiagentsystem och företagsplattformen WorldWise LLM Platform 2.5.
  • Integration av tredjepartsmodeller (inklusive DeepSeek) i företags-workflow.
  • Inferensoptimering (kvantisering, FP8) för att minska driftsättningskostnader.

Öppna modeller används fortsatt av communityn för forskning, fine-tuning och destillation.[6]

Litteratur

Externa länkar

Noter

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms