Yi (01.AI) (SV)
Yi — en familj av stora språkmodeller (Large Language Model, LLM) och visuellt-språkliga modeller (Vision-Language Model, VLM), utvecklade av företaget 01.AI (零一万物) under ledning av Kai-Fu Lee. Modellerna är tränade från grunden på ett högkvalitativt tvåspråkigt korpus (engelska och kinesiska) med en volym av 3,1 biljoner token och inkluderar varianter för textgenerering, hantering av lång kontext (upp till 200 000 token), multimodal inmatning (text + bilder), kodgenerering samt effektiv inferens baserad på arkitekturen Mixture-of-Experts (MoE). Öppna varianter distribueras under licensen Apache 2.0 med tillstånd för kommersiellt bruk; slutna flaggskeppsmodeller (Yi-Large, Yi-Lightning) är tillgängliga via API.[1][2][3]
Historia och utvecklingstidslinje
Företaget 01.AI grundades i mars 2023 av Kai-Fu Lee, tidigare chef för Microsoft Research Asia och Google China, med huvudkontor i Peking. Företagets fokus ligger på att utveckla effektiva LLM med tonvikt på datakvalitet och teknisk optimering av infrastrukturen. I november 2023 uppnådde 01.AI status som "enhörning" (värdering över 1 miljard dollar) efter en finansieringsrunda med deltagande av Alibaba.[4][5]
Första generationen (2023–2024)
De första öppna modellerna Yi-6B och Yi-34B presenterades den 2 november 2023. Under de följande veckorna utökades serien med varianter med 200 000 tokens kontext (5 november 2023), chattvarianter och kvantiserade modeller (23 november 2023). I januari 2024 lanserades de multimodala Yi-VL-6B och Yi-VL-34B. I mars 2024 presenterades modellen Yi-9B, framtagen genom djupskalning (depth upscaling) från Yi-6B, och en teknisk rapport publicerades: arXiv:2403.04652.[1][2]
Yi-1.5 och specialiserade modeller (2024)
Den 13 maj 2024 släpptes serien Yi-1.5 (6B/9B/34B) — resultatet av kontinuerlig förträning på ytterligare 500 miljarder token och fine-tuning på 3 miljoner instruktionsexempel. I maj–juni 2024 presenterades den slutna proprietära modellen Yi-Large med API-åtkomst, positionerad som SOTA. I september 2024 lanserades den specialiserade serien Yi-Coder (1,5B/9B) för kodgenerering med en kontext på 128 000 token och stöd för 52 programmeringsspråk.[1][6][7]
Yi-Lightning (2024)
I oktober 2024 presenterades flaggskeppsmodellen Yi-Lightning baserad på arkitekturen Mixture-of-Experts (MoE), optimerad för hastighet och inferenseffektivitet. Yi-Lightning intog 6:e plats i den övergripande rankningen på LMSYS Chatbot Arena (Elo 1287), 2:a plats för kinesiska och 3–4:e plats för matematik och kodning. Den tekniska rapporten publicerades i december 2024 (arXiv:2412.01253).[8]
Strategiändring (2025)
I mars 2025 meddelade företaget 01.AI att man avbryter förträningen av nya stora språkmodeller och fokuserar på företagsapplikationer, multiagentsystem och plattformen WorldWise LLM Platform 2.5 baserad på tredjepartsmodeller (inklusive DeepSeek).[4]
Sammanfattande tidslinje
| Datum | Händelse |
|---|---|
| November 2023 | Lansering av Yi-6B och Yi-34B (base, chat, 200K-varianter) |
| Januari 2024 | Multimodala Yi-VL-6B och Yi-VL-34B |
| Mars 2024 | Yi-9B (depth-upscaled); publicering av teknisk rapport arXiv:2403.04652 |
| Maj 2024 | Yi-1.5 (6B/9B/34B); Yi-Large (sluten, API) |
| September 2024 | Yi-Coder-1.5B/9B (specialisering på kod, kontext 128K) |
| Oktober 2024 | Yi-Lightning (MoE-arkitektur, flaggskeppsmodell) |
| December 2024 | Publicering av teknisk rapport Yi-Lightning (arXiv:2412.01253) |
| Mars 2025 | Avbrytande av förträning av nya LLM; fokus på företagslösningar |
Teoretiska grunder och arkitektur
Grundläggande arkitektur
Alla modeller i Yi-familjen baseras på arkitekturen decoder-only Transformer, beskriven i arbetet av Vaswani et al.[9] Modellerna är tränade från grunden och är inte derivat av LLaMA, trots likheter i implementering.[1]
Grundmekanismen för Multi-Head Self-Attention beskrivs av formeln:
där , , — matriserna för frågor (queries), nycklar (keys) och värden (values) respektive, — nyckelns dimensionalitet.[9]
Viktigaste arkitekturmodifieringarna i Yi:[1]
- Grouped-Query Attention (GQA) — uppdelning av query-huvuden i grupper med gemensamma key/value-huvuden, vilket minskar minnesförbrukningen utan att förlora kvalitet.
- SwiGLU-aktivering — ersättning av standard ReLU/GELU; minskar aktiveringarnas storlek till 8/3 av det dolda lagrets dimensionalitet (hidden size).
- Rotary Position Embedding (RoPE) med anpassad grundfrekvens (adjusted base frequency, ABF), som möjliggör kontextutvidgning utan arkitekturförändringar.
- Vokabulär (vocabulary): 64 000 token baserade på BPE (SentencePiece) med uppdelning av tal i siffror och unicode-byte fallback för sällsynta tecken.
Konfigurationer för grundmodeller
Arkitekturparametrar från den tekniska rapporten arXiv:2403.04652:[1]
| Parameter | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| Antal lager | 32 | 60 |
| Förträningslängd (Pretrain Seq. Len) | 4096 | 4096 |
| Max inlärningshastighet (Max LR) | 3×10⁻⁴ | 1,5×10⁻⁴ |
Källa: arXiv:2403.04652, parametertabell.[1]
Arkitektur för Yi-Lightning (MoE)
Yi-Lightning (2024) använder en förbättrad Mixture-of-Experts (MoE)-arkitektur med följande egenskaper:[8]
- Fine-grained expert segmentation — finkornad uppdelning av FFN-block i experter för ökad specialisering.
- Flernivåbalansering av belastning — kombination av Switch-Transformer (ST), Expert Parallel (EP) och Partitioned EP (PEP) losses för jämn fördelning av token mellan experter.
- Hybrid attention — växling mellan 3 lager med skjutfönster (sliding window) och 1 lager med fullständig uppmärksamhet (full attention), med återanvändning av KV-cache mellan lager.
- Minskning av KV-cache-minne med 82,8 % jämfört med standardmetoden vid bearbetning av långa sekvenser.
- Kontextfönster utökat till 64 000 token.
Exakt antal experter och det totala antalet parametrar i Yi-Lightning har inte avslöjats i offentliga källor.[8]
Multimodala varianter (Yi-VL)
I de multimodala modellerna Yi-VL kopplas språkmodellen till den visuella encodern CLIP ViT-H/14 via en MLP-projektion. Bilden omvandlas av den visuella encodern till en sekvens av embeddings , som matas in i språkmodellen tillsammans med texttoken. Träningen sker i tre steg med ökande upplösning: 224×224 → 448×448 pixlar.[1]
Träningspipeline och anpassning
Förträning (Pre-training)
Grundmodellerna Yi-6B och Yi-34B är förtränade på ett tvåspråkigt korpus med 3,1 biljoner token. Data genomgår en kaskadpipeline för filtrering och deduplicering: heuristiska filter, tränade skoreringsfunktioner (perplexity, quality, coherence, safety), klustring och MinHash-deduplicering. Källor inkluderar Common Crawl, böcker och vetenskapliga artiklar.[1]
För Yi-1.5 genomfördes kontinuerlig förträning (continued pre-training) på ytterligare 500 miljarder token av högkvalitativt korpus.[7]
Övervakat fine-tuning (Supervised Fine-Tuning, SFT)
Chattvarianter av första generationen är fine-tunade på en liten men noggrant verifierad uppsättning — färre än 10 000 flerturs- (multi-turn) exempel, var och en manuellt kontrollerad och redigerad av maskininlärningsingenjörer. För Yi-1.5 ökades volymen SFT-data till 3 miljoner exempel.[1][7]
Anpassning med förstärkningsinlärning
För Yi-Lightning tillämpas en flerstegsprocess för anpassning: SFT följt av RLHF/DPO. Syntetiska data genereras med hjälp av Monte Carlo Tree Search (MCTS). Säkerhetsramverket RAISE implementerar ett fyrnivåskydd: filtrering av förträningsdata, safety fine-tuning, kontroll av inmatade prompt och kontroll av genererade svar.[8]
Kontextutvidgning
Utvidgningen av kontextfönstret till 200 000 token realiseras genom lätt kontinuerlig förträning på 5 miljarder token (böcker + syntetiska fråge-svar) med tekniken RoPE ABF. Efter finjustering uppnår precisionen i uppgiften Needle-in-a-Haystack (sökning efter ett målfragment i en lång text) 99,8 %.[1][2]
Djupskalning (Depth Upscaling)
Yi-9B togs fram genom duplicering av lager 12–28 i grundmodellen Yi-6B med efterföljande förträning på 800 miljarder token. Metoden möjliggör ökad modellkapacitet utan träning från grunden.[1]
Modellernas sammansättning
Grundläggande språkmodeller
| Modell | Parametrar | Typ | Kontext | Lanseringsdatum | Licens | Anmärkning |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | 6 miljarder / 34 miljarder | Base / Chat | 4K (utökad till 32K) | November 2023 | Apache 2.0 | Grundmodeller, tränade från grunden |
| Yi-6B-200K / Yi-34B-200K | 6 miljarder / 34 miljarder | Base | 200K | November 2023 | Apache 2.0 | Kontinuerlig förträning på långa sekvenser |
| Yi-9B | 9 miljarder | Base | 4K (utökad till 200K) | Mars 2024 | Apache 2.0 | Depth-upscale från Yi-6B + 800 miljarder token |
| Yi-1.5-6B/9B/34B | 6 / 9 / 34 miljarder | Base / Chat | 4K / 16K / 32K | Maj 2024 | Apache 2.0 | +500 miljarder token + 3 miljoner SFT-exempel |
| Yi-Large | ~1 biljon (MoE, antal aktiva ej avslöjat) | LLM | Ej avslöjad | Maj 2024 | Sluten (API) | Positionerad som SOTA |
| Yi-Lightning | MoE (antal experter ej avslöjat) | LLM | 64K | Oktober 2024 | API | 6:e plats LMSYS Chatbot Arena |
Källor: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]
Specialiserade modeller
| Modell | Parametrar | Modaliteter | Kontext | Lanseringsdatum | Anmärkning |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | 6 / 34 miljarder | Text + bilder (448×448) | Standard för grundmodellen | Januari 2024 | ViT-encoder (CLIP ViT-H/14), trestegig träning |
| Yi-Coder-1.5B / Yi-Coder-9B | 1,5 / 9 miljarder | Text (kod) | 128K | September 2024 | 52 programmeringsspråk |
Källor: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]
API-identifierare
Exempel på plattformen 01.AI och hos tredjepartsleverantörer: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]
Utvärdering och benchmark
Resultat för grundmodeller
Data från den tekniska rapporten arXiv:2403.04652 (villkor: 0-shot / 5-shot, beroende på benchmark):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63,2 | 76,3 | 62,6 | 69,7 | 66,7 | — |
| BBH | 42,8 | 54,3 | 44,1 | — | 53,4 | — |
| C-Eval | 72,0 | 81,4 | — | 50,1 | 72,1 | 70,1 |
| CMMLU | 75,5 | 83,7 | — | 53,3 | 71,0 | 52,5 |
| GSM8K | 32,5 | 67,2 | 42,2 | 56,8 | 61,3 | 57,1 |
| HumanEval | 15,9 | 23,2 | 22,6 | 31,7 | 32,3 | 48,1 |
Källa: arXiv:2403.04652, resultattabeller.[1]
Yi-34B uppvisade resultat som överstiger Llama 2-70B (vid hälften av modellstorleken) på de flesta benchmark och ledde bland öppna modeller på C-Eval och CMMLU vid lanseringstillfället.[1][12]
Resultat för Yi-Lightning
Data från den tekniska rapporten arXiv:2412.01253 (villkor: 0-shot om inget annat anges):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50,9 | 49,1 | 45,1 |
| MATH | 76,4 | 82,7 | 67,1 |
| HumanEval | 83,5 | 86,0 | 76,2 |
| WildBench | 65,1 | 59,9 | 49,0 |
| Arena-Hard | 91,8 | 90,5 | 74,0 |
Källa: arXiv:2412.01253.[8]
Användarrankning
Yi-34B-Chat intog 2:a plats på AlpacaEval (94,08 %, efter GPT-4 Turbo) i december 2023 – januari 2024, med Elo-betyg ~1110 på LMSYS Chatbot Arena. Yi-34B ledde bland öppna modeller på Hugging Face Open LLM Leaderboard och C-Eval vid lanseringstillfället.[2][1]
Yi-Lightning intog 6:e plats totalt på LMSYS Chatbot Arena (poäng 1287), 2:a plats för kinesiska och 3–4:e plats i underkategorierna "matematik", "kodning", "hard prompts" och "multi-turn" vid tidpunkten för rapportens publicering.[8]
Obs. Direkt jämförelse av modeller från olika lanseringar och konfigurationer kräver enhetliga testförhållanden (samma versioner av benchmark, identiska genereringsparametrar). Subjektiva bedömningar på crowdsourcade plattformar beror på deltagarnas sammansättning och den aktuella uppsättningen modeller i systemet.[12]
Tillämpningsområden
Yi-familjen används inom ett brett spektrum av uppgifter inom naturlig språkbehandling och multimodal analys:[3][13]
- Chattassistenter och dialogsystem — baserade på chattvarianter Yi-34B-Chat och Yi-1.5.
- Kodgenerering och kodanalys — Yi-Coder stöder 52 programmeringsspråk.
- Analys av långa dokument — varianter med 200K kontext för juridiska, tekniska och analytiska uppgifter.
- Multimodal analys — bildbeskrivning och visuell fråge-svar via Yi-VL.
- Företagsagenter — RAG-system, kunskapssökning och dataklassificering via plattformen 01.AI.
- Lokal driftsättning — via vLLM, llama.cpp, Hugging Face Transformers; kvantiserade versioner (AWQ/GPTQ 4/8-bit) finns tillgängliga för driftsättning på konsument-GPU (exempelvis RTX 4090 för Yi-34B-4bit).
API-varianter (Yi-Large, Yi-Lightning) används för chattbotar, flerspråkiga tjänster och kostnadseffektiv inferens. Kostnaden för inferens med Yi-Lightning uppgick till 14 cent per miljon token per 2024.[8]
Begränsningar och öppna problem
- Hallucinationer. Modellerna uppvisar typiska faktafel för LLM i genererade svar, särskilt vid komplexa resonemang och långa slutledningskedjor.[1]
- Matematik och kod i tidiga versioner. Grundmodellerna Yi-34B uppvisar svagare resultat vid komplex kodning och matematik jämfört med specialiserade frontier-modeller (exempelvis MATH Yi-34B i 4-shot — 14,4). Detta problem har delvis åtgärdats i Yi-1.5 och Yi-Lightning.[1][8]
- Lång kontext. Utvidgning till 200K kräver ytterligare förträning och beräkningsresurser; en viss prestandaförsämring på kort kontext är möjlig.[1]
- Slutna modeller. Yi-Large och Yi-Lightning tillhandahåller inte vikter för nedladdning, vilket begränsar oberoende verifiering av arkitektur och data.[8]
- Skillnad mellan Arena och benchmark. Yi-Lightning uppvisar starka resultat i användarbaserade utvärderingar (Chatbot Arena), men ligger efter vissa konkurrenter på statiska akademiska benchmark — ett uttryck för det allmänna problemet med inkonsekvens hos mätvärden.[8]
- Reproducerbarhet. Inte alla träningsdetaljer (exakt datauppsättningens sammansättning, domänfördelning, hyperparametrar) är fullständigt offentliggjorda.[13]
- Promptkänslighet. Liksom andra LLM är Yi-modellerna känsliga för hur prompten formuleras, vilket påverkar stabiliteten i slutsatserna.[1]
Inga kända allvarliga regressioner efter lanseringar har registrerats; communityn noterar stabiliteten hos kvantiserade versioner.[2]
Etiska och regulatoriska aspekter
I Yi-Lightning har säkerhetsramverket RAISE implementerats, vilket ger ett fyrnivåskydd:[8]
- Filtrering av toxiskt innehåll, PII och skadligt material under förträningsfasen.
- Safety fine-tuning med exempel på korrekt hantering av känsliga förfrågningar.
- Kontroll av inmatning (klassificering av prompt).
- Kontroll av utmatning (filtrering av svar).
Licensen Apache 2.0 för öppna modeller tillåter kommersiellt bruk; enskilda hostar kan ställa ytterligare krav. Modellerna uppfyller kinesiska regulatoriska normer inom AI (CAICT-certifiering för företagslösningar).[1][3]
Framtidsutsikter och forskningsinriktningar
Yi-serien visar på effektiviteten hos ett synsätt som prioriterar datakvalitet framför antalet parametrar, samt enkel skalning (continual pretraining, depth upscaling, MoE-optimeringar).[1]
Efter 2025 har 01.AI:s fokus förskjutits mot tillämpade lösningar:[4]
- Multiagentsystem och företagsplattformen WorldWise LLM Platform 2.5.
- Integration av tredjepartsmodeller (inklusive DeepSeek) i företags-workflow.
- Inferensoptimering (kvantisering, FP8) för att minska driftsättningskostnader.
Öppna modeller används fortsatt av communityn för forskning, fine-tuning och destillation.[6]
Litteratur
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
Externa länkar
- https://github.com/01-ai/Yi — Officiellt GitHub-arkiv för Yi
- https://github.com/01-ai/Yi-1.5 — Arkiv för Yi-1.5
- https://www.01.ai/yi-models — Officiell sida för Yi-modeller
- https://huggingface.co/01-ai — Organisationen 01-ai på Hugging Face
- https://en.wikipedia.org/wiki/01.AI — Wikipedia-artikel om företaget 01.AI
Noter
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms