Yi (01.AI) (NL)
Yi — een familie van grote taalmodellen (Large Language Model, LLM) en visueel-taalkundige modellen (Vision-Language Model, VLM), ontwikkeld door het bedrijf 01.AI (零一万物) onder leiding van Kai-Fu Lee. De modellen zijn vanaf nul getraind op een hoogwaardig tweetalig corpus (Engels en Chinees) van 3,1 biljoen tokens en omvatten varianten voor tekstgeneratie, verwerking van lange context (tot 200.000 tokens), multimodale invoer (tekst + afbeeldingen), codegeneratie en efficiënte inferentie op basis van de Mixture-of-Experts (MoE)-architectuur. Open varianten worden verspreid onder de Apache 2.0-licentie met toestemming voor commercieel gebruik; gesloten flagship-modellen (Yi-Large, Yi-Lightning) zijn beschikbaar via API.[1][2][3]
Geschiedenis en chronologie van de ontwikkeling
Bedrijf 01.AI werd in maart 2023 opgericht door Kai-Fu Lee, voormalig directeur van Microsoft Research Asia en Google China, met het hoofdkantoor in Peking. De focus van het bedrijf ligt op de ontwikkeling van efficiënte LLM's met nadruk op gegevenskwaliteit en technische infrastructuuroptimalisatie. In november 2023 bereikte 01.AI de status van 'eenhoorn' (waardering van meer dan 1 miljard dollar) na een financieringsronde met deelname van Alibaba.[4][5]
Eerste generatie (2023–2024)
De eerste open modellen Yi-6B en Yi-34B werden gepresenteerd op 2 november 2023. In de weken daarna werd de reeks aangevuld met varianten met een context van 200.000 tokens (5 november 2023), chatvarianten en gekwantiseerde modellen (23 november 2023). In januari 2024 verschenen de multimodale Yi-VL-6B en Yi-VL-34B. In maart 2024 werd het model Yi-9B gepresenteerd, verkregen via depth upscaling vanuit Yi-6B, en werd het technisch rapport arXiv:2403.04652 gepubliceerd.[1][2]
Yi-1.5 en gespecialiseerde modellen (2024)
Op 13 mei 2024 werd de Yi-1.5-serie (6B/9B/34B) uitgebracht — het resultaat van voortgezet vooraf trainen op aanvullende 500 miljard tokens en fine-tuning op 3 miljoen instructievoorbeelden. In mei–juni 2024 werd het gesloten propriëtaire model Yi-Large met API-toegang gepresenteerd, gepositioneerd als SOTA. In september 2024 verscheen de gespecialiseerde Yi-Coder-serie (1,5B/9B) voor codegeneratie met een context van 128.000 tokens en ondersteuning voor 52 programmeertalen.[1][6][7]
Yi-Lightning (2024)
In oktober 2024 werd het flagship-model Yi-Lightning gepresenteerd op basis van de Mixture-of-Experts (MoE)-architectuur, geoptimaliseerd voor snelheid en efficiëntie van inferentie. Yi-Lightning behaalde de 6e plaats in de algemene ranglijst van LMSYS Chatbot Arena (Elo 1287), de 2e plaats voor de Chinese taal en de 3e–4e plaats voor wiskunde en programmeren. Het technisch rapport werd gepubliceerd in december 2024 (arXiv:2412.01253).[8]
Strategiewijziging (2025)
In maart 2025 kondigde bedrijf 01.AI aan te stoppen met het vooraf trainen van nieuwe grote taalmodellen en richtte het zich op bedrijfsapplicaties, multi-agentsystemen en het WorldWise LLM Platform 2.5 op basis van externe modellen (waaronder DeepSeek).[4]
Beknopte chronologie
| Datum | Gebeurtenis |
|---|---|
| November 2023 | Release van Yi-6B en Yi-34B (base, chat, 200K-varianten) |
| Januari 2024 | Multimodale Yi-VL-6B en Yi-VL-34B |
| Maart 2024 | Yi-9B (depth-upscaled); publicatie van technisch rapport arXiv:2403.04652 |
| Mei 2024 | Yi-1.5 (6B/9B/34B); Yi-Large (gesloten, API) |
| September 2024 | Yi-Coder-1.5B/9B (specialisatie in code, context 128K) |
| Oktober 2024 | Yi-Lightning (MoE-architectuur, flagship-model) |
| December 2024 | Publicatie van technisch rapport Yi-Lightning (arXiv:2412.01253) |
| Maart 2025 | Stopzetting van vooraf trainen van nieuwe LLM's; focus op bedrijfsoplossingen |
Theoretische grondslagen en architectuur
Basisarchitectuur
Alle modellen van de Yi-familie zijn gebaseerd op de decoder-only Transformer-architectuur, beschreven in het werk van Vaswani et al.[9] De modellen zijn vanaf nul getraind en zijn geen afgeleiden van LLaMA, ondanks de gelijkenis in implementatie.[1]
Het basismechanisme van Multi-Head Self-Attention wordt beschreven door de formule:
waar , , respectievelijk de matrices van queries, keys en values zijn, en de dimensie van de keys is.[9]
Belangrijke architectuurwijzigingen van Yi:[1]
- Grouped-Query Attention (GQA) — verdeling van query-heads in groepen met gedeelde key/value-heads, waardoor geheugengebruik wordt verminderd met behoud van kwaliteit.
- SwiGLU-activatie — vervanging van de standaard ReLU/GELU; verkleint de omvang van activaties tot 8/3 van de dimensie van de verborgen laag (hidden size).
- Rotary Position Embedding (RoPE) met aangepaste basisfrequentie (adjusted base frequency, ABF), die contextuitbreiding mogelijk maakt zonder architectuurwijzigingen.
- Woordenschat (vocabulary): 64.000 tokens op basis van BPE (SentencePiece) met opdeling van getallen in cijfers en unicode-byte fallback voor zeldzame tekens.
Configuraties van basismodellen
Architectuurparameters uit het technisch rapport arXiv:2403.04652:[1]
| Parameter | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| Aantal lagen | 32 | 60 |
| Vooraf trainingslengte (Pretrain Seq. Len) | 4096 | 4096 |
| Max. leersnelheid (Max LR) | 3×10⁻⁴ | 1,5×10⁻⁴ |
Bron: arXiv:2403.04652, parametertabel.[1]
Architectuur van Yi-Lightning (MoE)
Yi-Lightning (2024) maakt gebruik van een verbeterde Mixture-of-Experts (MoE)-architectuur met de volgende kenmerken:[8]
- Fine-grained expert segmentation — fijnmazige opdeling van FFN-blokken in experts voor verhoogde specialisatie.
- Meerlaagse lastbalancering — combinatie van Switch-Transformer (ST)-, Expert Parallel (EP)- en Partitioned EP (PEP)-verliezen voor gelijkmatige verdeling van tokens tussen experts.
- Hybride aandacht — afwisseling van 3 lagen met sliding window en 1 laag met volledige aandacht (full attention), met hergebruik van de KV-cache tussen lagen.
- Vermindering van KV-cachegeheugen met 82,8% ten opzichte van de standaardaanpak bij de verwerking van lange reeksen.
- Contextvenster uitgebreid tot 64.000 tokens.
Het exacte aantal experts en het totale aantal parameters van Yi-Lightning worden niet bekendgemaakt in publieke bronnen.[8]
Multimodale varianten (Yi-VL)
In de multimodale modellen Yi-VL wordt het taalmodel verbonden met de visuele encoder CLIP ViT-H/14 via een MLP-projectie. Een afbeelding wordt door de visuele encoder omgezet in een reeks embeddings , die samen met teksttokens aan het taalmodel worden aangeboden. De training verloopt in drie fasen met toenemende resolutie: 224×224 → 448×448 pixels.[1]
Trainingspipeline en afstemming
Voorafgaand trainen (Pre-training)
De basismodellen Yi-6B en Yi-34B zijn vooraf getraind op een tweetalig corpus van 3,1 biljoen tokens. De gegevens doorlopen een trapsgewijze filtering- en deduplicatiepipeline: heuristische filters, getrainde scorers (perplexity, quality, coherence, safety), clustering en MinHash-deduplicatie. Bronnen zijn Common Crawl, boeken en wetenschappelijke artikelen.[1]
Voor Yi-1.5 is voortgezet vooraf trainen (continued pre-training) uitgevoerd op aanvullende 500 miljard tokens van een hoogwaardig corpus.[7]
Gesuperviseerde fine-tuning (Supervised Fine-Tuning, SFT)
Chatvarianten van de eerste generatie zijn fine-getuned op een kleine maar zorgvuldig samengestelde set — minder dan 10.000 multi-turn-voorbeelden, elk handmatig gecontroleerd en bewerkt door ML-engineers. Voor Yi-1.5 is het volume van de SFT-gegevens vergroot tot 3 miljoen voorbeelden.[1][7]
Afstemming via Reinforcement Learning
Voor Yi-Lightning wordt een meerfasig afstemmingsproces toegepast: SFT gevolgd door RLHF/DPO. Synthetische gegevens worden gegenereerd met behulp van Monte Carlo Tree Search (MCTS). Het veiligheidsframework RAISE implementeert een vierniveaubeveiliging: filtering van vooraf trainingsgegevens, safety fine-tuning, invoercontrole van prompts en uitvoercontrole van antwoorden.[8]
Contextuitbreiding
Uitbreiding van het contextvenster tot 200.000 tokens is gerealiseerd via licht voortgezet vooraf trainen op 5 miljard tokens (boeken + synthetische vraag-antwoordparen) met gebruikmaking van de RoPE ABF-techniek. Na verfijning bereikt de nauwkeurigheid bij de Needle-in-a-Haystack-taak (zoeken naar een doelfragment in een lange tekst) 99,8%.[1][2]
Diepte-opschaling (Depth Upscaling)
Yi-9B is verkregen door lagen 12–28 van het basismodel Yi-6B te dupliceren, gevolgd door vooraf trainen op 800 miljard tokens. De methode zorgt voor een grotere modelcapaciteit zonder training vanaf nul.[1]
Samenstelling van de modelfamilie
Belangrijkste taalmodellen
| Model | Parameters | Type | Context | Releasedatum | Licentie | Opmerking |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | 6 mld / 34 mld | Base / Chat | 4K (uitgebreid tot 32K) | November 2023 | Apache 2.0 | Basismodellen, vanaf nul getraind |
| Yi-6B-200K / Yi-34B-200K | 6 mld / 34 mld | Base | 200K | November 2023 | Apache 2.0 | Voortgezet vooraf trainen op lange reeksen |
| Yi-9B | 9 mld | Base | 4K (uitgebreid tot 200K) | Maart 2024 | Apache 2.0 | Depth-upscale vanuit Yi-6B + 800 mld tokens |
| Yi-1.5-6B/9B/34B | 6 / 9 / 34 mld | Base / Chat | 4K / 16K / 32K | Mei 2024 | Apache 2.0 | +500 mld tokens + 3 mln SFT-voorbeelden |
| Yi-Large | ~1 bln (MoE, actieve niet bekendgemaakt) | LLM | Niet bekendgemaakt | Mei 2024 | Gesloten (API) | Gepositioneerd als SOTA |
| Yi-Lightning | MoE (aantal experts niet bekendgemaakt) | LLM | 64K | Oktober 2024 | API | 6e plaats LMSYS Chatbot Arena |
Bronnen: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]
Gespecialiseerde modellen
| Model | Parameters | Modaliteiten | Context | Releasedatum | Opmerking |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | 6 / 34 mld | Tekst + afbeeldingen (448×448) | Standaard van basismodel | Januari 2024 | ViT-encoder (CLIP ViT-H/14), drietrapsgewijze training |
| Yi-Coder-1.5B / Yi-Coder-9B | 1,5 / 9 mld | Tekst (code) | 128K | September 2024 | 52 programmeertalen |
Bronnen: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]
API-identificatoren
Voorbeelden op het platform van 01.AI en externe aanbieders: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]
Evaluatie en benchmarks
Resultaten van basismodellen
Gegevens uit het technisch rapport arXiv:2403.04652 (condities: 0-shot / 5-shot, afhankelijk van de benchmark):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63,2 | 76,3 | 62,6 | 69,7 | 66,7 | — |
| BBH | 42,8 | 54,3 | 44,1 | — | 53,4 | — |
| C-Eval | 72,0 | 81,4 | — | 50,1 | 72,1 | 70,1 |
| CMMLU | 75,5 | 83,7 | — | 53,3 | 71,0 | 52,5 |
| GSM8K | 32,5 | 67,2 | 42,2 | 56,8 | 61,3 | 57,1 |
| HumanEval | 15,9 | 23,2 | 22,6 | 31,7 | 32,3 | 48,1 |
Bron: arXiv:2403.04652, resultaattabellen.[1]
Yi-34B behaalde resultaten die Llama 2-70B (bij de helft van het aantal parameters) overtreffen op de meeste benchmarks en leidend waren onder open modellen op C-Eval en CMMLU ten tijde van de release.[1][12]
Resultaten van Yi-Lightning
Gegevens uit het technisch rapport arXiv:2412.01253 (condities: 0-shot, tenzij anders aangegeven):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50,9 | 49,1 | 45,1 |
| MATH | 76,4 | 82,7 | 67,1 |
| HumanEval | 83,5 | 86,0 | 76,2 |
| WildBench | 65,1 | 59,9 | 49,0 |
| Arena-Hard | 91,8 | 90,5 | 74,0 |
Bron: arXiv:2412.01253.[8]
Gebruikersranglijsten
Yi-34B-Chat stond op de 2e plaats op AlpacaEval (94,08%, na GPT-4 Turbo) in december 2023 – januari 2024, met een Elo-score van ~1110 op LMSYS Chatbot Arena. Yi-34B was leidend onder open modellen op de Hugging Face Open LLM Leaderboard en C-Eval ten tijde van de release.[2][1]
Yi-Lightning behaalde de 6e algemene plaats op LMSYS Chatbot Arena (score 1287), de 2e plaats voor de Chinese taal en de 3e–4e plaatsen in de subcategorieën 'wiskunde', 'programmeren', 'hard prompts' en 'multi-turn' ten tijde van de publicatie van het rapport.[8]
Opmerking. Directe vergelijking van modellen uit verschillende releases en configuraties vereist uniforme testomstandigheden (dezelfde versies van benchmarks, identieke generatieparameters). Subjectieve beoordelingen op crowdsourcingplatforms zijn afhankelijk van de samenstelling van deelnemers en de actuele set modellen in het systeem.[12]
Toepassingen
De Yi-familie wordt ingezet voor een breed scala aan taken op het gebied van natuurlijke taalverwerking en multimodale analyse:[3][13]
- Chatassistenten en dialoogsystemen — op basis van de chatvarianten Yi-34B-Chat en Yi-1.5.
- Codegeneratie en -analyse — Yi-Coder ondersteunt 52 programmeertalen.
- Analyse van lange documenten — varianten met een context van 200K voor juridische, technische en analytische taken.
- Multimodale analyse — beschrijving van afbeeldingen en visuele vraag-antwoord via Yi-VL.
- Bedrijfsagenten — RAG-systemen, kennisopzoekingen en gegevensclassificatie via het platform van 01.AI.
- Lokale implementatie — via vLLM, llama.cpp, Hugging Face Transformers; gekwantiseerde versies (AWQ/GPTQ 4/8-bit) zijn beschikbaar voor implementatie op consumentenGPU's (bijv. RTX 4090 voor Yi-34B-4bit).
API-varianten (Yi-Large, Yi-Lightning) worden gebruikt voor chatbots, meertalige diensten en low-cost inference. De inferentiekosten van Yi-Lightning bedroegen 14 cent per miljoen tokens in 2024.[8]
Beperkingen en open problemen
- Hallucinaties. De modellen zijn gevoelig voor de voor LLM's typische feitelijke fouten in gegenereerde antwoorden, met name bij complexe redeneerprocessen en lange inferentieketens.[1]
- Wiskunde en code in vroege versies. De basismodellen Yi-34B presteren zwakker bij complexe programmeer- en wiskundetaken vergeleken met gespecialiseerde frontier-modellen (bijv. MATH Yi-34B bij 4-shot — 14,4). Dit probleem is gedeeltelijk opgelost in Yi-1.5 en Yi-Lightning.[1][8]
- Lange context. Uitbreiding tot 200K vereist aanvullend vooraf trainen en rekenbronnen; enige lichte prestatiedegradatie bij korte context is mogelijk.[1]
- Gesloten modellen. Yi-Large en Yi-Lightning stellen geen gewichten beschikbaar voor download, wat onafhankelijke verificatie van de architectuur en de gegevens beperkt.[8]
- Kloof tussen Arena en benchmarks. Yi-Lightning behaalt sterke resultaten bij gebruikersbeoordelingen (Chatbot Arena), maar blijft achter bij sommige concurrenten op statische academische benchmarks — een weerspiegeling van het algemene probleem van metriekeninconsisteties.[8]
- Reproduceerbaarheid. Niet alle trainingsdetails (exacte samenstelling van de dataset, domeinverdeling, hyperparameters) zijn volledig bekendgemaakt.[13]
- Promptgevoeligheid. Net als andere LLM's zijn Yi-modellen gevoelig voor de formulering van de prompt, wat de stabiliteit van de uitvoer beïnvloedt.[1]
Er zijn geen bekende ernstige regressies na releases geconstateerd; de gemeenschap merkt de stabiliteit van gekwantiseerde versies op.[2]
Ethische en regulatoire aspecten
In Yi-Lightning is het veiligheidsframework RAISE geïmplementeerd, dat een vierniveaubeveiliging biedt:[8]
- Filtering van toxische inhoud, persoonlijk identificeerbare informatie (PII) en schadelijk materiaal tijdens de vooraf trainingsfase.
- Safety fine-tuning met voorbeelden van correcte verwerking van gevoelige verzoeken.
- Invoercontrole (classificatie van prompts).
- Uitvoercontrole (filtering van antwoorden).
De Apache 2.0-licentie voor open modellen staat commercieel gebruik toe; afzonderlijke hostingaanbieders kunnen aanvullende eisen stellen. De modellen voldoen aan de Chinese regelgeving op het gebied van AI (CAICT-certificering voor bedrijfsoplossingen).[1][3]
Vooruitzichten en onderzoeksrichtingen
De Yi-serie toont de doeltreffendheid aan van een aanpak waarbij gegevenskwaliteit boven het aantal parameters wordt gesteld, alsook van lichte opschaling (continual pretraining, depth upscaling, MoE-optimalisaties).[1]
Na 2025 verschoof de nadruk van 01.AI naar toegepaste oplossingen:[4]
- Multi-agentsystemen en het enterprise-platform WorldWise LLM Platform 2.5.
- Integratie van externe modellen (waaronder DeepSeek) in bedrijfsworkflows.
- Optimalisatie van inferentie (kwantisering, FP8) om de implementatiekosten te verlagen.
Open modellen worden door de gemeenschap verder gebruikt voor onderzoek, fine-tuning en distillatie.[6]
Literatuur
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
Verwijzingen
- https://github.com/01-ai/Yi — Officiële GitHub-repository van Yi
- https://github.com/01-ai/Yi-1.5 — Repository van Yi-1.5
- https://www.01.ai/yi-models — Officiële pagina van Yi-modellen
- https://huggingface.co/01-ai — Organisatie 01-ai op Hugging Face
- https://en.wikipedia.org/wiki/01.AI — Wikipedia-artikel over bedrijf 01.AI
Noten
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms