Yi (01.AI) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — बड़े भाषा मॉडलों (Large Language Model, LLM) और दृश्य-भाषा मॉडलों (Vision-Language Model, VLM) का एक परिवार है, जिसे Kai-Fu Lee के नेतृत्व में 01.AI (零一万物) कंपनी द्वारा विकसित किया गया है। इन मॉडलों को 3.1 ट्रिलियन token के उच्च-गुणवत्ता वाले द्विभाषी कॉर्पस (अंग्रेज़ी और चीनी भाषा) पर शुरू से प्रशिक्षित किया गया है और इनमें पाठ उत्पादन, लंबे संदर्भ की प्रसंस्करण (200 हज़ार token तक), मल्टीमॉडल इनपुट (पाठ + चित्र), कोड उत्पादन और Mixture-of-Experts (MoE) आर्किटेक्चर पर आधारित प्रभावी inference के लिए संस्करण शामिल हैं। खुले संस्करण Apache 2.0 लाइसेंस के तहत व्यावसायिक उपयोग की अनुमति के साथ वितरित किए जाते हैं; बंद स्रोत के प्रमुख मॉडल (Yi-Large, Yi-Lightning) API के माध्यम से उपलब्ध हैं।[1][2][3]

इतिहास और विकास की कालक्रम

01.AI कंपनी की स्थापना मार्च 2023 में Kai-Fu Lee द्वारा की गई, जो Microsoft Research Asia और Google China के पूर्व प्रमुख हैं, और इसका मुख्यालय बीजिंग में है। कंपनी का ध्यान डेटा गुणवत्ता और इंजीनियरिंग अवसंरचना अनुकूलन पर जोर देते हुए प्रभावी LLM के विकास पर है। नवंबर 2023 तक, Alibaba की भागीदारी के साथ एक फंडिंग राउंड के बाद, 01.AI ने «यूनिकॉर्न» का दर्जा हासिल कर लिया (1 अरब डॉलर से अधिक मूल्यांकन)।[4][5]

पहली पीढ़ी (2023–2024)

पहले खुले मॉडल Yi-6B और Yi-34B को 2 नवंबर 2023 को प्रस्तुत किया गया। अगले कुछ हफ्तों में इस श्रृंखला को 200 हज़ार token के संदर्भ वाले संस्करणों (5 नवंबर 2023), चैट संस्करणों और quantized मॉडलों (23 नवंबर 2023) के साथ विस्तारित किया गया। जनवरी 2024 में मल्टीमॉडल Yi-VL-6B और Yi-VL-34B जारी किए गए। मार्च 2024 में Yi-6B से depth upscaling विधि से प्राप्त Yi-9B मॉडल प्रस्तुत किया गया और तकनीकी रिपोर्ट arXiv:2403.04652 प्रकाशित की गई।[1][2]

Yi-1.5 और विशेष मॉडल (2024)

13 मई 2024 को Yi-1.5 श्रृंखला (6B/9B/34B) जारी की गई — यह अतिरिक्त 500 अरब token पर निरंतर pre-training और 30 लाख instruction उदाहरणों पर fine-tuning का परिणाम है। मई–जून 2024 में API-एक्सेस के साथ बंद स्रोत का प्रायोगिक Yi-Large मॉडल प्रस्तुत किया गया, जिसे SOTA के रूप में स्थापित किया गया। सितंबर 2024 में 128 हज़ार token के संदर्भ और 52 प्रोग्रामिंग भाषाओं के समर्थन के साथ कोड उत्पादन के लिए विशेष Yi-Coder श्रृंखला (1.5B/9B) जारी की गई।[1][6][7]

Yi-Lightning (2024)

अक्टूबर 2024 में Mixture-of-Experts (MoE) आर्किटेक्चर पर आधारित प्रमुख मॉडल Yi-Lightning प्रस्तुत किया गया, जो inference की गति और दक्षता के लिए अनुकूलित है। Yi-Lightning ने LMSYS Chatbot Arena की सामान्य रैंकिंग में 6वां स्थान (Elo 1287), चीनी भाषा में दूसरा स्थान और गणित तथा कोडिंग में 3–4वां स्थान प्राप्त किया। तकनीकी रिपोर्ट दिसंबर 2024 में प्रकाशित हुई (arXiv:2412.01253)।[8]

रणनीति में बदलाव (2025)

मार्च 2025 में 01.AI कंपनी ने नए बड़े भाषा मॉडलों के pre-training को बंद करने और कॉर्पोरेट अनुप्रयोगों, बहु-एजेंट प्रणालियों और तृतीय-पक्ष मॉडलों (DeepSeek सहित) पर आधारित WorldWise LLM Platform 2.5 पर ध्यान केंद्रित करने की घोषणा की।[4]

संक्षिप्त कालक्रम

तारीख घटना
नवंबर 2023 Yi-6B और Yi-34B का रिलीज़ (base, chat, 200K संस्करण)
जनवरी 2024 मल्टीमॉडल Yi-VL-6B और Yi-VL-34B
मार्च 2024 Yi-9B (depth-upscaled); तकनीकी रिपोर्ट arXiv:2403.04652 का प्रकाशन
मई 2024 Yi-1.5 (6B/9B/34B); Yi-Large (बंद स्रोत, API)
सितंबर 2024 Yi-Coder-1.5B/9B (कोड विशेषज्ञता, 128K संदर्भ)
अक्टूबर 2024 Yi-Lightning (MoE आर्किटेक्चर, प्रमुख मॉडल)
दिसंबर 2024 Yi-Lightning की तकनीकी रिपोर्ट का प्रकाशन (arXiv:2412.01253)
मार्च 2025 नए LLM के pre-training की समाप्ति; कॉर्पोरेट समाधानों पर ध्यान

सैद्धांतिक आधार और आर्किटेक्चर

मूल आर्किटेक्चर

Yi परिवार के सभी मॉडल decoder-only Transformer आर्किटेक्चर पर आधारित हैं, जो Vaswani et al. के कार्य में वर्णित है।[9] मॉडलों को शुरू से प्रशिक्षित किया गया है और कार्यान्वयन में समानता के बावजूद ये LLaMA से व्युत्पन्न नहीं हैं।[1]

बहु-शीर्ष स्व-ध्यान (Multi-Head Self-Attention) का मूल तंत्र निम्न सूत्र द्वारा वर्णित है:

Attention(Q,K,V)=softmax(QKdk)V

जहाँ Q, K, V — क्रमशः queries, keys और values के मैट्रिक्स हैं, dk — keys का आयाम है।[9]

Yi की प्रमुख आर्किटेक्चरल संशोधनाएँ:[1]

  • Grouped-Query Attention (GQA) — साझा key/value हेड्स के साथ query हेड्स को समूहों में विभाजित करना, जो गुणवत्ता बनाए रखते हुए मेमोरी उपयोग को कम करता है।
  • SwiGLU सक्रियण — मानक ReLU/GELU का प्रतिस्थापन; hidden size के 8/3 तक activation का आकार घटाता है।
  • Rotary Position Embedding (RoPE) अनुकूलित आधार आवृत्ति (adjusted base frequency, ABF) के साथ, जो आर्किटेक्चरल बदलावों के बिना संदर्भ विस्तार सुनिश्चित करता है।
  • शब्दकोश (vocabulary): BPE (SentencePiece) पर आधारित 64,000 token, संख्याओं को अंकों में विभाजन और दुर्लभ प्रतीकों के लिए unicode-byte fallback के साथ।

मूल मॉडलों की कॉन्फ़िगरेशन

tकनीकी रिपोर्ट arXiv:2403.04652 से आर्किटेक्चर पैरामीटर:[1]

पैरामीटर Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
परतों की संख्या 32 60
Pre-training अनुक्रम की लंबाई (Pretrain Seq. Len) 4096 4096
अधिकतम सीखने की दर (Max LR) 3×10⁻⁴ 1.5×10⁻⁴

स्रोत: arXiv:2403.04652, पैरामीटर तालिका।[1]

Yi-Lightning (MoE) आर्किटेक्चर

Yi-Lightning (2024) निम्नलिखित विशेषताओं के साथ उन्नत Mixture-of-Experts (MoE) आर्किटेक्चर का उपयोग करता है:[8]

  • Fine-grained expert segmentation — विशेषज्ञता बढ़ाने के लिए FFN ब्लॉकों का सूक्ष्म-दानेदार विभाजन।
  • बहु-स्तरीय लोड संतुलन — विशेषज्ञों के बीच token के समान वितरण के लिए Switch-Transformer (ST), Expert Parallel (EP) और Partitioned EP (PEP) losses का संयोजन।
  • हाइब्रिड ध्यान — स्लाइडिंग विंडो (sliding window) वाले 3 परतों और पूर्ण ध्यान (full attention) वाले 1 परत का एकांतर, परतों के बीच KV-cache का पुनः उपयोग।
  • KV-cache मेमोरी में कमी लंबे अनुक्रमों की प्रसंस्करण में मानक दृष्टिकोण की तुलना में 82.8% तक।
  • संदर्भ विंडो 64 हज़ार token तक विस्तारित।

सार्वजनिक स्रोतों में Yi-Lightning के विशेषज्ञों की सटीक संख्या और कुल पैरामीटर की संख्या प्रकट नहीं की गई है।[8]

मल्टीमॉडल संस्करण (Yi-VL)

मल्टीमॉडल मॉडलों Yi-VL में भाषा मॉडल को MLP-प्रोजेक्शन के माध्यम से CLIP ViT-H/14 विज़ुअल एनकोडर से जोड़ा जाता है। चित्र I को विज़ुअल एनकोडर द्वारा embedding अनुक्रम {v1,,vK} में परिवर्तित किया जाता है, जो पाठ token के साथ भाषा मॉडल में प्रवेश करते हैं। प्रशिक्षण रिज़ॉल्यूशन में वृद्धि के साथ तीन चरणों में होता है: 224×224 → 448×448 पिक्सेल।[1]

प्रशिक्षण पाइपलाइन और संरेखण

पूर्व-प्रशिक्षण (Pre-training)

Yi-6B और Yi-34B के मूल मॉडलों को 3.1 ट्रिलियन token के द्विभाषी कॉर्पस पर pre-trained किया गया है। डेटा एक क्रमिक फ़िल्टरिंग और deduplication पाइपलाइन से गुजरता है: अनुमानी फ़िल्टर, प्रशिक्षित scorer (perplexity, quality, coherence, safety), क्लस्टरिंग और MinHash deduplication। स्रोत — Common Crawl, पुस्तकें और वैज्ञानिक लेख।[1]

Yi-1.5 के लिए उच्च-गुणवत्ता कॉर्पस के अतिरिक्त 500 अरब token पर निरंतर pre-training (continued pre-training) किया गया।[7]

पर्यवेक्षित fine-tuning (Supervised Fine-Tuning, SFT)

पहली पीढ़ी के चैट संस्करणों को एक छोटे लेकिन सावधानीपूर्वक सत्यापित सेट पर fine-tuned किया गया — 10 हज़ार से कम बहु-चरण (multi-turn) उदाहरण, जिनमें से प्रत्येक को Machine Learning इंजीनियरों द्वारा मैन्युअल रूप से जाँचा और संपादित किया गया। Yi-1.5 के लिए SFT डेटा की मात्रा बढ़ाकर 30 लाख उदाहरण की गई।[1][7]

Reinforcement Learning के माध्यम से संरेखण

Yi-Lightning के लिए बहु-चरणीय संरेखण प्रक्रिया लागू की जाती है: SFT के बाद RLHF/DPO। Monte Carlo Tree Search (MCTS) का उपयोग करके synthetic डेटा उत्पन्न किया जाता है। सुरक्षा फ्रेमवर्क RAISE चार-स्तरीय सुरक्षा लागू करता है: pre-training डेटा फ़िल्टरिंग, safety fine-tuning, prompt का इनपुट नियंत्रण और उत्तरों का आउटपुट नियंत्रण।[8]

संदर्भ विस्तार

संदर्भ विंडो को 200 हज़ार token तक विस्तारित करना RoPE ABF तकनीक का उपयोग करके 5 अरब token (पुस्तकें + synthetic प्रश्न-उत्तर) पर हल्के निरंतर pre-training के माध्यम से कार्यान्वित किया गया है। परिष्करण के बाद Needle-in-a-Haystack कार्य (लंबे पाठ में लक्ष्य अंश की खोज) में सटीकता 99.8% तक पहुँचती है।[1][2]

गहन स्केलिंग (Depth Upscaling)

Yi-9B को Yi-6B मूल मॉडल की परत 12–28 को दोहराकर और फिर 800 अरब token पर pre-training करके प्राप्त किया गया। यह विधि शुरू से प्रशिक्षण के बिना मॉडल की क्षमता बढ़ाने की सुविधा देती है।[1]

मॉडल परिवार की संरचना

मुख्य भाषा मॉडल

मॉडल पैरामीटर प्रकार संदर्भ रिलीज़ तारीख लाइसेंस टिप्पणी
Yi-6B / Yi-34B 6 अरब / 34 अरब Base / Chat 4K (32K तक विस्तारित) नवंबर 2023 Apache 2.0 शुरू से प्रशिक्षित मूल मॉडल
Yi-6B-200K / Yi-34B-200K 6 अरब / 34 अरब Base 200K नवंबर 2023 Apache 2.0 लंबे अनुक्रमों पर निरंतर pre-training
Yi-9B 9 अरब Base 4K (200K तक विस्तारित) मार्च 2024 Apache 2.0 Yi-6B से Depth-upscale + 800 अरब token
Yi-1.5-6B/9B/34B 6 / 9 / 34 अरब Base / Chat 4K / 16K / 32K मई 2024 Apache 2.0 +500 अरब token + 30 लाख SFT उदाहरण
Yi-Large ~1 ट्रिलियन (MoE, सक्रिय पैरामीटर प्रकट नहीं) LLM प्रकट नहीं मई 2024 बंद स्रोत (API) SOTA के रूप में स्थापित
Yi-Lightning MoE (विशेषज्ञों की संख्या प्रकट नहीं) LLM 64K अक्टूबर 2024 API LMSYS Chatbot Arena में 6वां स्थान

स्रोत: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi।[1][8][2]

विशेष मॉडल

मॉडल पैरामीटर मोडैलिटी संदर्भ रिलीज़ तारीख टिप्पणी
Yi-VL-6B / Yi-VL-34B 6 / 34 अरब पाठ + चित्र (448×448) मूल मॉडल का मानक जनवरी 2024 ViT एनकोडर (CLIP ViT-H/14), तीन-चरणीय प्रशिक्षण
Yi-Coder-1.5B / Yi-Coder-9B 1.5 / 9 अरब पाठ (कोड) 128K सितंबर 2024 52 प्रोग्रामिंग भाषाएँ

स्रोत: arXiv:2403.04652; GitHub 01-ai/Yi।[1][2]

API पहचानकर्ता

01.AI और तृतीय-पक्ष प्रदाताओं के प्लेटफ़ॉर्म पर उदाहरण: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate)।[6][10][11]

मूल्यांकन और benchmark

मूल मॉडलों के परिणाम

tकनीकी रिपोर्ट arXiv:2403.04652 के डेटा (शर्तें: 0-shot / 5-shot, benchmark के अनुसार):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63.2 76.3 62.6 69.7 66.7
BBH 42.8 54.3 44.1 53.4
C-Eval 72.0 81.4 50.1 72.1 70.1
CMMLU 75.5 83.7 53.3 71.0 52.5
GSM8K 32.5 67.2 42.2 56.8 61.3 57.1
HumanEval 15.9 23.2 22.6 31.7 32.3 48.1

स्रोत: arXiv:2403.04652, परिणाम तालिकाएँ।[1]

Yi-34B ने अधिकांश benchmark पर Llama 2-70B से बेहतर परिणाम दिखाए (आधे आकार के बावजूद) और रिलीज़ के समय C-Eval और CMMLU पर खुले मॉडलों में अग्रणी रहा।[1][12]

Yi-Lightning के परिणाम

tकनीकी रिपोर्ट arXiv:2412.01253 के डेटा (शर्तें: 0-shot, जहाँ अन्यथा न बताया हो):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50.9 49.1 45.1
MATH 76.4 82.7 67.1
HumanEval 83.5 86.0 76.2
WildBench 65.1 59.9 49.0
Arena-Hard 91.8 90.5 74.0

स्रोत: arXiv:2412.01253।[8]

उपयोगकर्ता रेटिंग

Yi-34B-Chat ने दिसंबर 2023 – जनवरी 2024 में AlpacaEval पर दूसरा स्थान (94.08%, GPT-4 Turbo के बाद) और LMSYS Chatbot Arena पर Elo ~1110 रेटिंग हासिल की। Yi-34B ने रिलीज़ के समय Hugging Face Open LLM Leaderboard और C-Eval पर खुले मॉडलों में अग्रणी स्थान प्राप्त किया।[2][1]

Yi-Lightning ने LMSYS Chatbot Arena पर सामान्य 6वां स्थान (score 1287), चीनी भाषा में दूसरा स्थान और रिपोर्ट प्रकाशन के समय «गणित», «कोडिंग», «hard prompts» और «multi-turn» उपश्रेणियों में 3–4वां स्थान प्राप्त किया।[8]

टिप्पणी। विभिन्न रिलीज़ और कॉन्फ़िगरेशन के मॉडलों की प्रत्यक्ष तुलना के लिए एकसमान परीक्षण शर्तों (समान benchmark संस्करण, समान generation पैरामीटर) की आवश्यकता है। क्राउडसोर्सिंग प्लेटफ़ॉर्म पर व्यक्तिपरक मूल्यांकन प्रतिभागियों की संरचना और प्रणाली में मॉडलों के वर्तमान सेट पर निर्भर करते हैं।[12]

अनुप्रयोग

Yi परिवार प्राकृतिक भाषा प्रसंस्करण और मल्टीमॉडल विश्लेषण के कार्यों की विस्तृत श्रृंखला में उपयोग किया जाता है:[3][13]

  • चैट सहायक और संवादात्मक प्रणालियाँ — Yi-34B-Chat और Yi-1.5 के चैट संस्करणों के आधार पर।
  • कोड उत्पादन और विश्लेषण — Yi-Coder 52 प्रोग्रामिंग भाषाओं का समर्थन करता है।
  • लंबे दस्तावेज़ों का विश्लेषण — कानूनी, तकनीकी और विश्लेषणात्मक कार्यों के लिए 200K संदर्भ वाले संस्करण।
  • मल्टीमॉडल विश्लेषण — Yi-VL के माध्यम से चित्रों का विवरण और दृश्य प्रश्न-उत्तर।
  • कॉर्पोरेट एजेंट — 01.AI प्लेटफ़ॉर्म के माध्यम से RAG-प्रणालियाँ, ज्ञान खोज और डेटा वर्गीकरण।
  • स्थानीय तैनाती — vLLM, llama.cpp, Hugging Face Transformers के माध्यम से; quantized संस्करण (AWQ/GPTQ 4/8-bit) उपभोक्ता GPU पर तैनाती के लिए उपलब्ध हैं (उदाहरण के लिए, Yi-34B-4bit के लिए RTX 4090)।

API संस्करण (Yi-Large, Yi-Lightning) चैटबॉट, बहुभाषी सेवाओं और low-cost inference के लिए उपयोग किए जाते हैं। 2024 तक Yi-Lightning के inference की लागत प्रति दस लाख token 14 सेंट थी।[8]

सीमाएँ और खुली समस्याएँ

  • भ्रम (Hallucinations)। मॉडल LLM के लिए सामान्य तथ्यात्मक त्रुटियों के प्रति संवेदनशील हैं, विशेष रूप से जटिल तर्क और लंबी inference श्रृंखलाओं में।[1]
  • प्रारंभिक संस्करणों में गणित और कोड। Yi-34B के मूल मॉडल जटिल कोडिंग और गणित में विशेष frontier मॉडलों (उदाहरण के लिए, 4-shot में Yi-34B का MATH — 14.4) की तुलना में कमज़ोर परिणाम दिखाते हैं। यह समस्या Yi-1.5 और Yi-Lightning में आंशिक रूप से हल हुई है।[1][8]
  • लंबा संदर्भ। 200K तक विस्तार के लिए अतिरिक्त pre-training और कंप्यूटिंग संसाधनों की आवश्यकता होती है; छोटे संदर्भ पर प्रदर्शन में मामूली गिरावट संभव है।[1]
  • बंद स्रोत के मॉडल। Yi-Large और Yi-Lightning डाउनलोड के लिए weights प्रदान नहीं करते, जो आर्किटेक्चर और डेटा के स्वतंत्र सत्यापन को सीमित करता है।[8]
  • Arena और benchmark के बीच अंतर। Yi-Lightning उपयोगकर्ता मूल्यांकन (Chatbot Arena) में मजबूत परिणाम दिखाता है, लेकिन स्थैतिक शैक्षणिक benchmark पर कुछ प्रतिस्पर्धियों से पीछे है — यह मेट्रिक्स के बेमेल की सामान्य समस्या का प्रतिबिंब है।[8]
  • पुनरुत्पादनीयता। प्रशिक्षण के सभी विवरण (dataset की सटीक संरचना, domain वितरण, hyperparameter) पूरी तरह प्रकट नहीं किए गए हैं।[13]
  • Prompt के प्रति संवेदनशीलता। अन्य LLM की तरह, Yi मॉडल prompt की शब्दावली के प्रति संवेदनशील हैं, जो निष्कर्षों की स्थिरता को प्रभावित करता है।[1]

रिलीज़ के बाद कोई ज्ञात गंभीर प्रतिगमन दर्ज नहीं किया गया है; समुदाय quantized संस्करणों की स्थिरता को स्वीकार करता है।[2]

नैतिक और नियामक पहलू

Yi-Lightning में सुरक्षा फ्रेमवर्क RAISE लागू किया गया है, जो चार-स्तरीय सुरक्षा कार्यान्वित करता है:[8]

  • Pre-training चरण में विषाक्त सामग्री, PII और हानिकारक सामग्री का फ़िल्टरिंग।
  • संवेदनशील अनुरोधों के सही प्रबंधन के उदाहरणों के साथ Safety fine-tuning।
  • इनपुट नियंत्रण (prompt वर्गीकरण)।
  • आउटपुट नियंत्रण (उत्तरों का फ़िल्टरिंग)।

खुले मॉडलों के लिए Apache 2.0 लाइसेंस व्यावसायिक उपयोग की अनुमति देता है; अलग-अलग होस्टिंग सेवाएँ अतिरिक्त आवश्यकताएँ लगा सकती हैं। मॉडल कॉर्पोरेट समाधानों के लिए CAICT प्रमाणीकरण के साथ कृत्रिम बुद्धिमत्ता के क्षेत्र में चीनी नियामक मानकों का अनुपालन करते हैं।[1][3]

संभावनाएँ और अनुसंधान की दिशाएँ

Yi श्रृंखला उस दृष्टिकोण की प्रभावशीलता दर्शाती है जो पैरामीटर की मात्रा से अधिक डेटा गुणवत्ता को प्राथमिकता देती है, साथ ही हल्की स्केलिंग (continual pretraining, depth upscaling, MoE अनुकूलन) को भी।[1]

2025 के बाद 01.AI का जोर व्यावहारिक समाधानों पर स्थानांतरित हो गया है:[4]

  • बहु-एजेंट प्रणालियाँ और enterprise-प्लेटफ़ॉर्म WorldWise LLM Platform 2.5।
  • कॉर्पोरेट workflow में तृतीय-पक्ष मॉडलों (DeepSeek सहित) का एकीकरण।
  • तैनाती की लागत कम करने के लिए inference अनुकूलन (quantization, FP8)।

खुले मॉडल अनुसंधान, fine-tuning और distillation के लिए समुदाय द्वारा उपयोग किए जाते रहते हैं।[6]

साहित्य

लिंक

टिप्पणियाँ

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms