Yi (01.AI) (HI)
Yi — बड़े भाषा मॉडलों (Large Language Model, LLM) और दृश्य-भाषा मॉडलों (Vision-Language Model, VLM) का एक परिवार है, जिसे Kai-Fu Lee के नेतृत्व में 01.AI (零一万物) कंपनी द्वारा विकसित किया गया है। इन मॉडलों को 3.1 ट्रिलियन token के उच्च-गुणवत्ता वाले द्विभाषी कॉर्पस (अंग्रेज़ी और चीनी भाषा) पर शुरू से प्रशिक्षित किया गया है और इनमें पाठ उत्पादन, लंबे संदर्भ की प्रसंस्करण (200 हज़ार token तक), मल्टीमॉडल इनपुट (पाठ + चित्र), कोड उत्पादन और Mixture-of-Experts (MoE) आर्किटेक्चर पर आधारित प्रभावी inference के लिए संस्करण शामिल हैं। खुले संस्करण Apache 2.0 लाइसेंस के तहत व्यावसायिक उपयोग की अनुमति के साथ वितरित किए जाते हैं; बंद स्रोत के प्रमुख मॉडल (Yi-Large, Yi-Lightning) API के माध्यम से उपलब्ध हैं।[1][2][3]
इतिहास और विकास की कालक्रम
01.AI कंपनी की स्थापना मार्च 2023 में Kai-Fu Lee द्वारा की गई, जो Microsoft Research Asia और Google China के पूर्व प्रमुख हैं, और इसका मुख्यालय बीजिंग में है। कंपनी का ध्यान डेटा गुणवत्ता और इंजीनियरिंग अवसंरचना अनुकूलन पर जोर देते हुए प्रभावी LLM के विकास पर है। नवंबर 2023 तक, Alibaba की भागीदारी के साथ एक फंडिंग राउंड के बाद, 01.AI ने «यूनिकॉर्न» का दर्जा हासिल कर लिया (1 अरब डॉलर से अधिक मूल्यांकन)।[4][5]
पहली पीढ़ी (2023–2024)
पहले खुले मॉडल Yi-6B और Yi-34B को 2 नवंबर 2023 को प्रस्तुत किया गया। अगले कुछ हफ्तों में इस श्रृंखला को 200 हज़ार token के संदर्भ वाले संस्करणों (5 नवंबर 2023), चैट संस्करणों और quantized मॉडलों (23 नवंबर 2023) के साथ विस्तारित किया गया। जनवरी 2024 में मल्टीमॉडल Yi-VL-6B और Yi-VL-34B जारी किए गए। मार्च 2024 में Yi-6B से depth upscaling विधि से प्राप्त Yi-9B मॉडल प्रस्तुत किया गया और तकनीकी रिपोर्ट arXiv:2403.04652 प्रकाशित की गई।[1][2]
Yi-1.5 और विशेष मॉडल (2024)
13 मई 2024 को Yi-1.5 श्रृंखला (6B/9B/34B) जारी की गई — यह अतिरिक्त 500 अरब token पर निरंतर pre-training और 30 लाख instruction उदाहरणों पर fine-tuning का परिणाम है। मई–जून 2024 में API-एक्सेस के साथ बंद स्रोत का प्रायोगिक Yi-Large मॉडल प्रस्तुत किया गया, जिसे SOTA के रूप में स्थापित किया गया। सितंबर 2024 में 128 हज़ार token के संदर्भ और 52 प्रोग्रामिंग भाषाओं के समर्थन के साथ कोड उत्पादन के लिए विशेष Yi-Coder श्रृंखला (1.5B/9B) जारी की गई।[1][6][7]
Yi-Lightning (2024)
अक्टूबर 2024 में Mixture-of-Experts (MoE) आर्किटेक्चर पर आधारित प्रमुख मॉडल Yi-Lightning प्रस्तुत किया गया, जो inference की गति और दक्षता के लिए अनुकूलित है। Yi-Lightning ने LMSYS Chatbot Arena की सामान्य रैंकिंग में 6वां स्थान (Elo 1287), चीनी भाषा में दूसरा स्थान और गणित तथा कोडिंग में 3–4वां स्थान प्राप्त किया। तकनीकी रिपोर्ट दिसंबर 2024 में प्रकाशित हुई (arXiv:2412.01253)।[8]
रणनीति में बदलाव (2025)
मार्च 2025 में 01.AI कंपनी ने नए बड़े भाषा मॉडलों के pre-training को बंद करने और कॉर्पोरेट अनुप्रयोगों, बहु-एजेंट प्रणालियों और तृतीय-पक्ष मॉडलों (DeepSeek सहित) पर आधारित WorldWise LLM Platform 2.5 पर ध्यान केंद्रित करने की घोषणा की।[4]
संक्षिप्त कालक्रम
| तारीख | घटना |
|---|---|
| नवंबर 2023 | Yi-6B और Yi-34B का रिलीज़ (base, chat, 200K संस्करण) |
| जनवरी 2024 | मल्टीमॉडल Yi-VL-6B और Yi-VL-34B |
| मार्च 2024 | Yi-9B (depth-upscaled); तकनीकी रिपोर्ट arXiv:2403.04652 का प्रकाशन |
| मई 2024 | Yi-1.5 (6B/9B/34B); Yi-Large (बंद स्रोत, API) |
| सितंबर 2024 | Yi-Coder-1.5B/9B (कोड विशेषज्ञता, 128K संदर्भ) |
| अक्टूबर 2024 | Yi-Lightning (MoE आर्किटेक्चर, प्रमुख मॉडल) |
| दिसंबर 2024 | Yi-Lightning की तकनीकी रिपोर्ट का प्रकाशन (arXiv:2412.01253) |
| मार्च 2025 | नए LLM के pre-training की समाप्ति; कॉर्पोरेट समाधानों पर ध्यान |
सैद्धांतिक आधार और आर्किटेक्चर
मूल आर्किटेक्चर
Yi परिवार के सभी मॉडल decoder-only Transformer आर्किटेक्चर पर आधारित हैं, जो Vaswani et al. के कार्य में वर्णित है।[9] मॉडलों को शुरू से प्रशिक्षित किया गया है और कार्यान्वयन में समानता के बावजूद ये LLaMA से व्युत्पन्न नहीं हैं।[1]
बहु-शीर्ष स्व-ध्यान (Multi-Head Self-Attention) का मूल तंत्र निम्न सूत्र द्वारा वर्णित है:
जहाँ , , — क्रमशः queries, keys और values के मैट्रिक्स हैं, — keys का आयाम है।[9]
Yi की प्रमुख आर्किटेक्चरल संशोधनाएँ:[1]
- Grouped-Query Attention (GQA) — साझा key/value हेड्स के साथ query हेड्स को समूहों में विभाजित करना, जो गुणवत्ता बनाए रखते हुए मेमोरी उपयोग को कम करता है।
- SwiGLU सक्रियण — मानक ReLU/GELU का प्रतिस्थापन; hidden size के 8/3 तक activation का आकार घटाता है।
- Rotary Position Embedding (RoPE) अनुकूलित आधार आवृत्ति (adjusted base frequency, ABF) के साथ, जो आर्किटेक्चरल बदलावों के बिना संदर्भ विस्तार सुनिश्चित करता है।
- शब्दकोश (vocabulary): BPE (SentencePiece) पर आधारित 64,000 token, संख्याओं को अंकों में विभाजन और दुर्लभ प्रतीकों के लिए unicode-byte fallback के साथ।
मूल मॉडलों की कॉन्फ़िगरेशन
tकनीकी रिपोर्ट arXiv:2403.04652 से आर्किटेक्चर पैरामीटर:[1]
| पैरामीटर | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| परतों की संख्या | 32 | 60 |
| Pre-training अनुक्रम की लंबाई (Pretrain Seq. Len) | 4096 | 4096 |
| अधिकतम सीखने की दर (Max LR) | 3×10⁻⁴ | 1.5×10⁻⁴ |
स्रोत: arXiv:2403.04652, पैरामीटर तालिका।[1]
Yi-Lightning (MoE) आर्किटेक्चर
Yi-Lightning (2024) निम्नलिखित विशेषताओं के साथ उन्नत Mixture-of-Experts (MoE) आर्किटेक्चर का उपयोग करता है:[8]
- Fine-grained expert segmentation — विशेषज्ञता बढ़ाने के लिए FFN ब्लॉकों का सूक्ष्म-दानेदार विभाजन।
- बहु-स्तरीय लोड संतुलन — विशेषज्ञों के बीच token के समान वितरण के लिए Switch-Transformer (ST), Expert Parallel (EP) और Partitioned EP (PEP) losses का संयोजन।
- हाइब्रिड ध्यान — स्लाइडिंग विंडो (sliding window) वाले 3 परतों और पूर्ण ध्यान (full attention) वाले 1 परत का एकांतर, परतों के बीच KV-cache का पुनः उपयोग।
- KV-cache मेमोरी में कमी लंबे अनुक्रमों की प्रसंस्करण में मानक दृष्टिकोण की तुलना में 82.8% तक।
- संदर्भ विंडो 64 हज़ार token तक विस्तारित।
सार्वजनिक स्रोतों में Yi-Lightning के विशेषज्ञों की सटीक संख्या और कुल पैरामीटर की संख्या प्रकट नहीं की गई है।[8]
मल्टीमॉडल संस्करण (Yi-VL)
मल्टीमॉडल मॉडलों Yi-VL में भाषा मॉडल को MLP-प्रोजेक्शन के माध्यम से CLIP ViT-H/14 विज़ुअल एनकोडर से जोड़ा जाता है। चित्र को विज़ुअल एनकोडर द्वारा embedding अनुक्रम में परिवर्तित किया जाता है, जो पाठ token के साथ भाषा मॉडल में प्रवेश करते हैं। प्रशिक्षण रिज़ॉल्यूशन में वृद्धि के साथ तीन चरणों में होता है: 224×224 → 448×448 पिक्सेल।[1]
प्रशिक्षण पाइपलाइन और संरेखण
पूर्व-प्रशिक्षण (Pre-training)
Yi-6B और Yi-34B के मूल मॉडलों को 3.1 ट्रिलियन token के द्विभाषी कॉर्पस पर pre-trained किया गया है। डेटा एक क्रमिक फ़िल्टरिंग और deduplication पाइपलाइन से गुजरता है: अनुमानी फ़िल्टर, प्रशिक्षित scorer (perplexity, quality, coherence, safety), क्लस्टरिंग और MinHash deduplication। स्रोत — Common Crawl, पुस्तकें और वैज्ञानिक लेख।[1]
Yi-1.5 के लिए उच्च-गुणवत्ता कॉर्पस के अतिरिक्त 500 अरब token पर निरंतर pre-training (continued pre-training) किया गया।[7]
पर्यवेक्षित fine-tuning (Supervised Fine-Tuning, SFT)
पहली पीढ़ी के चैट संस्करणों को एक छोटे लेकिन सावधानीपूर्वक सत्यापित सेट पर fine-tuned किया गया — 10 हज़ार से कम बहु-चरण (multi-turn) उदाहरण, जिनमें से प्रत्येक को Machine Learning इंजीनियरों द्वारा मैन्युअल रूप से जाँचा और संपादित किया गया। Yi-1.5 के लिए SFT डेटा की मात्रा बढ़ाकर 30 लाख उदाहरण की गई।[1][7]
Reinforcement Learning के माध्यम से संरेखण
Yi-Lightning के लिए बहु-चरणीय संरेखण प्रक्रिया लागू की जाती है: SFT के बाद RLHF/DPO। Monte Carlo Tree Search (MCTS) का उपयोग करके synthetic डेटा उत्पन्न किया जाता है। सुरक्षा फ्रेमवर्क RAISE चार-स्तरीय सुरक्षा लागू करता है: pre-training डेटा फ़िल्टरिंग, safety fine-tuning, prompt का इनपुट नियंत्रण और उत्तरों का आउटपुट नियंत्रण।[8]
संदर्भ विस्तार
संदर्भ विंडो को 200 हज़ार token तक विस्तारित करना RoPE ABF तकनीक का उपयोग करके 5 अरब token (पुस्तकें + synthetic प्रश्न-उत्तर) पर हल्के निरंतर pre-training के माध्यम से कार्यान्वित किया गया है। परिष्करण के बाद Needle-in-a-Haystack कार्य (लंबे पाठ में लक्ष्य अंश की खोज) में सटीकता 99.8% तक पहुँचती है।[1][2]
गहन स्केलिंग (Depth Upscaling)
Yi-9B को Yi-6B मूल मॉडल की परत 12–28 को दोहराकर और फिर 800 अरब token पर pre-training करके प्राप्त किया गया। यह विधि शुरू से प्रशिक्षण के बिना मॉडल की क्षमता बढ़ाने की सुविधा देती है।[1]
मॉडल परिवार की संरचना
मुख्य भाषा मॉडल
| मॉडल | पैरामीटर | प्रकार | संदर्भ | रिलीज़ तारीख | लाइसेंस | टिप्पणी |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | 6 अरब / 34 अरब | Base / Chat | 4K (32K तक विस्तारित) | नवंबर 2023 | Apache 2.0 | शुरू से प्रशिक्षित मूल मॉडल |
| Yi-6B-200K / Yi-34B-200K | 6 अरब / 34 अरब | Base | 200K | नवंबर 2023 | Apache 2.0 | लंबे अनुक्रमों पर निरंतर pre-training |
| Yi-9B | 9 अरब | Base | 4K (200K तक विस्तारित) | मार्च 2024 | Apache 2.0 | Yi-6B से Depth-upscale + 800 अरब token |
| Yi-1.5-6B/9B/34B | 6 / 9 / 34 अरब | Base / Chat | 4K / 16K / 32K | मई 2024 | Apache 2.0 | +500 अरब token + 30 लाख SFT उदाहरण |
| Yi-Large | ~1 ट्रिलियन (MoE, सक्रिय पैरामीटर प्रकट नहीं) | LLM | प्रकट नहीं | मई 2024 | बंद स्रोत (API) | SOTA के रूप में स्थापित |
| Yi-Lightning | MoE (विशेषज्ञों की संख्या प्रकट नहीं) | LLM | 64K | अक्टूबर 2024 | API | LMSYS Chatbot Arena में 6वां स्थान |
स्रोत: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi।[1][8][2]
विशेष मॉडल
| मॉडल | पैरामीटर | मोडैलिटी | संदर्भ | रिलीज़ तारीख | टिप्पणी |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | 6 / 34 अरब | पाठ + चित्र (448×448) | मूल मॉडल का मानक | जनवरी 2024 | ViT एनकोडर (CLIP ViT-H/14), तीन-चरणीय प्रशिक्षण |
| Yi-Coder-1.5B / Yi-Coder-9B | 1.5 / 9 अरब | पाठ (कोड) | 128K | सितंबर 2024 | 52 प्रोग्रामिंग भाषाएँ |
स्रोत: arXiv:2403.04652; GitHub 01-ai/Yi।[1][2]
API पहचानकर्ता
01.AI और तृतीय-पक्ष प्रदाताओं के प्लेटफ़ॉर्म पर उदाहरण: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate)।[6][10][11]
मूल्यांकन और benchmark
मूल मॉडलों के परिणाम
tकनीकी रिपोर्ट arXiv:2403.04652 के डेटा (शर्तें: 0-shot / 5-shot, benchmark के अनुसार):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63.2 | 76.3 | 62.6 | 69.7 | 66.7 | — |
| BBH | 42.8 | 54.3 | 44.1 | — | 53.4 | — |
| C-Eval | 72.0 | 81.4 | — | 50.1 | 72.1 | 70.1 |
| CMMLU | 75.5 | 83.7 | — | 53.3 | 71.0 | 52.5 |
| GSM8K | 32.5 | 67.2 | 42.2 | 56.8 | 61.3 | 57.1 |
| HumanEval | 15.9 | 23.2 | 22.6 | 31.7 | 32.3 | 48.1 |
स्रोत: arXiv:2403.04652, परिणाम तालिकाएँ।[1]
Yi-34B ने अधिकांश benchmark पर Llama 2-70B से बेहतर परिणाम दिखाए (आधे आकार के बावजूद) और रिलीज़ के समय C-Eval और CMMLU पर खुले मॉडलों में अग्रणी रहा।[1][12]
Yi-Lightning के परिणाम
tकनीकी रिपोर्ट arXiv:2412.01253 के डेटा (शर्तें: 0-shot, जहाँ अन्यथा न बताया हो):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50.9 | 49.1 | 45.1 |
| MATH | 76.4 | 82.7 | 67.1 |
| HumanEval | 83.5 | 86.0 | 76.2 |
| WildBench | 65.1 | 59.9 | 49.0 |
| Arena-Hard | 91.8 | 90.5 | 74.0 |
स्रोत: arXiv:2412.01253।[8]
उपयोगकर्ता रेटिंग
Yi-34B-Chat ने दिसंबर 2023 – जनवरी 2024 में AlpacaEval पर दूसरा स्थान (94.08%, GPT-4 Turbo के बाद) और LMSYS Chatbot Arena पर Elo ~1110 रेटिंग हासिल की। Yi-34B ने रिलीज़ के समय Hugging Face Open LLM Leaderboard और C-Eval पर खुले मॉडलों में अग्रणी स्थान प्राप्त किया।[2][1]
Yi-Lightning ने LMSYS Chatbot Arena पर सामान्य 6वां स्थान (score 1287), चीनी भाषा में दूसरा स्थान और रिपोर्ट प्रकाशन के समय «गणित», «कोडिंग», «hard prompts» और «multi-turn» उपश्रेणियों में 3–4वां स्थान प्राप्त किया।[8]
टिप्पणी। विभिन्न रिलीज़ और कॉन्फ़िगरेशन के मॉडलों की प्रत्यक्ष तुलना के लिए एकसमान परीक्षण शर्तों (समान benchmark संस्करण, समान generation पैरामीटर) की आवश्यकता है। क्राउडसोर्सिंग प्लेटफ़ॉर्म पर व्यक्तिपरक मूल्यांकन प्रतिभागियों की संरचना और प्रणाली में मॉडलों के वर्तमान सेट पर निर्भर करते हैं।[12]
अनुप्रयोग
Yi परिवार प्राकृतिक भाषा प्रसंस्करण और मल्टीमॉडल विश्लेषण के कार्यों की विस्तृत श्रृंखला में उपयोग किया जाता है:[3][13]
- चैट सहायक और संवादात्मक प्रणालियाँ — Yi-34B-Chat और Yi-1.5 के चैट संस्करणों के आधार पर।
- कोड उत्पादन और विश्लेषण — Yi-Coder 52 प्रोग्रामिंग भाषाओं का समर्थन करता है।
- लंबे दस्तावेज़ों का विश्लेषण — कानूनी, तकनीकी और विश्लेषणात्मक कार्यों के लिए 200K संदर्भ वाले संस्करण।
- मल्टीमॉडल विश्लेषण — Yi-VL के माध्यम से चित्रों का विवरण और दृश्य प्रश्न-उत्तर।
- कॉर्पोरेट एजेंट — 01.AI प्लेटफ़ॉर्म के माध्यम से RAG-प्रणालियाँ, ज्ञान खोज और डेटा वर्गीकरण।
- स्थानीय तैनाती — vLLM, llama.cpp, Hugging Face Transformers के माध्यम से; quantized संस्करण (AWQ/GPTQ 4/8-bit) उपभोक्ता GPU पर तैनाती के लिए उपलब्ध हैं (उदाहरण के लिए, Yi-34B-4bit के लिए RTX 4090)।
API संस्करण (Yi-Large, Yi-Lightning) चैटबॉट, बहुभाषी सेवाओं और low-cost inference के लिए उपयोग किए जाते हैं। 2024 तक Yi-Lightning के inference की लागत प्रति दस लाख token 14 सेंट थी।[8]
सीमाएँ और खुली समस्याएँ
- भ्रम (Hallucinations)। मॉडल LLM के लिए सामान्य तथ्यात्मक त्रुटियों के प्रति संवेदनशील हैं, विशेष रूप से जटिल तर्क और लंबी inference श्रृंखलाओं में।[1]
- प्रारंभिक संस्करणों में गणित और कोड। Yi-34B के मूल मॉडल जटिल कोडिंग और गणित में विशेष frontier मॉडलों (उदाहरण के लिए, 4-shot में Yi-34B का MATH — 14.4) की तुलना में कमज़ोर परिणाम दिखाते हैं। यह समस्या Yi-1.5 और Yi-Lightning में आंशिक रूप से हल हुई है।[1][8]
- लंबा संदर्भ। 200K तक विस्तार के लिए अतिरिक्त pre-training और कंप्यूटिंग संसाधनों की आवश्यकता होती है; छोटे संदर्भ पर प्रदर्शन में मामूली गिरावट संभव है।[1]
- बंद स्रोत के मॉडल। Yi-Large और Yi-Lightning डाउनलोड के लिए weights प्रदान नहीं करते, जो आर्किटेक्चर और डेटा के स्वतंत्र सत्यापन को सीमित करता है।[8]
- Arena और benchmark के बीच अंतर। Yi-Lightning उपयोगकर्ता मूल्यांकन (Chatbot Arena) में मजबूत परिणाम दिखाता है, लेकिन स्थैतिक शैक्षणिक benchmark पर कुछ प्रतिस्पर्धियों से पीछे है — यह मेट्रिक्स के बेमेल की सामान्य समस्या का प्रतिबिंब है।[8]
- पुनरुत्पादनीयता। प्रशिक्षण के सभी विवरण (dataset की सटीक संरचना, domain वितरण, hyperparameter) पूरी तरह प्रकट नहीं किए गए हैं।[13]
- Prompt के प्रति संवेदनशीलता। अन्य LLM की तरह, Yi मॉडल prompt की शब्दावली के प्रति संवेदनशील हैं, जो निष्कर्षों की स्थिरता को प्रभावित करता है।[1]
रिलीज़ के बाद कोई ज्ञात गंभीर प्रतिगमन दर्ज नहीं किया गया है; समुदाय quantized संस्करणों की स्थिरता को स्वीकार करता है।[2]
नैतिक और नियामक पहलू
Yi-Lightning में सुरक्षा फ्रेमवर्क RAISE लागू किया गया है, जो चार-स्तरीय सुरक्षा कार्यान्वित करता है:[8]
- Pre-training चरण में विषाक्त सामग्री, PII और हानिकारक सामग्री का फ़िल्टरिंग।
- संवेदनशील अनुरोधों के सही प्रबंधन के उदाहरणों के साथ Safety fine-tuning।
- इनपुट नियंत्रण (prompt वर्गीकरण)।
- आउटपुट नियंत्रण (उत्तरों का फ़िल्टरिंग)।
खुले मॉडलों के लिए Apache 2.0 लाइसेंस व्यावसायिक उपयोग की अनुमति देता है; अलग-अलग होस्टिंग सेवाएँ अतिरिक्त आवश्यकताएँ लगा सकती हैं। मॉडल कॉर्पोरेट समाधानों के लिए CAICT प्रमाणीकरण के साथ कृत्रिम बुद्धिमत्ता के क्षेत्र में चीनी नियामक मानकों का अनुपालन करते हैं।[1][3]
संभावनाएँ और अनुसंधान की दिशाएँ
Yi श्रृंखला उस दृष्टिकोण की प्रभावशीलता दर्शाती है जो पैरामीटर की मात्रा से अधिक डेटा गुणवत्ता को प्राथमिकता देती है, साथ ही हल्की स्केलिंग (continual pretraining, depth upscaling, MoE अनुकूलन) को भी।[1]
2025 के बाद 01.AI का जोर व्यावहारिक समाधानों पर स्थानांतरित हो गया है:[4]
- बहु-एजेंट प्रणालियाँ और enterprise-प्लेटफ़ॉर्म WorldWise LLM Platform 2.5।
- कॉर्पोरेट workflow में तृतीय-पक्ष मॉडलों (DeepSeek सहित) का एकीकरण।
- तैनाती की लागत कम करने के लिए inference अनुकूलन (quantization, FP8)।
खुले मॉडल अनुसंधान, fine-tuning और distillation के लिए समुदाय द्वारा उपयोग किए जाते रहते हैं।[6]
साहित्य
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
लिंक
- https://github.com/01-ai/Yi — Yi का आधिकारिक GitHub रिपॉज़िटरी
- https://github.com/01-ai/Yi-1.5 — Yi-1.5 रिपॉज़िटरी
- https://www.01.ai/yi-models — Yi मॉडलों का आधिकारिक पृष्ठ
- https://huggingface.co/01-ai — Hugging Face पर 01-ai संगठन
- https://en.wikipedia.org/wiki/01.AI — 01.AI कंपनी के बारे में Wikipedia लेख
टिप्पणियाँ
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms