Yi (01.AI) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — بڑے زبانی ماڈلز (Large Language Model, LLM) اور بصری-زبانی ماڈلز (Vision-Language Model, VLM) کا ایک خاندان ہے، جسے کمپنی 01.AI (零一万物) نے کائی-فو لی (Kai-Fu Lee) کی قیادت میں تیار کیا ہے۔ یہ ماڈلز انگریزی اور چینی زبانوں پر مشتمل 3.1 ٹریلین token کے اعلیٰ معیار کے دو لسانی corpus پر شروع سے تربیت یافتہ ہیں اور ان میں متن کی تخلیق، طویل context کی پروسیسنگ (200 ہزار token تک)، کثیر الوسائط اِن پٹ (متن + تصاویر)، کوڈ تخلیق اور Mixture-of-Experts (MoE) فن تعمیر پر مبنی مؤثر inference کے لیے مختلف نسخے شامل ہیں۔ کھلے نسخے Apache 2.0 لائسنس کے تحت تجارتی استعمال کی اجازت کے ساتھ دستیاب ہیں؛ بند فلیگ شِپ ماڈلز (Yi-Large، Yi-Lightning) API کے ذریعے قابلِ رسائی ہیں۔[1][2][3]

تاریخ اور ترقی کا سلسلہ

کمپنی 01.AI مارچ 2023 میں کائی-فو لی نے قائم کی، جو Microsoft Research Asia اور Google China کے سابق سربراہ ہیں، اور اس کا ہیڈ کوارٹر بیجنگ میں ہے۔ کمپنی کا مرکزِ توجہ ڈیٹا کے معیار اور انفراسٹرکچر کی انجینئرنگ اصلاح پر زور دیتے ہوئے مؤثر LLM کی تیاری ہے۔ نومبر 2023 تک Alibaba کی شرکت کے ساتھ فنڈنگ راؤنڈ کے بعد 01.AI نے یونی کارن کا درجہ (ایک ارب ڈالر سے زائد تشخیص) حاصل کر لیا۔[4][5]

پہلی نسل (2023–2024)

پہلے کھلے ماڈلز Yi-6B اور Yi-34B کو 2 نومبر 2023 کو پیش کیا گیا۔ اگلے چند ہفتوں میں اس سیریز میں 200 ہزار token کے context والے نسخے (5 نومبر 2023)، چیٹ نسخے اور quantized ماڈلز (23 نومبر 2023) شامل کیے گئے۔ جنوری 2024 میں کثیر الوسائط Yi-VL-6B اور Yi-VL-34B سامنے آئے۔ مارچ 2024 میں Yi-6B سے depth upscaling کے طریقے سے حاصل کردہ Yi-9B ماڈل پیش کیا گیا اور تکنیکی رپورٹ arXiv:2403.04652 شائع ہوئی۔[1][2]

Yi-1.5 اور خصوصی ماڈلز (2024)

13 مئی 2024 کو Yi-1.5 سیریز (6B/9B/34B) جاری کی گئی جو اضافی 500 ارب token پر مسلسل pre-training اور 30 لاکھ ہدایت نامہ مثالوں پر fine-tuning کا نتیجہ ہے۔ مئی–جون 2024 میں API رسائی کے ساتھ بند proprietary ماڈل Yi-Large پیش کیا گیا جسے SOTA کے طور پر پیش کیا گیا۔ ستمبر 2024 میں 128 ہزار token کے context اور 52 پروگرامنگ زبانوں کی حمایت کے ساتھ کوڈ تخلیق کے لیے خصوصی سیریز Yi-Coder (1.5B/9B) جاری ہوئی۔[1][6][7]

Yi-Lightning (2024)

اکتوبر 2024 میں Mixture-of-Experts (MoE) فن تعمیر پر مبنی فلیگ شِپ ماڈل Yi-Lightning پیش کیا گیا جو رفتار اور inference کی کارکردگی کے لیے بہتر بنایا گیا ہے۔ Yi-Lightning نے LMSYS Chatbot Arena کی مجموعی درجہ بندی میں چھٹا مقام (Elo 1287)، چینی زبان میں دوسرا مقام اور ریاضی و کوڈنگ میں تیسرا–چوتھا مقام حاصل کیا۔ تکنیکی رپورٹ دسمبر 2024 میں شائع ہوئی (arXiv:2412.01253)۔[8]

حکمتِ عملی میں تبدیلی (2025)

مارچ 2025 میں کمپنی 01.AI نے نئے بڑے زبانی ماڈلز کی pre-training بند کرنے کا اعلان کیا اور اس کا ارتکاز enterprise ایپلی کیشنز، کثیر عامل نظاموں اور بیرونی ماڈلز (بشمول DeepSeek) پر مبنی WorldWise LLM Platform 2.5 پر مرکوز ہو گیا۔[4]

مجموعی سلسلہ

تاریخ واقعہ
نومبر 2023 Yi-6B اور Yi-34B کا اجرا (base، chat، 200K نسخے)
جنوری 2024 کثیر الوسائط Yi-VL-6B اور Yi-VL-34B
مارچ 2024 Yi-9B (depth-upscaled)؛ تکنیکی رپورٹ arXiv:2403.04652 کی اشاعت
مئی 2024 Yi-1.5 (6B/9B/34B)؛ Yi-Large (بند، API)
ستمبر 2024 Yi-Coder-1.5B/9B (کوڈ میں تخصص، context 128K)
اکتوبر 2024 Yi-Lightning (MoE فن تعمیر، فلیگ شِپ ماڈل)
دسمبر 2024 Yi-Lightning تکنیکی رپورٹ کی اشاعت (arXiv:2412.01253)
مارچ 2025 نئے LLM کی pre-training بند؛ enterprise حل پر توجہ

نظریاتی بنیادیں اور فن تعمیر

بنیادی فن تعمیر

Yi خاندان کے تمام ماڈلز decoder-only Transformer فن تعمیر پر مبنی ہیں جو Vaswani et al. کے مقالے میں بیان کیا گیا ہے۔[9] ماڈلز شروع سے تربیت یافتہ ہیں اور LLaMA سے مشتق نہیں ہیں، باوجود اس کے کہ ان کا نفاذ ملتا جلتا ہے۔[1]

کثیر سَر خود توجہ (Multi-Head Self-Attention) کا بنیادی طریقہ کار اس فارمولے سے بیان کیا جاتا ہے:

Attention(Q,K,V)=softmax(QKdk)V

جہاں Q، K، V بالترتیب queries، keys اور values کی میٹرکسیں ہیں، اور dk keys کی جہت ہے۔[9]

Yi کی اہم فن تعمیراتی ترامیم:[1]

  • Grouped-Query Attention (GQA) — query heads کو مشترک key/value heads کے ساتھ گروپوں میں تقسیم کرنا، جو معیار برقرار رکھتے ہوئے میموری کی کھپت کم کرتا ہے۔
  • SwiGLU activation — معیاری ReLU/GELU کا متبادل؛ activation کا حجم hidden size کے 8/3 تک کم کر دیتا ہے۔
  • Rotary Position Embedding (RoPE) موافق بنیادی تعدد (adjusted base frequency, ABF) کے ساتھ، جو فن تعمیراتی تبدیلیوں کے بغیر context کی توسیع فراہم کرتا ہے۔
  • ذخیرۂ الفاظ (vocabulary): BPE (SentencePiece) پر مبنی 64,000 token جس میں اعداد کو ہندسوں میں تقسیم اور نادر علامات کے لیے unicode-byte fallback شامل ہے۔

بنیادی ماڈلز کی ترتیبات

تکنیکی رپورٹ arXiv:2403.04652 سے فن تعمیر کے پیرامیٹرز:[1]

پیرامیٹر Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
تہوں کی تعداد 32 60
Pre-training کی لمبائی (Pretrain Seq. Len) 4096 4096
زیادہ سے زیادہ سیکھنے کی شرح (Max LR) 3×10⁻⁴ 1.5×10⁻⁴

ماخذ: arXiv:2403.04652، پیرامیٹرز کی جدول۔[1]

Yi-Lightning کا فن تعمیر (MoE)

Yi-Lightning (2024) بہتر Mixture-of-Experts (MoE) فن تعمیر استعمال کرتا ہے جس کی درج ذیل خصوصیات ہیں:[8]

  • Fine-grained expert segmentation — تخصص بڑھانے کے لیے FFN بلاکس کو باریک ماہرین میں تقسیم کرنا۔
  • کثیر سطحی بار توازن — ماہرین کے درمیان token کی یکساں تقسیم کے لیے Switch-Transformer (ST)، Expert Parallel (EP) اور Partitioned EP (PEP) نقصانات کا مجموعہ۔
  • ہائبرڈ توجہ — sliding window والی 3 تہوں اور مکمل توجہ (full attention) والی 1 تہ کا باری باری استعمال، تہوں کے درمیان KV-cache کا دوبارہ استعمال کرتے ہوئے۔
  • KV-cache میموری میں کمی — طویل تسلسلوں کی پروسیسنگ میں معیاری طریقے کے مقابلے 82.8 فیصد کمی۔
  • context window کو 64 ہزار token تک بڑھایا گیا ہے۔

Yi-Lightning میں ماہرین کی درست تعداد اور پیرامیٹرز کی مجموعی تعداد عوامی ذرائع میں ظاہر نہیں کی گئی۔[8]

کثیر الوسائط نسخے (Yi-VL)

کثیر الوسائط ماڈلز Yi-VL میں زبانی ماڈل کو CLIP ViT-H/14 بصری encoder کے ساتھ MLP پروجیکشن کے ذریعے جوڑا گیا ہے۔ تصویر I کو بصری encoder embedding کی ترتیب {v1,,vK} میں تبدیل کرتا ہے جو متنی token کے ساتھ مل کر زبانی ماڈل میں دیے جاتے ہیں۔ تربیت ریزولیوشن میں اضافے کے ساتھ تین مراحل میں ہوتی ہے: 224×224 → 448×448 پکسل۔[1]

تربیت کا پائپ لائن اور ہم آہنگی

ابتدائی تربیت (Pre-training)

بنیادی ماڈلز Yi-6B اور Yi-34B کو 3.1 ٹریلین token کے دو لسانی corpus پر pre-train کیا گیا ہے۔ ڈیٹا ایک cascade فلٹریشن اور ڈی ڈپلیکیشن پائپ لائن سے گزرتا ہے: ہیورسٹک فلٹرز، تربیت یافتہ اسکورر (perplexity، quality، coherence، safety)، clustering اور MinHash ڈی ڈپلیکیشن۔ ذرائع میں Common Crawl، کتابیں اور تحقیقی مقالے شامل ہیں۔[1]

Yi-1.5 کے لیے اعلیٰ معیاری corpus کے اضافی 500 ارب token پر مسلسل pre-training (continued pre-training) کی گئی۔[7]

نگران fine-tuning (Supervised Fine-Tuning, SFT)

پہلی نسل کے چیٹ نسخوں کو ایک چھوٹے لیکن بغور منتخب کردہ مجموعے پر fine-tune کیا گیا — 10 ہزار سے کم multi-turn مثالیں، جن میں سے ہر ایک کو machine learning انجینئرز نے دستی طور پر جانچا اور ترمیم کی۔ Yi-1.5 کے لیے SFT ڈیٹا کی مقدار 30 لاکھ مثالوں تک بڑھائی گئی۔[1][7]

تقویتی سیکھنے سے ہم آہنگی

Yi-Lightning کے لیے ہم آہنگی کا کثیر مرحلہ عمل استعمال کیا گیا: SFT کے بعد RLHF/DPO۔ مصنوعی ڈیٹا Monte Carlo Tree Search (MCTS) کے استعمال سے تیار کیا جاتا ہے۔ حفاظتی فریم ورک RAISE چار سطحی تحفظ فراہم کرتا ہے: pre-training ڈیٹا کی فلٹریشن، safety fine-tuning، prompt کا اِن پٹ کنٹرول اور جوابات کا آؤٹ پٹ کنٹرول۔[8]

Context کی توسیع

Context window کو 200 ہزار token تک بڑھانا RoPE ABF تکنیک کے استعمال کے ساتھ 5 ارب token (کتابیں + مصنوعی سوال-جواب) پر ہلکی مسلسل pre-training کے ذریعے حاصل کیا گیا ہے۔ تکمیل کے بعد Needle-in-a-Haystack کام (طویل متن میں ہدف کے ٹکڑے کی تلاش) میں درستگی 99.8 فیصد تک پہنچ جاتی ہے۔[1][2]

گہرائی میں پیمانہ کاری (Depth Upscaling)

Yi-9B بنیادی ماڈل Yi-6B کی تہوں 12–28 کو دوگنا کر کے اور پھر 800 ارب token پر pre-training کر کے حاصل کیا گیا۔ یہ طریقہ شروع سے تربیت دیے بغیر ماڈل کی گنجائش بڑھانے کو ممکن بناتا ہے۔[1]

ماڈلز کے خاندان کی ساخت

بنیادی زبانی ماڈلز

ماڈل پیرامیٹرز قسم Context اجرا کی تاریخ لائسنس نوٹ
Yi-6B / Yi-34B 6 ارب / 34 ارب Base / Chat 4K (32K تک توسیع) نومبر 2023 Apache 2.0 شروع سے تربیت یافتہ بنیادی ماڈلز
Yi-6B-200K / Yi-34B-200K 6 ارب / 34 ارب Base 200K نومبر 2023 Apache 2.0 طویل تسلسلوں پر مسلسل pre-training
Yi-9B 9 ارب Base 4K (200K تک توسیع) مارچ 2024 Apache 2.0 Yi-6B سے Depth-upscale + 800 ارب token
Yi-1.5-6B/9B/34B 6 / 9 / 34 ارب Base / Chat 4K / 16K / 32K مئی 2024 Apache 2.0 +500 ارب token + 30 لاکھ SFT مثالیں
Yi-Large ~1 ٹریلین (MoE، فعال پیرامیٹرز غیر ظاہر) LLM غیر ظاہر مئی 2024 بند (API) SOTA کے طور پر پیش کیا گیا
Yi-Lightning MoE (ماہرین کی تعداد غیر ظاہر) LLM 64K اکتوبر 2024 API LMSYS Chatbot Arena میں چھٹا مقام

ماخذ: arXiv:2403.04652؛ arXiv:2412.01253؛ GitHub 01-ai/Yi۔[1][8][2]

خصوصی ماڈلز

ماڈل پیرامیٹرز طریقہ ہائے کار Context اجرا کی تاریخ نوٹ
Yi-VL-6B / Yi-VL-34B 6 / 34 ارب متن + تصاویر (448×448) بنیادی ماڈل کی معیاری جنوری 2024 ViT encoder (CLIP ViT-H/14)، تین مرحلہ تربیت
Yi-Coder-1.5B / Yi-Coder-9B 1.5 / 9 ارب متن (کوڈ) 128K ستمبر 2024 52 پروگرامنگ زبانیں

ماخذ: arXiv:2403.04652؛ GitHub 01-ai/Yi۔[1][2]

API شناخت کار

01.AI پلیٹ فارم اور بیرونی فراہم کنندگان کی مثالیں: yi-large، yi-lightning، yi-34b-chat، 01-ai/Yi-1.5-34B-Chat (Hugging Face)، yi-34b (Fireworks AI, Replicate)۔[6][10][11]

جائزہ اور benchmark

بنیادی ماڈلز کے نتائج

تکنیکی رپورٹ arXiv:2403.04652 کا ڈیٹا (شرائط: benchmark کے مطابق 0-shot / 5-shot):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63.2 76.3 62.6 69.7 66.7
BBH 42.8 54.3 44.1 53.4
C-Eval 72.0 81.4 50.1 72.1 70.1
CMMLU 75.5 83.7 53.3 71.0 52.5
GSM8K 32.5 67.2 42.2 56.8 61.3 57.1
HumanEval 15.9 23.2 22.6 31.7 32.3 48.1

ماخذ: arXiv:2403.04652، نتائج کی جداول۔[1]

Yi-34B نے اکثر benchmark پر Llama 2-70B سے بہتر نتائج دکھائے (دوگنے چھوٹے حجم کے باوجود) اور اجرا کے وقت C-Eval اور CMMLU پر کھلے ماڈلز میں سرفہرست رہا۔[1][12]

Yi-Lightning کے نتائج

تکنیکی رپورٹ arXiv:2412.01253 کا ڈیٹا (شرائط: جہاں اشارہ نہ ہو وہاں 0-shot):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50.9 49.1 45.1
MATH 76.4 82.7 67.1
HumanEval 83.5 86.0 76.2
WildBench 65.1 59.9 49.0
Arena-Hard 91.8 90.5 74.0

ماخذ: arXiv:2412.01253۔[8]

صارف درجہ بندیاں

Yi-34B-Chat نے دسمبر 2023 — جنوری 2024 میں AlpacaEval پر دوسرا مقام حاصل کیا (94.08٪، GPT-4 Turbo کے بعد)، جبکہ LMSYS Chatbot Arena پر Elo تقریباً 1110 رہا۔ Yi-34B نے اجرا کے وقت Hugging Face Open LLM Leaderboard اور C-Eval پر کھلے ماڈلز میں سبقت حاصل کی۔[2][1]

Yi-Lightning نے LMSYS Chatbot Arena پر مجموعی طور پر چھٹا مقام (score 1287)، چینی زبان میں دوسرا مقام اور رپورٹ کی اشاعت کے وقت ریاضی، کوڈنگ، hard prompts اور multi-turn ذیلی زمروں میں تیسرا–چوتھا مقام حاصل کیا۔[8]

نوٹ۔ مختلف ریلیز اور ترتیبات کے ماڈلز کا براہ راست موازنہ یکساں جانچ شرائط (یکساں benchmark نسخے، یکساں generation پیرامیٹرز) کا تقاضا کرتا ہے۔ crowd-sourcing پلیٹ فارمز پر ذاتی تشخیصات شرکاء کی ساخت اور نظام میں موجودہ ماڈلز کے مجموعے پر منحصر ہوتے ہیں۔[12]

استعمال

Yi خاندان قدرتی زبان کی پروسیسنگ اور کثیر الوسائط تجزیے کے وسیع دائرے میں استعمال ہوتا ہے:[3][13]

  • چیٹ اسسٹنٹ اور مکالماتی نظام — Yi-34B-Chat اور Yi-1.5 کے چیٹ نسخوں پر مبنی۔
  • کوڈ کی تخلیق اور تجزیہ — Yi-Coder 52 پروگرامنگ زبانوں کی حمایت کرتا ہے۔
  • طویل دستاویزات کا تجزیہ — قانونی، تکنیکی اور تجزیاتی کاموں کے لیے 200K context والے نسخے۔
  • کثیر الوسائط تجزیہ — Yi-VL کے ذریعے تصاویر کی وضاحت اور بصری سوال-جواب۔
  • Enterprise ایجنٹ — 01.AI پلیٹ فارم کے ذریعے RAG نظام، علم کی تلاش اور ڈیٹا کی درجہ بندی۔
  • مقامی deployment — vLLM، llama.cpp، Hugging Face Transformers کے ذریعے؛ quantized نسخے (AWQ/GPTQ 4/8-bit) صارف GPU (مثلاً Yi-34B-4bit کے لیے RTX 4090) پر deployment کے لیے دستیاب ہیں۔

API نسخے (Yi-Large، Yi-Lightning) چیٹ بوٹس، کثیر لسانی خدمات اور کم لاگت inference کے لیے استعمال ہوتے ہیں۔ 2024 تک Yi-Lightning کے inference کی لاگت فی ملین token 14 سینٹ تھی۔[8]

حدود اور کھلے مسائل

  • Hallucination۔ ماڈلز LLM میں عام فکری غلطیوں کا شکار ہوتے ہیں، خاص طور پر پیچیدہ استدلال اور طویل inference سلسلوں میں۔[1]
  • ابتدائی نسخوں میں ریاضی اور کوڈ۔ Yi-34B کے بنیادی ماڈلز خصوصی frontier ماڈلز (مثلاً MATH Yi-34B 4-shot میں 14.4) کے مقابلے پیچیدہ کوڈنگ اور ریاضی میں کمزور نتائج دکھاتے ہیں۔ یہ مسئلہ Yi-1.5 اور Yi-Lightning میں جزوی طور پر حل کیا گیا ہے۔[1][8]
  • طویل context۔ 200K تک توسیع کے لیے اضافی pre-training اور کمپیوٹنگ وسائل درکار ہیں؛ مختصر context پر کارکردگی میں معمولی کمی ممکن ہے۔[1]
  • بند ماڈلز۔ Yi-Large اور Yi-Lightning ڈاؤن لوڈ کے لیے weights فراہم نہیں کرتے، جو فن تعمیر اور ڈیٹا کی آزاد تصدیق کو محدود کرتا ہے۔[8]
  • Arena اور benchmark کے درمیان فرق۔ Yi-Lightning صارف تشخیصات (Chatbot Arena) میں مضبوط نتائج دکھاتا ہے لیکن کچھ حریفوں سے جامد علمی benchmark پر پیچھے ہے — جو metrics کے عدم مطابقت کے عمومی مسئلے کا عکس ہے۔[8]
  • تکرارپذیری۔ تربیت کی تمام تفصیلات (dataset کی درست ساخت، domain کی تقسیم، hyper-parameters) مکمل طور پر ظاہر نہیں کی گئی ہیں۔[13]
  • Prompt کے لیے حساسیت۔ دیگر LLM کی طرح Yi ماڈلز بھی prompt کی صورت بندی کے لیے حساس ہیں، جو نتائج کے استحکام پر اثر ڈالتا ہے۔[1]

ریلیز کے بعد کوئی سنگین regression ریکارڈ نہیں ہوئی؛ community نے quantized نسخوں کا استحکام نوٹ کیا ہے۔[2]

اخلاقی اور ضابطہ کاری پہلو

Yi-Lightning میں حفاظتی فریم ورک RAISE نافذ کیا گیا ہے جو چار سطحی تحفظ فراہم کرتا ہے:[8]

  • pre-training مرحلے پر toxic content، PII اور نقصاندہ مواد کی فلٹریشن۔
  • حساس درخواستوں کے درست ہینڈلنگ کی مثالوں کے ساتھ safety fine-tuning۔
  • اِن پٹ کنٹرول (prompt کی درجہ بندی)۔
  • آؤٹ پٹ کنٹرول (جوابات کی فلٹریشن)۔

کھلے ماڈلز کے لیے Apache 2.0 لائسنس تجارتی استعمال کی اجازت دیتا ہے؛ انفرادی hosting فراہم کنندگان اضافی تقاضے عائد کر سکتے ہیں۔ ماڈلز چینی AI ضوابط کی تعمیل کرتے ہیں (enterprise حل کے لیے CAICT سرٹیفیکیشن)۔[1][3]

مستقبل اور تحقیقی سمتیں

Yi سیریز اس نقطہ نظر کی تاثیر ظاہر کرتی ہے جو پیرامیٹرز کی تعداد سے زیادہ ڈیٹا کے معیار کو ترجیح دیتا ہے، نیز ہلکی پیمانہ کاری (continual pretraining، depth upscaling، MoE آپٹیمائزیشن) کی اہمیت بھی واضح کرتی ہے۔[1]

2025 کے بعد 01.AI کا زور عملی حل پر منتقل ہو گیا ہے:[4]

  • کثیر عامل نظام اور enterprise پلیٹ فارم WorldWise LLM Platform 2.5۔
  • بیرونی ماڈلز (بشمول DeepSeek) کو enterprise workflow میں ضم کرنا۔
  • deployment کی لاگت کم کرنے کے لیے inference آپٹیمائزیشن (quantization، FP8)۔

کھلے ماڈلز تحقیق، fine-tuning اور distillation کے لیے community کے استعمال میں ہیں۔[6]

کتابیات

روابط

حواشی

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms