Yi (01.AI) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — خانواده‌ای از مدل‌های زبانی بزرگ (Large Language Model, LLM) و مدل‌های بینایی-زبانی (Vision-Language Model, VLM) است که توسط شرکت 01.AI (零一万物) به رهبری Kai-Fu Lee توسعه یافته‌اند. این مدل‌ها از ابتدا بر روی یک پیکره دوزبانه (انگلیسی و چینی) با کیفیت بالا شامل ۳٫۱ تریلیون token آموزش دیده‌اند و شامل نسخه‌هایی برای تولید متن، پردازش زمینه طولانی (تا ۲۰۰ هزار token)، ورودی چندوجهی (متن + تصویر)، تولید کد و استنتاج کارآمد بر اساس معماری Mixture-of-Experts (MoE) هستند. نسخه‌های متن‌باز تحت مجوز Apache 2.0 با اجازه استفاده تجاری توزیع می‌شوند؛ مدل‌های اختصاصی سرویس‌دهی‌شده (Yi-Large، Yi-Lightning) از طریق API در دسترس‌اند.[1][2][3]

تاریخچه و روند توسعه

شرکت 01.AI در مارس ۲۰۲۳ توسط Kai-Fu Lee، مدیر سابق Microsoft Research Asia و Google China، با مقر در پکن تأسیس شد. تمرکز شرکت بر توسعه LLM‌های کارآمد با تأکید بر کیفیت داده‌ها و بهینه‌سازی مهندسی زیرساخت است. تا نوامبر ۲۰۲۳، شرکت 01.AI به جایگاه «یونیکورن» (ارزش‌گذاری بالای ۱ میلیارد دلار) پس از دور تأمین مالی با مشارکت Alibaba رسید.[4][5]

نسل اول (۲۰۲۳–۲۰۲۴)

اولین مدل‌های متن‌باز Yi-6B و Yi-34B در ۲ نوامبر ۲۰۲۳ معرفی شدند. طی هفته‌های بعد، خط محصولات با نسخه‌های دارای زمینه ۲۰۰ هزار token (۵ نوامبر ۲۰۲۳)، نسخه‌های چت و مدل‌های کوانتیزه‌شده (۲۳ نوامبر ۲۰۲۳) تکمیل شد. در ژانویه ۲۰۲۴، مدل‌های چندوجهی Yi-VL-6B و Yi-VL-34B عرضه شدند. در مارس ۲۰۲۴، مدل Yi-9B از طریق روش depth upscaling از Yi-6B به دست آمد و گزارش فنی arXiv:2403.04652 منتشر شد.[1][2]

Yi-1.5 و مدل‌های تخصصی (۲۰۲۴)

در ۱۳ مه ۲۰۲۴، مجموعه Yi-1.5 (6B/9B/34B) منتشر شد که حاصل پیش‌آموزش پیوسته بر روی ۵۰۰ میلیارد token اضافی و fine-tuning بر روی ۳ میلیون نمونه دستورالعمل است. در ماه‌های مه تا ژوئن ۲۰۲۴، مدل اختصاصی Yi-Large با دسترسی از طریق API معرفی شد که به عنوان SOTA معرفی می‌گردد. در سپتامبر ۲۰۲۴، مجموعه تخصصی Yi-Coder (1.5B/9B) برای تولید کد با زمینه ۱۲۸ هزار token و پشتیبانی از ۵۲ زبان برنامه‌نویسی عرضه شد.[1][6][7]

Yi-Lightning (2024)

در اکتبر ۲۰۲۴، مدل پرچمدار Yi-Lightning بر اساس معماری Mixture-of-Experts (MoE) معرفی شد که برای سرعت و کارایی استنتاج بهینه‌سازی شده است. Yi-Lightning رتبه ششم در رتبه‌بندی کلی LMSYS Chatbot Arena (امتیاز Elo 1287)، رتبه دوم در زبان چینی و رتبه سوم تا چهارم در ریاضیات و کدنویسی را کسب کرد. گزارش فنی در دسامبر ۲۰۲۴ منتشر شد (arXiv:2412.01253).[8]

تغییر استراتژی (۲۰۲۵)

در مارس ۲۰۲۵، شرکت 01.AI اعلام کرد که پیش‌آموزش مدل‌های زبانی جدید بزرگ را متوقف کرده و تمرکز خود را بر روی کاربردهای سازمانی، سیستم‌های چندعاملی و پلتفرم WorldWise LLM Platform 2.5 بر پایه مدل‌های خارجی (از جمله DeepSeek) معطوف کرده است.[4]

جدول زمانی خلاصه

تاریخ رویداد
نوامبر ۲۰۲۳ انتشار Yi-6B و Yi-34B (نسخه‌های base، chat، 200K)
ژانویه ۲۰۲۴ مدل‌های چندوجهی Yi-VL-6B و Yi-VL-34B
مارس ۲۰۲۴ Yi-9B (depth-upscaled)؛ انتشار گزارش فنی arXiv:2403.04652
مه ۲۰۲۴ Yi-1.5 (6B/9B/34B)؛ Yi-Large (اختصاصی، API)
سپتامبر ۲۰۲۴ Yi-Coder-1.5B/9B (تخصصی در کد، زمینه 128K)
اکتبر ۲۰۲۴ Yi-Lightning (معماری MoE، مدل پرچمدار)
دسامبر ۲۰۲۴ انتشار گزارش فنی Yi-Lightning (arXiv:2412.01253)
مارس ۲۰۲۵ توقف پیش‌آموزش LLM‌های جدید؛ تمرکز بر راهکارهای سازمانی

مبانی نظری و معماری

معماری پایه

تمام مدل‌های خانواده Yi بر اساس معماری decoder-only Transformer بنا شده‌اند که در مقاله Vaswani et al. توصیف شده است.[9] این مدل‌ها از ابتدا آموزش دیده‌اند و علی‌رغم شباهت پیاده‌سازی، مشتق از LLaMA نیستند.[1]

مکانیزم پایه Multi-Head Self-Attention با فرمول زیر توصیف می‌شود:

Attention(Q,K,V)=softmax(QKdk)V

که در آن Q، K، V به ترتیب ماتریس‌های queries، keys و values هستند و dk بُعد keys است.[9]

اصلاحات معماری کلیدی Yi:[1]

  • Grouped-Query Attention (GQA) — تقسیم query-head‌ها به گروه‌هایی با key/value-head‌های مشترک، که مصرف حافظه را با حفظ کیفیت کاهش می‌دهد.
  • فعال‌سازی SwiGLU — جایگزینی ReLU/GELU استاندارد؛ اندازه فعال‌سازی‌ها را به ۸/۳ اندازه لایه پنهان (hidden size) کاهش می‌دهد.
  • Rotary Position Embedding (RoPE) با فرکانس پایه تطبیق‌یافته (adjusted base frequency, ABF) که گسترش زمینه را بدون تغییرات معماری ممکن می‌سازد.
  • واژگان (vocabulary): ۶۴٬۰۰۰ token بر اساس BPE (SentencePiece) با تفکیک اعداد به ارقام و unicode-byte fallback برای کاراکترهای نادر.

پیکربندی‌های مدل‌های پایه

پارامترهای معماری از گزارش فنی arXiv:2403.04652:[1]

پارامتر Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
تعداد لایه‌ها 32 60
طول پیش‌آموزش (Pretrain Seq. Len) 4096 4096
حداکثر نرخ یادگیری (Max LR) 3×10⁻⁴ 1٫5×10⁻⁴

منبع: arXiv:2403.04652، جدول پارامترها.[1]

معماری Yi-Lightning (MoE)

Yi-Lightning (2024) از معماری بهبودیافته Mixture-of-Experts (MoE) با ویژگی‌های زیر استفاده می‌کند:[8]

  • Fine-grained expert segmentation — تقسیم‌بندی دقیق بلوک‌های FFN به متخصصان برای افزایش تخصص‌گرایی.
  • توازن بار چندسطحی — ترکیبی از Switch-Transformer (ST)، Expert Parallel (EP) و Partitioned EP (PEP) losses برای توزیع یکنواخت token‌ها میان متخصصان.
  • توجه ترکیبی — تناوب ۳ لایه با پنجره لغزنده (sliding window) و ۱ لایه با توجه کامل (full attention)، با استفاده مجدد از KV-cache بین لایه‌ها.
  • کاهش حافظه KV-cache به میزان ۸۲٫۸٪ در مقایسه با رویکرد استاندارد در پردازش دنباله‌های طولانی.
  • پنجره زمینه تا ۶۴ هزار token گسترش یافته است.

تعداد دقیق متخصصان و تعداد کل پارامترهای Yi-Lightning در منابع عمومی فاش نشده است.[8]

نسخه‌های چندوجهی (Yi-VL)

در مدل‌های چندوجهی Yi-VL، مدل زبانی از طریق یک MLP-projection به encoder بینایی CLIP ViT-H/14 متصل می‌شود. تصویر I توسط encoder بینایی به دنباله‌ای از embedding‌ها {v1,,vK} تبدیل می‌شود که به همراه token‌های متنی به مدل زبانی داده می‌شوند. آموزش در سه مرحله با افزایش وضوح انجام می‌شود: ۲۲۴×۲۲۴ → ۴۴۸×۴۴۸ پیکسل.[1]

پایپ‌لاین آموزش و هم‌راستایی

پیش‌آموزش (Pre-training)

مدل‌های پایه Yi-6B و Yi-34B بر روی یک پیکره دوزبانه با حجم ۳٫۱ تریلیون token پیش‌آموزش دیده‌اند. داده‌ها از یک پایپ‌لاین آبشاری فیلترسازی و حذف تکراری عبور می‌کنند: فیلترهای اکتشافی، امتیازدهنده‌های آموزش‌دیده (perplexity، quality، coherence، safety)، خوشه‌بندی و حذف تکراری MinHash. منابع شامل Common Crawl، کتاب‌ها و مقالات علمی هستند.[1]

برای Yi-1.5، پیش‌آموزش پیوسته (continued pre-training) بر روی ۵۰۰ میلیارد token اضافی با کیفیت بالا انجام شده است.[7]

تنظیم دقیق نظارت‌شده (Supervised Fine-Tuning, SFT)

نسخه‌های چت نسل اول بر روی مجموعه‌ای کوچک اما دقیقاً بررسی‌شده — کمتر از ۱۰ هزار نمونه multi-turn — fine-tuning شده‌اند که هر یک به‌صورت دستی توسط مهندسان machine learning بررسی و ویرایش شده‌اند. برای Yi-1.5، حجم داده‌های SFT به ۳ میلیون نمونه افزایش یافته است.[1][7]

هم‌راستایی از طریق Reinforcement Learning

برای Yi-Lightning از فرآیند هم‌راستایی چندمرحله‌ای استفاده می‌شود: SFT با RLHF/DPO متعاقب. داده‌های مصنوعی با استفاده از Monte Carlo Tree Search (MCTS) تولید می‌شوند. چارچوب ایمنی RAISE چهار سطح حفاظت را پیاده‌سازی می‌کند: فیلترسازی داده‌های پیش‌آموزش، safety fine-tuning، کنترل ورودی prompt‌ها و کنترل خروجی پاسخ‌ها.[8]

گسترش زمینه

گسترش پنجره زمینه تا ۲۰۰ هزار token از طریق پیش‌آموزش پیوسته سبک بر روی ۵ میلیارد token (کتاب‌ها + پرسش‌وپاسخ مصنوعی) با استفاده از تکنیک RoPE ABF پیاده‌سازی شده است. پس از تنظیم دقیق، دقت در وظیفه Needle-in-a-Haystack (جستجوی قطعه هدف در متن طولانی) به ۹۹٫۸٪ می‌رسد.[1][2]

مقیاس‌گذاری عمقی (Depth Upscaling)

Yi-9B از طریق تکرار لایه‌های ۱۲ تا ۲۸ مدل پایه Yi-6B و پیش‌آموزش بعدی بر روی ۸۰۰ میلیارد token به دست آمده است. این روش افزایش ظرفیت مدل را بدون آموزش از ابتدا فراهم می‌کند.[1]

ترکیب خانواده مدل‌ها

مدل‌های زبانی اصلی

مدل پارامترها نوع زمینه تاریخ انتشار مجوز توضیح
Yi-6B / Yi-34B ۶ میلیارد / ۳۴ میلیارد Base / Chat 4K (گسترش‌یافته تا 32K) نوامبر ۲۰۲۳ Apache 2.0 مدل‌های پایه آموزش‌دیده از ابتدا
Yi-6B-200K / Yi-34B-200K ۶ میلیارد / ۳۴ میلیارد Base 200K نوامبر ۲۰۲۳ Apache 2.0 پیش‌آموزش پیوسته بر روی دنباله‌های طولانی
Yi-9B ۹ میلیارد Base 4K (گسترش‌یافته تا 200K) مارس ۲۰۲۴ Apache 2.0 Depth-upscale از Yi-6B + ۸۰۰ میلیارد token
Yi-1.5-6B/9B/34B ۶ / ۹ / ۳۴ میلیارد Base / Chat 4K / 16K / 32K مه ۲۰۲۴ Apache 2.0 +۵۰۰ میلیارد token + ۳ میلیون نمونه SFT
Yi-Large ~۱ تریلیون (MoE، تعداد فعال فاش نشده) LLM فاش نشده مه ۲۰۲۴ اختصاصی (API) معرفی‌شده به عنوان SOTA
Yi-Lightning MoE (تعداد متخصصان فاش نشده) LLM 64K اکتبر ۲۰۲۴ API رتبه ۶ در LMSYS Chatbot Arena

منابع: arXiv:2403.04652؛ arXiv:2412.01253؛ GitHub 01-ai/Yi.[1][8][2]

مدل‌های تخصصی

مدل پارامترها وجه‌ها زمینه تاریخ انتشار توضیح
Yi-VL-6B / Yi-VL-34B ۶ / ۳۴ میلیارد متن + تصویر (448×448) استاندارد مدل پایه ژانویه ۲۰۲۴ encoder بینایی ViT (CLIP ViT-H/14)، آموزش سه‌مرحله‌ای
Yi-Coder-1.5B / Yi-Coder-9B ۱٫۵ / ۹ میلیارد متن (کد) 128K سپتامبر ۲۰۲۴ ۵۲ زبان برنامه‌نویسی

منابع: arXiv:2403.04652؛ GitHub 01-ai/Yi.[1][2]

شناسه‌های API

نمونه‌هایی در پلتفرم 01.AI و ارائه‌دهندگان خارجی: yi-large، yi-lightning، yi-34b-chat، 01-ai/Yi-1.5-34B-Chat (Hugging Face)، yi-34b (Fireworks AI، Replicate).[6][10][11]

ارزیابی و benchmark‌ها

نتایج مدل‌های پایه

داده‌ها از گزارش فنی arXiv:2403.04652 (شرایط: 0-shot / 5-shot، بسته به benchmark):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63٫2 76٫3 62٫6 69٫7 66٫7
BBH 42٫8 54٫3 44٫1 53٫4
C-Eval 72٫0 81٫4 50٫1 72٫1 70٫1
CMMLU 75٫5 83٫7 53٫3 71٫0 52٫5
GSM8K 32٫5 67٫2 42٫2 56٫8 61٫3 57٫1
HumanEval 15٫9 23٫2 22٫6 31٫7 32٫3 48٫1

منبع: arXiv:2403.04652، جداول نتایج.[1]

Yi-34B در اکثر benchmark‌ها نتایجی برتر از Llama 2-70B (با اندازه دو برابر کوچک‌تر) نشان داد و در زمان انتشار در C-Eval و CMMLU در میان مدل‌های متن‌باز پیشتاز بود.[1][12]

نتایج Yi-Lightning

داده‌ها از گزارش فنی arXiv:2412.01253 (شرایط: 0-shot، مگر جایی که غیر از این ذکر شده):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50٫9 49٫1 45٫1
MATH 76٫4 82٫7 67٫1
HumanEval 83٫5 86٫0 76٫2
WildBench 65٫1 59٫9 49٫0
Arena-Hard 91٫8 90٫5 74٫0

منبع: arXiv:2412.01253.[8]

رتبه‌بندی‌های کاربری

Yi-34B-Chat در دسامبر ۲۰۲۳ تا ژانویه ۲۰۲۴ رتبه دوم را در AlpacaEval (94٫08٪، پس از GPT-4 Turbo) کسب کرد و امتیاز Elo حدود ۱۱۱۰ در LMSYS Chatbot Arena داشت. Yi-34B در زمان انتشار در میان مدل‌های متن‌باز در Hugging Face Open LLM Leaderboard و C-Eval پیشتاز بود.[2][1]

Yi-Lightning در LMSYS Chatbot Arena رتبه ششم کلی (امتیاز 1287)، رتبه دوم در زبان چینی و رتبه سوم تا چهارم در زیرمجموعه‌های «ریاضیات»، «کدنویسی»، «hard prompts» و «multi-turn» را در زمان انتشار گزارش کسب کرد.[8]

توجه. مقایسه مستقیم مدل‌های منتشرشده در نسخه‌ها و پیکربندی‌های مختلف مستلزم شرایط آزمایشی یکسان است (نسخه‌های یکسان benchmark‌ها، پارامترهای تولید یکسان). ارزیابی‌های ذهنی در پلتفرم‌های برون‌سپاری‌شده به جمعیت به ترکیب شرکت‌کنندگان و مجموعه مدل‌های فعلی در سیستم بستگی دارد.[12]

کاربردها

خانواده Yi در طیف گسترده‌ای از وظایف پردازش زبان طبیعی و تحلیل چندوجهی کاربرد دارد:[3][13]

  • دستیارهای چت و سیستم‌های مکالمه‌ای — بر پایه نسخه‌های چت Yi-34B-Chat و Yi-1.5.
  • تولید و تحلیل کد — Yi-Coder از ۵۲ زبان برنامه‌نویسی پشتیبانی می‌کند.
  • تحلیل اسناد طولانی — نسخه‌های دارای زمینه 200K برای وظایف حقوقی، فنی و تحلیلی.
  • تحلیل چندوجهی — توصیف تصویر و پرسش‌وپاسخ بینایی از طریق Yi-VL.
  • عوامل سازمانی — سیستم‌های RAG، جستجوی دانش و دسته‌بندی داده‌ها از طریق پلتفرم 01.AI.
  • استقرار محلی — از طریق vLLM، llama.cpp، Hugging Face Transformers؛ نسخه‌های کوانتیزه‌شده (AWQ/GPTQ 4/8-bit) برای استقرار بر روی GPU‌های مصرف‌کننده در دسترس هستند (مثلاً RTX 4090 برای Yi-34B-4bit).

نسخه‌های API (Yi-Large، Yi-Lightning) برای چت‌بات‌ها، سرویس‌های چندزبانه و استنتاج کم‌هزینه استفاده می‌شوند. هزینه استنتاج Yi-Lightning در سال ۲۰۲۴ برابر ۱۴ سنت به ازای هر میلیون token بود.[8]

محدودیت‌ها و مسائل باز

  • توهمات. مدل‌ها در معرض خطاهای واقعی رایج در LLM‌ها در پاسخ‌های تولیدشده قرار دارند، به‌ویژه در استدلال‌های پیچیده و زنجیره‌های طولانی استنتاج.[1]
  • ریاضیات و کد در نسخه‌های اولیه. مدل‌های پایه Yi-34B در کدنویسی پیچیده و ریاضیات نتایج ضعیف‌تری نسبت به مدل‌های frontier تخصصی نشان می‌دهند (مثلاً MATH برای Yi-34B در 4-shot — 14٫4). این مشکل تا حدی در Yi-1.5 و Yi-Lightning برطرف شده است.[1][8]
  • زمینه طولانی. گسترش تا 200K به پیش‌آموزش اضافی و منابع محاسباتی نیاز دارد؛ کاهش جزئی عملکرد در زمینه کوتاه ممکن است رخ دهد.[1]
  • مدل‌های اختصاصی. Yi-Large و Yi-Lightning وزن‌ها را برای دانلود ارائه نمی‌دهند که تأیید مستقل معماری و داده‌ها را محدود می‌کند.[8]
  • شکاف بین Arena و benchmark‌ها. Yi-Lightning در ارزیابی‌های کاربری (Chatbot Arena) نتایج قوی نشان می‌دهد اما در برخی benchmark‌های آکادمیک ایستا از برخی رقبا عقب‌تر است — بازتاب مشکل کلی ناسازگاری معیارها.[8]
  • بازتولیدپذیری. تمام جزئیات آموزش (ترکیب دقیق dataset، توزیع حوزه‌ها، ابرپارامترها) به‌طور کامل فاش نشده‌اند.[13]
  • حساسیت به prompt. مانند سایر LLM‌ها، مدل‌های Yi نسبت به فرمول‌بندی prompt حساس هستند که بر ثبات خروجی‌ها تأثیر می‌گذارد.[1]

هیچ رگرسیون جدی شناخته‌شده‌ای پس از انتشارها ثبت نشده است؛ جامعه کاربری ثبات نسخه‌های کوانتیزه‌شده را تأیید می‌کند.[2]

جنبه‌های اخلاقی و نظارتی

در Yi-Lightning چارچوب ایمنی RAISE با چهار سطح حفاظت پیاده‌سازی شده است:[8]

  • فیلترسازی محتوای سمی، PII و مواد مضر در مرحله پیش‌آموزش.
  • Safety fine-tuning با نمونه‌هایی از پردازش صحیح درخواست‌های حساس.
  • کنترل ورودی (دسته‌بندی prompt‌ها).
  • کنترل خروجی (فیلترسازی پاسخ‌ها).

مجوز Apache 2.0 برای مدل‌های متن‌باز استفاده تجاری را مجاز می‌داند؛ برخی میزبانی‌ها ممکن است الزامات اضافی داشته باشند. مدل‌ها با مقررات نظارتی چینی در حوزه هوش مصنوعی مطابقت دارند (گواهینامه CAICT برای راهکارهای سازمانی).[1][3]

چشم‌اندازها و جهت‌های پژوهشی

مجموعه Yi کارایی رویکردی را نشان می‌دهد که کیفیت داده را بر حجم پارامترها ترجیح می‌دهد، همچنین مقیاس‌گذاری سبک (continual pretraining، depth upscaling، بهینه‌سازی‌های MoE) را اثبات می‌کند.[1]

پس از ۲۰۲۵، تمرکز 01.AI به سمت راهکارهای کاربردی تغییر یافته است:[4]

  • سیستم‌های چندعاملی و پلتفرم سازمانی WorldWise LLM Platform 2.5.
  • یکپارچه‌سازی مدل‌های خارجی (از جمله DeepSeek) در گردش‌های کاری سازمانی.
  • بهینه‌سازی استنتاج (کوانتیزاسیون، FP8) برای کاهش هزینه استقرار.

مدل‌های متن‌باز همچنان توسط جامعه کاربری برای پژوهش، fine-tuning و تقطیر استفاده می‌شوند.[6]

پیوندها

منابع

یادداشت‌ها

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms