Yi (01.AI) (FA)
Yi — خانوادهای از مدلهای زبانی بزرگ (Large Language Model, LLM) و مدلهای بینایی-زبانی (Vision-Language Model, VLM) است که توسط شرکت 01.AI (零一万物) به رهبری Kai-Fu Lee توسعه یافتهاند. این مدلها از ابتدا بر روی یک پیکره دوزبانه (انگلیسی و چینی) با کیفیت بالا شامل ۳٫۱ تریلیون token آموزش دیدهاند و شامل نسخههایی برای تولید متن، پردازش زمینه طولانی (تا ۲۰۰ هزار token)، ورودی چندوجهی (متن + تصویر)، تولید کد و استنتاج کارآمد بر اساس معماری Mixture-of-Experts (MoE) هستند. نسخههای متنباز تحت مجوز Apache 2.0 با اجازه استفاده تجاری توزیع میشوند؛ مدلهای اختصاصی سرویسدهیشده (Yi-Large، Yi-Lightning) از طریق API در دسترساند.[1][2][3]
تاریخچه و روند توسعه
شرکت 01.AI در مارس ۲۰۲۳ توسط Kai-Fu Lee، مدیر سابق Microsoft Research Asia و Google China، با مقر در پکن تأسیس شد. تمرکز شرکت بر توسعه LLMهای کارآمد با تأکید بر کیفیت دادهها و بهینهسازی مهندسی زیرساخت است. تا نوامبر ۲۰۲۳، شرکت 01.AI به جایگاه «یونیکورن» (ارزشگذاری بالای ۱ میلیارد دلار) پس از دور تأمین مالی با مشارکت Alibaba رسید.[4][5]
نسل اول (۲۰۲۳–۲۰۲۴)
اولین مدلهای متنباز Yi-6B و Yi-34B در ۲ نوامبر ۲۰۲۳ معرفی شدند. طی هفتههای بعد، خط محصولات با نسخههای دارای زمینه ۲۰۰ هزار token (۵ نوامبر ۲۰۲۳)، نسخههای چت و مدلهای کوانتیزهشده (۲۳ نوامبر ۲۰۲۳) تکمیل شد. در ژانویه ۲۰۲۴، مدلهای چندوجهی Yi-VL-6B و Yi-VL-34B عرضه شدند. در مارس ۲۰۲۴، مدل Yi-9B از طریق روش depth upscaling از Yi-6B به دست آمد و گزارش فنی arXiv:2403.04652 منتشر شد.[1][2]
Yi-1.5 و مدلهای تخصصی (۲۰۲۴)
در ۱۳ مه ۲۰۲۴، مجموعه Yi-1.5 (6B/9B/34B) منتشر شد که حاصل پیشآموزش پیوسته بر روی ۵۰۰ میلیارد token اضافی و fine-tuning بر روی ۳ میلیون نمونه دستورالعمل است. در ماههای مه تا ژوئن ۲۰۲۴، مدل اختصاصی Yi-Large با دسترسی از طریق API معرفی شد که به عنوان SOTA معرفی میگردد. در سپتامبر ۲۰۲۴، مجموعه تخصصی Yi-Coder (1.5B/9B) برای تولید کد با زمینه ۱۲۸ هزار token و پشتیبانی از ۵۲ زبان برنامهنویسی عرضه شد.[1][6][7]
Yi-Lightning (2024)
در اکتبر ۲۰۲۴، مدل پرچمدار Yi-Lightning بر اساس معماری Mixture-of-Experts (MoE) معرفی شد که برای سرعت و کارایی استنتاج بهینهسازی شده است. Yi-Lightning رتبه ششم در رتبهبندی کلی LMSYS Chatbot Arena (امتیاز Elo 1287)، رتبه دوم در زبان چینی و رتبه سوم تا چهارم در ریاضیات و کدنویسی را کسب کرد. گزارش فنی در دسامبر ۲۰۲۴ منتشر شد (arXiv:2412.01253).[8]
تغییر استراتژی (۲۰۲۵)
در مارس ۲۰۲۵، شرکت 01.AI اعلام کرد که پیشآموزش مدلهای زبانی جدید بزرگ را متوقف کرده و تمرکز خود را بر روی کاربردهای سازمانی، سیستمهای چندعاملی و پلتفرم WorldWise LLM Platform 2.5 بر پایه مدلهای خارجی (از جمله DeepSeek) معطوف کرده است.[4]
جدول زمانی خلاصه
| تاریخ | رویداد |
|---|---|
| نوامبر ۲۰۲۳ | انتشار Yi-6B و Yi-34B (نسخههای base، chat، 200K) |
| ژانویه ۲۰۲۴ | مدلهای چندوجهی Yi-VL-6B و Yi-VL-34B |
| مارس ۲۰۲۴ | Yi-9B (depth-upscaled)؛ انتشار گزارش فنی arXiv:2403.04652 |
| مه ۲۰۲۴ | Yi-1.5 (6B/9B/34B)؛ Yi-Large (اختصاصی، API) |
| سپتامبر ۲۰۲۴ | Yi-Coder-1.5B/9B (تخصصی در کد، زمینه 128K) |
| اکتبر ۲۰۲۴ | Yi-Lightning (معماری MoE، مدل پرچمدار) |
| دسامبر ۲۰۲۴ | انتشار گزارش فنی Yi-Lightning (arXiv:2412.01253) |
| مارس ۲۰۲۵ | توقف پیشآموزش LLMهای جدید؛ تمرکز بر راهکارهای سازمانی |
مبانی نظری و معماری
معماری پایه
تمام مدلهای خانواده Yi بر اساس معماری decoder-only Transformer بنا شدهاند که در مقاله Vaswani et al. توصیف شده است.[9] این مدلها از ابتدا آموزش دیدهاند و علیرغم شباهت پیادهسازی، مشتق از LLaMA نیستند.[1]
مکانیزم پایه Multi-Head Self-Attention با فرمول زیر توصیف میشود:
که در آن ، ، به ترتیب ماتریسهای queries، keys و values هستند و بُعد keys است.[9]
اصلاحات معماری کلیدی Yi:[1]
- Grouped-Query Attention (GQA) — تقسیم query-headها به گروههایی با key/value-headهای مشترک، که مصرف حافظه را با حفظ کیفیت کاهش میدهد.
- فعالسازی SwiGLU — جایگزینی ReLU/GELU استاندارد؛ اندازه فعالسازیها را به ۸/۳ اندازه لایه پنهان (hidden size) کاهش میدهد.
- Rotary Position Embedding (RoPE) با فرکانس پایه تطبیقیافته (adjusted base frequency, ABF) که گسترش زمینه را بدون تغییرات معماری ممکن میسازد.
- واژگان (vocabulary): ۶۴٬۰۰۰ token بر اساس BPE (SentencePiece) با تفکیک اعداد به ارقام و unicode-byte fallback برای کاراکترهای نادر.
پیکربندیهای مدلهای پایه
پارامترهای معماری از گزارش فنی arXiv:2403.04652:[1]
| پارامتر | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| تعداد لایهها | 32 | 60 |
| طول پیشآموزش (Pretrain Seq. Len) | 4096 | 4096 |
| حداکثر نرخ یادگیری (Max LR) | 3×10⁻⁴ | 1٫5×10⁻⁴ |
منبع: arXiv:2403.04652، جدول پارامترها.[1]
معماری Yi-Lightning (MoE)
Yi-Lightning (2024) از معماری بهبودیافته Mixture-of-Experts (MoE) با ویژگیهای زیر استفاده میکند:[8]
- Fine-grained expert segmentation — تقسیمبندی دقیق بلوکهای FFN به متخصصان برای افزایش تخصصگرایی.
- توازن بار چندسطحی — ترکیبی از Switch-Transformer (ST)، Expert Parallel (EP) و Partitioned EP (PEP) losses برای توزیع یکنواخت tokenها میان متخصصان.
- توجه ترکیبی — تناوب ۳ لایه با پنجره لغزنده (sliding window) و ۱ لایه با توجه کامل (full attention)، با استفاده مجدد از KV-cache بین لایهها.
- کاهش حافظه KV-cache به میزان ۸۲٫۸٪ در مقایسه با رویکرد استاندارد در پردازش دنبالههای طولانی.
- پنجره زمینه تا ۶۴ هزار token گسترش یافته است.
تعداد دقیق متخصصان و تعداد کل پارامترهای Yi-Lightning در منابع عمومی فاش نشده است.[8]
نسخههای چندوجهی (Yi-VL)
در مدلهای چندوجهی Yi-VL، مدل زبانی از طریق یک MLP-projection به encoder بینایی CLIP ViT-H/14 متصل میشود. تصویر توسط encoder بینایی به دنبالهای از embeddingها تبدیل میشود که به همراه tokenهای متنی به مدل زبانی داده میشوند. آموزش در سه مرحله با افزایش وضوح انجام میشود: ۲۲۴×۲۲۴ → ۴۴۸×۴۴۸ پیکسل.[1]
پایپلاین آموزش و همراستایی
پیشآموزش (Pre-training)
مدلهای پایه Yi-6B و Yi-34B بر روی یک پیکره دوزبانه با حجم ۳٫۱ تریلیون token پیشآموزش دیدهاند. دادهها از یک پایپلاین آبشاری فیلترسازی و حذف تکراری عبور میکنند: فیلترهای اکتشافی، امتیازدهندههای آموزشدیده (perplexity، quality، coherence، safety)، خوشهبندی و حذف تکراری MinHash. منابع شامل Common Crawl، کتابها و مقالات علمی هستند.[1]
برای Yi-1.5، پیشآموزش پیوسته (continued pre-training) بر روی ۵۰۰ میلیارد token اضافی با کیفیت بالا انجام شده است.[7]
تنظیم دقیق نظارتشده (Supervised Fine-Tuning, SFT)
نسخههای چت نسل اول بر روی مجموعهای کوچک اما دقیقاً بررسیشده — کمتر از ۱۰ هزار نمونه multi-turn — fine-tuning شدهاند که هر یک بهصورت دستی توسط مهندسان machine learning بررسی و ویرایش شدهاند. برای Yi-1.5، حجم دادههای SFT به ۳ میلیون نمونه افزایش یافته است.[1][7]
همراستایی از طریق Reinforcement Learning
برای Yi-Lightning از فرآیند همراستایی چندمرحلهای استفاده میشود: SFT با RLHF/DPO متعاقب. دادههای مصنوعی با استفاده از Monte Carlo Tree Search (MCTS) تولید میشوند. چارچوب ایمنی RAISE چهار سطح حفاظت را پیادهسازی میکند: فیلترسازی دادههای پیشآموزش، safety fine-tuning، کنترل ورودی promptها و کنترل خروجی پاسخها.[8]
گسترش زمینه
گسترش پنجره زمینه تا ۲۰۰ هزار token از طریق پیشآموزش پیوسته سبک بر روی ۵ میلیارد token (کتابها + پرسشوپاسخ مصنوعی) با استفاده از تکنیک RoPE ABF پیادهسازی شده است. پس از تنظیم دقیق، دقت در وظیفه Needle-in-a-Haystack (جستجوی قطعه هدف در متن طولانی) به ۹۹٫۸٪ میرسد.[1][2]
مقیاسگذاری عمقی (Depth Upscaling)
Yi-9B از طریق تکرار لایههای ۱۲ تا ۲۸ مدل پایه Yi-6B و پیشآموزش بعدی بر روی ۸۰۰ میلیارد token به دست آمده است. این روش افزایش ظرفیت مدل را بدون آموزش از ابتدا فراهم میکند.[1]
ترکیب خانواده مدلها
مدلهای زبانی اصلی
| مدل | پارامترها | نوع | زمینه | تاریخ انتشار | مجوز | توضیح |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | ۶ میلیارد / ۳۴ میلیارد | Base / Chat | 4K (گسترشیافته تا 32K) | نوامبر ۲۰۲۳ | Apache 2.0 | مدلهای پایه آموزشدیده از ابتدا |
| Yi-6B-200K / Yi-34B-200K | ۶ میلیارد / ۳۴ میلیارد | Base | 200K | نوامبر ۲۰۲۳ | Apache 2.0 | پیشآموزش پیوسته بر روی دنبالههای طولانی |
| Yi-9B | ۹ میلیارد | Base | 4K (گسترشیافته تا 200K) | مارس ۲۰۲۴ | Apache 2.0 | Depth-upscale از Yi-6B + ۸۰۰ میلیارد token |
| Yi-1.5-6B/9B/34B | ۶ / ۹ / ۳۴ میلیارد | Base / Chat | 4K / 16K / 32K | مه ۲۰۲۴ | Apache 2.0 | +۵۰۰ میلیارد token + ۳ میلیون نمونه SFT |
| Yi-Large | ~۱ تریلیون (MoE، تعداد فعال فاش نشده) | LLM | فاش نشده | مه ۲۰۲۴ | اختصاصی (API) | معرفیشده به عنوان SOTA |
| Yi-Lightning | MoE (تعداد متخصصان فاش نشده) | LLM | 64K | اکتبر ۲۰۲۴ | API | رتبه ۶ در LMSYS Chatbot Arena |
منابع: arXiv:2403.04652؛ arXiv:2412.01253؛ GitHub 01-ai/Yi.[1][8][2]
مدلهای تخصصی
| مدل | پارامترها | وجهها | زمینه | تاریخ انتشار | توضیح |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | ۶ / ۳۴ میلیارد | متن + تصویر (448×448) | استاندارد مدل پایه | ژانویه ۲۰۲۴ | encoder بینایی ViT (CLIP ViT-H/14)، آموزش سهمرحلهای |
| Yi-Coder-1.5B / Yi-Coder-9B | ۱٫۵ / ۹ میلیارد | متن (کد) | 128K | سپتامبر ۲۰۲۴ | ۵۲ زبان برنامهنویسی |
منابع: arXiv:2403.04652؛ GitHub 01-ai/Yi.[1][2]
شناسههای API
نمونههایی در پلتفرم 01.AI و ارائهدهندگان خارجی: yi-large، yi-lightning، yi-34b-chat، 01-ai/Yi-1.5-34B-Chat (Hugging Face)، yi-34b (Fireworks AI، Replicate).[6][10][11]
ارزیابی و benchmarkها
نتایج مدلهای پایه
دادهها از گزارش فنی arXiv:2403.04652 (شرایط: 0-shot / 5-shot، بسته به benchmark):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63٫2 | 76٫3 | 62٫6 | 69٫7 | 66٫7 | — |
| BBH | 42٫8 | 54٫3 | 44٫1 | — | 53٫4 | — |
| C-Eval | 72٫0 | 81٫4 | — | 50٫1 | 72٫1 | 70٫1 |
| CMMLU | 75٫5 | 83٫7 | — | 53٫3 | 71٫0 | 52٫5 |
| GSM8K | 32٫5 | 67٫2 | 42٫2 | 56٫8 | 61٫3 | 57٫1 |
| HumanEval | 15٫9 | 23٫2 | 22٫6 | 31٫7 | 32٫3 | 48٫1 |
منبع: arXiv:2403.04652، جداول نتایج.[1]
Yi-34B در اکثر benchmarkها نتایجی برتر از Llama 2-70B (با اندازه دو برابر کوچکتر) نشان داد و در زمان انتشار در C-Eval و CMMLU در میان مدلهای متنباز پیشتاز بود.[1][12]
نتایج Yi-Lightning
دادهها از گزارش فنی arXiv:2412.01253 (شرایط: 0-shot، مگر جایی که غیر از این ذکر شده):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50٫9 | 49٫1 | 45٫1 |
| MATH | 76٫4 | 82٫7 | 67٫1 |
| HumanEval | 83٫5 | 86٫0 | 76٫2 |
| WildBench | 65٫1 | 59٫9 | 49٫0 |
| Arena-Hard | 91٫8 | 90٫5 | 74٫0 |
منبع: arXiv:2412.01253.[8]
رتبهبندیهای کاربری
Yi-34B-Chat در دسامبر ۲۰۲۳ تا ژانویه ۲۰۲۴ رتبه دوم را در AlpacaEval (94٫08٪، پس از GPT-4 Turbo) کسب کرد و امتیاز Elo حدود ۱۱۱۰ در LMSYS Chatbot Arena داشت. Yi-34B در زمان انتشار در میان مدلهای متنباز در Hugging Face Open LLM Leaderboard و C-Eval پیشتاز بود.[2][1]
Yi-Lightning در LMSYS Chatbot Arena رتبه ششم کلی (امتیاز 1287)، رتبه دوم در زبان چینی و رتبه سوم تا چهارم در زیرمجموعههای «ریاضیات»، «کدنویسی»، «hard prompts» و «multi-turn» را در زمان انتشار گزارش کسب کرد.[8]
توجه. مقایسه مستقیم مدلهای منتشرشده در نسخهها و پیکربندیهای مختلف مستلزم شرایط آزمایشی یکسان است (نسخههای یکسان benchmarkها، پارامترهای تولید یکسان). ارزیابیهای ذهنی در پلتفرمهای برونسپاریشده به جمعیت به ترکیب شرکتکنندگان و مجموعه مدلهای فعلی در سیستم بستگی دارد.[12]
کاربردها
خانواده Yi در طیف گستردهای از وظایف پردازش زبان طبیعی و تحلیل چندوجهی کاربرد دارد:[3][13]
- دستیارهای چت و سیستمهای مکالمهای — بر پایه نسخههای چت Yi-34B-Chat و Yi-1.5.
- تولید و تحلیل کد — Yi-Coder از ۵۲ زبان برنامهنویسی پشتیبانی میکند.
- تحلیل اسناد طولانی — نسخههای دارای زمینه 200K برای وظایف حقوقی، فنی و تحلیلی.
- تحلیل چندوجهی — توصیف تصویر و پرسشوپاسخ بینایی از طریق Yi-VL.
- عوامل سازمانی — سیستمهای RAG، جستجوی دانش و دستهبندی دادهها از طریق پلتفرم 01.AI.
- استقرار محلی — از طریق vLLM، llama.cpp، Hugging Face Transformers؛ نسخههای کوانتیزهشده (AWQ/GPTQ 4/8-bit) برای استقرار بر روی GPUهای مصرفکننده در دسترس هستند (مثلاً RTX 4090 برای Yi-34B-4bit).
نسخههای API (Yi-Large، Yi-Lightning) برای چتباتها، سرویسهای چندزبانه و استنتاج کمهزینه استفاده میشوند. هزینه استنتاج Yi-Lightning در سال ۲۰۲۴ برابر ۱۴ سنت به ازای هر میلیون token بود.[8]
محدودیتها و مسائل باز
- توهمات. مدلها در معرض خطاهای واقعی رایج در LLMها در پاسخهای تولیدشده قرار دارند، بهویژه در استدلالهای پیچیده و زنجیرههای طولانی استنتاج.[1]
- ریاضیات و کد در نسخههای اولیه. مدلهای پایه Yi-34B در کدنویسی پیچیده و ریاضیات نتایج ضعیفتری نسبت به مدلهای frontier تخصصی نشان میدهند (مثلاً MATH برای Yi-34B در 4-shot — 14٫4). این مشکل تا حدی در Yi-1.5 و Yi-Lightning برطرف شده است.[1][8]
- زمینه طولانی. گسترش تا 200K به پیشآموزش اضافی و منابع محاسباتی نیاز دارد؛ کاهش جزئی عملکرد در زمینه کوتاه ممکن است رخ دهد.[1]
- مدلهای اختصاصی. Yi-Large و Yi-Lightning وزنها را برای دانلود ارائه نمیدهند که تأیید مستقل معماری و دادهها را محدود میکند.[8]
- شکاف بین Arena و benchmarkها. Yi-Lightning در ارزیابیهای کاربری (Chatbot Arena) نتایج قوی نشان میدهد اما در برخی benchmarkهای آکادمیک ایستا از برخی رقبا عقبتر است — بازتاب مشکل کلی ناسازگاری معیارها.[8]
- بازتولیدپذیری. تمام جزئیات آموزش (ترکیب دقیق dataset، توزیع حوزهها، ابرپارامترها) بهطور کامل فاش نشدهاند.[13]
- حساسیت به prompt. مانند سایر LLMها، مدلهای Yi نسبت به فرمولبندی prompt حساس هستند که بر ثبات خروجیها تأثیر میگذارد.[1]
هیچ رگرسیون جدی شناختهشدهای پس از انتشارها ثبت نشده است؛ جامعه کاربری ثبات نسخههای کوانتیزهشده را تأیید میکند.[2]
جنبههای اخلاقی و نظارتی
در Yi-Lightning چارچوب ایمنی RAISE با چهار سطح حفاظت پیادهسازی شده است:[8]
- فیلترسازی محتوای سمی، PII و مواد مضر در مرحله پیشآموزش.
- Safety fine-tuning با نمونههایی از پردازش صحیح درخواستهای حساس.
- کنترل ورودی (دستهبندی promptها).
- کنترل خروجی (فیلترسازی پاسخها).
مجوز Apache 2.0 برای مدلهای متنباز استفاده تجاری را مجاز میداند؛ برخی میزبانیها ممکن است الزامات اضافی داشته باشند. مدلها با مقررات نظارتی چینی در حوزه هوش مصنوعی مطابقت دارند (گواهینامه CAICT برای راهکارهای سازمانی).[1][3]
چشماندازها و جهتهای پژوهشی
مجموعه Yi کارایی رویکردی را نشان میدهد که کیفیت داده را بر حجم پارامترها ترجیح میدهد، همچنین مقیاسگذاری سبک (continual pretraining، depth upscaling، بهینهسازیهای MoE) را اثبات میکند.[1]
پس از ۲۰۲۵، تمرکز 01.AI به سمت راهکارهای کاربردی تغییر یافته است:[4]
- سیستمهای چندعاملی و پلتفرم سازمانی WorldWise LLM Platform 2.5.
- یکپارچهسازی مدلهای خارجی (از جمله DeepSeek) در گردشهای کاری سازمانی.
- بهینهسازی استنتاج (کوانتیزاسیون، FP8) برای کاهش هزینه استقرار.
مدلهای متنباز همچنان توسط جامعه کاربری برای پژوهش، fine-tuning و تقطیر استفاده میشوند.[6]
پیوندها
- https://github.com/01-ai/Yi — مخزن رسمی GitHub پروژه Yi
- https://github.com/01-ai/Yi-1.5 — مخزن Yi-1.5
- https://www.01.ai/yi-models — صفحه رسمی مدلهای Yi
- https://huggingface.co/01-ai — سازمان 01-ai در Hugging Face
- https://en.wikipedia.org/wiki/01.AI — مقاله Wikipedia درباره شرکت 01.AI
منابع
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
یادداشتها
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms