Yi (01.AI) (BN)
Yi — বৃহৎ ভাষা মডেলের (Large Language Model, LLM) এবং ভিজ্যুয়াল-ভাষা মডেলের (Vision-Language Model, VLM) একটি পরিবার, যা 01.AI (零一万物) কোম্পানি কাই-ফু লি (Kai-Fu Lee)-এর নেতৃত্বে তৈরি করেছে। মডেলগুলো উচ্চমানের দ্বিভাষিক কর্পাসে (ইংরেজি ও চীনা ভাষা) শূন্য থেকে প্রশিক্ষিত, যার পরিমাণ ৩.১ ট্রিলিয়ন token; এতে টেক্সট জেনারেশন, দীর্ঘ context প্রক্রিয়াকরণ (২ লক্ষ token পর্যন্ত), মাল্টিমোডাল ইনপুট (টেক্সট + ছবি), কোড জেনারেশন এবং Mixture-of-Experts (MoE) আর্কিটেকচার-ভিত্তিক দক্ষ inference-এর ভেরিয়েন্ট অন্তর্ভুক্ত। উন্মুক্ত ভেরিয়েন্টগুলো বাণিজ্যিক ব্যবহারের অনুমতিসহ Apache 2.0 লাইসেন্সের অধীনে বিতরণ করা হয়; বন্ধ ফ্ল্যাগশিপ মডেলগুলো (Yi-Large, Yi-Lightning) API-এর মাধ্যমে পাওয়া যায়।[1][2][3]
ইতিহাস ও উন্নয়নের কালক্রম
01.AI কোম্পানিটি ২০২৩ সালের মার্চ মাসে কাই-ফু লি প্রতিষ্ঠা করেন, যিনি Microsoft Research Asia এবং Google China-এর সাবেক প্রধান; কোম্পানির সদর দপ্তর বেইজিংয়ে। কোম্পানির মূল লক্ষ্য — ডেটার মান এবং অবকাঠামো প্রকৌশল অপ্টিমাইজেশনের উপর জোর দিয়ে দক্ষ LLM তৈরি করা। ২০২৩ সালের নভেম্বরের মধ্যে Alibaba-সহ অন্যান্যদের অংশগ্রহণে একটি ফান্ডিং রাউন্ডের পর 01.AI 'ইউনিকর্ন' মর্যাদা (১ বিলিয়ন ডলারের বেশি মূল্যায়ন) অর্জন করে।[4][5]
প্রথম প্রজন্ম (২০২৩–২০২৪)
প্রথম উন্মুক্ত মডেল Yi-6B এবং Yi-34B ২০২৩ সালের ২ নভেম্বর উপস্থাপিত হয়। পরবর্তী কয়েক সপ্তাহে ২ লক্ষ token context-এর ভেরিয়েন্ট (৫ নভেম্বর ২০২৩), চ্যাট ভেরিয়েন্ট এবং quantized মডেল (২৩ নভেম্বর ২০২৩) যোগ করে সিরিজটি সম্পূর্ণ করা হয়। ২০২৪ সালের জানুয়ারিতে মাল্টিমোডাল Yi-VL-6B এবং Yi-VL-34B প্রকাশিত হয়। ২০২৪ সালের মার্চে Yi-6B থেকে depth upscaling পদ্ধতিতে তৈরি Yi-9B মডেল উপস্থাপিত হয় এবং কারিগরি প্রতিবেদন arXiv:2403.04652 প্রকাশিত হয়।[1][2]
Yi-1.5 এবং বিশেষায়িত মডেল (২০২৪)
২০২৪ সালের ১৩ মে Yi-1.5 সিরিজ (6B/9B/34B) প্রকাশিত হয় — যা অতিরিক্ত ৫০০ বিলিয়ন token-এ ক্রমাগত pre-training এবং ৩০ লক্ষ instruction উদাহরণে fine-tuning-এর ফল। ২০২৪ সালের মে–জুনে API অ্যাক্সেসযোগ্য বন্ধ মালিকানাধীন মডেল Yi-Large উপস্থাপিত হয়, যাকে SOTA হিসেবে উপস্থাপন করা হয়। ২০২৪ সালের সেপ্টেম্বরে কোড জেনারেশনের জন্য বিশেষায়িত Yi-Coder সিরিজ (1.5B/9B) প্রকাশিত হয়, যা ১ লক্ষ ২৮ হাজার token context এবং ৫২টি প্রোগ্রামিং ভাষা সমর্থন করে।[1][6][7]
Yi-Lightning (২০২৪)
২০২৪ সালের অক্টোবরে Mixture-of-Experts (MoE) আর্কিটেকচার-ভিত্তিক ফ্ল্যাগশিপ মডেল Yi-Lightning উপস্থাপিত হয়, যা গতি ও inference দক্ষতার জন্য অপ্টিমাইজ করা হয়েছে। Yi-Lightning LMSYS Chatbot Arena-এর সামগ্রিক র্যাংকিংয়ে ৬ষ্ঠ স্থান (Elo 1287), চীনা ভাষায় ২য় স্থান এবং গণিত ও কোডিংয়ে ৩য়–৪র্থ স্থান অর্জন করেছে। কারিগরি প্রতিবেদন ২০২৪ সালের ডিসেম্বরে প্রকাশিত হয় (arXiv:2412.01253)।[8]
কৌশলগত পরিবর্তন (২০২৫)
২০২৫ সালের মার্চে 01.AI ঘোষণা করে যে তারা নতুন বৃহৎ ভাষা মডেলের pre-training বন্ধ করছে এবং কর্পোরেট অ্যাপ্লিকেশন, মাল্টি-এজেন্ট সিস্টেম এবং তৃতীয় পক্ষের মডেলের (DeepSeek সহ) উপর ভিত্তি করে WorldWise LLM Platform 2.5-এ মনোযোগ দিচ্ছে।[4]
সংক্ষিপ্ত কালক্রম
| তারিখ | ঘটনা |
|---|---|
| নভেম্বর ২০২৩ | Yi-6B এবং Yi-34B রিলিজ (base, chat, 200K ভেরিয়েন্ট) |
| জানুয়ারি ২০২৪ | মাল্টিমোডাল Yi-VL-6B এবং Yi-VL-34B |
| মার্চ ২০২৪ | Yi-9B (depth-upscaled); কারিগরি প্রতিবেদন arXiv:2403.04652 প্রকাশ |
| মে ২০২৪ | Yi-1.5 (6B/9B/34B); Yi-Large (বন্ধ, API) |
| সেপ্টেম্বর ২০২৪ | Yi-Coder-1.5B/9B (কোডে বিশেষায়িত, context 128K) |
| অক্টোবর ২০২৪ | Yi-Lightning (MoE আর্কিটেকচার, ফ্ল্যাগশিপ মডেল) |
| ডিসেম্বর ২০২৪ | Yi-Lightning কারিগরি প্রতিবেদন প্রকাশ (arXiv:2412.01253) |
| মার্চ ২০২৫ | নতুন LLM-এর pre-training বন্ধ; কর্পোরেট সমাধানে মনোযোগ |
তাত্ত্বিক ভিত্তি ও আর্কিটেকচার
মূল আর্কিটেকচার
Yi পরিবারের সকল মডেল Vaswani et al.-এর কাজে বর্ণিত decoder-only Transformer আর্কিটেকচারের উপর ভিত্তি করে তৈরি।[9] মডেলগুলো শূন্য থেকে প্রশিক্ষিত এবং বাস্তবায়নের মিল থাকলেও LLaMA থেকে উদ্ভূত নয়।[1]
মাল্টি-হেড সেলফ-অ্যাটেনশনের (Multi-Head Self-Attention) মূল পদ্ধতিটি নিম্নলিখিত সূত্র দ্বারা বর্ণিত:
যেখানে , , যথাক্রমে queries, keys এবং values-এর ম্যাট্রিক্স এবং হলো keys-এর মাত্রা।[9]
Yi-এর মূল আর্কিটেকচারাল পরিবর্তনসমূহ:[1]
- Grouped-Query Attention (GQA) — query হেডগুলোকে ভাগ করা key/value হেড সহ গ্রুপে বিভক্ত করা, যা মানের সাথে আপোস না করে মেমরি ব্যবহার কমায়।
- SwiGLU অ্যাক্টিভেশন — প্রমাণিত ReLU/GELU-এর পরিবর্তে ব্যবহার; hidden size-এর 8/3 ভাগে অ্যাক্টিভেশনের আকার কমায়।
- Rotary Position Embedding (RoPE) অভিযোজিত মূল কম্পাঙ্কসহ (adjusted base frequency, ABF), যা আর্কিটেকচারাল পরিবর্তন ছাড়াই context বিস্তার নিশ্চিত করে।
- শব্দভাণ্ডার (vocabulary): BPE (SentencePiece)-ভিত্তিক ৬৪,০০০ token, সংখ্যাকে অঙ্কে বিভক্ত করা এবং বিরল প্রতীকের জন্য unicode-byte fallback সহ।
মূল মডেলের কনফিগারেশন
কারিগরি প্রতিবেদন arXiv:2403.04652 থেকে আর্কিটেকচার প্যারামিটার:[1]
| প্যারামিটার | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| স্তরের সংখ্যা | 32 | 60 |
| Pre-training ক্রমের দৈর্ঘ্য (Pretrain Seq. Len) | 4096 | 4096 |
| সর্বোচ্চ লার্নিং রেট (Max LR) | 3×10⁻⁴ | 1,5×10⁻⁴ |
উৎস: arXiv:2403.04652, প্যারামিটার টেবিল।[1]
Yi-Lightning (MoE) আর্কিটেকচার
Yi-Lightning (২০২৪) উন্নত Mixture-of-Experts (MoE) আর্কিটেকচার ব্যবহার করে, যার বিশেষত্বগুলো হলো:[8]
- Fine-grained expert segmentation — বিশেষায়ন বাড়ানোর জন্য FFN ব্লকগুলোকে সূক্ষ্মভাবে বিশেষজ্ঞদের মধ্যে ভাগ করা।
- বহুস্তরীয় লোড ব্যালান্সিং — বিশেষজ্ঞদের মধ্যে token সমানভাবে বিতরণের জন্য Switch-Transformer (ST), Expert Parallel (EP) এবং Partitioned EP (PEP) লসের সমন্বয়।
- হাইব্রিড অ্যাটেনশন — ৩টি স্লাইডিং উইন্ডো (sliding window) স্তর এবং ১টি পূর্ণ অ্যাটেনশন (full attention) স্তরের পর্যায়ক্রম, স্তরগুলোর মধ্যে KV-ক্যাশের পুনরায় ব্যবহারসহ।
- KV-ক্যাশ মেমরি হ্রাস — দীর্ঘ ক্রম প্রক্রিয়াকরণে প্রমাণিত পদ্ধতির তুলনায় ৮২.৮% কম।
- Context উইন্ডো ৬৪ হাজার token পর্যন্ত বিস্তৃত।
Yi-Lightning-এ বিশেষজ্ঞের সঠিক সংখ্যা এবং মোট প্যারামিটারের পরিমাণ সর্বজনীন উৎসে প্রকাশ করা হয়নি।[8]
মাল্টিমোডাল ভেরিয়েন্ট (Yi-VL)
মাল্টিমোডাল মডেল Yi-VL-এ ভাষা মডেলটি MLP প্রজেকশনের মাধ্যমে ভিজ্যুয়াল এনকোডার CLIP ViT-H/14-এর সাথে সংযুক্ত। ছবি ভিজ্যুয়াল এনকোডার দ্বারা embedding-এর একটি ক্রমে রূপান্তরিত হয়, যা টেক্সট token-এর সাথে একযোগে ভাষা মডেলে প্রবেশ করানো হয়। প্রশিক্ষণ রেজোলিউশন বৃদ্ধির তিনটি ধাপে সম্পন্ন হয়: 224×224 → 448×448 পিক্সেল।[1]
প্রশিক্ষণ পাইপলাইন ও alignment
প্রাথমিক প্রশিক্ষণ (Pre-training)
বেস মডেল Yi-6B এবং Yi-34B ৩.১ ট্রিলিয়ন token-এর দ্বিভাষিক কর্পাসে pre-train করা হয়েছে। ডেটা ফিল্টারিং ও ডি-ডুপ্লিকেশনের একটি ধাপে ধাপে পাইপলাইনের মধ্য দিয়ে যায়: হিউরিস্টিক ফিল্টার, প্রশিক্ষিত স্কোরার (perplexity, quality, coherence, safety), ক্লাস্টারিং এবং MinHash ডি-ডুপ্লিকেশন। উৎস — Common Crawl, বই ও বৈজ্ঞানিক প্রবন্ধ।[1]
Yi-1.5-এর জন্য উচ্চমানের কর্পাসে অতিরিক্ত ৫০০ বিলিয়ন token-এ ক্রমাগত pre-training (continued pre-training) করা হয়েছে।[7]
তত্ত্বাবধায়িত fine-tuning (Supervised Fine-Tuning, SFT)
প্রথম প্রজন্মের চ্যাট ভেরিয়েন্টগুলো একটি ছোট কিন্তু সুচিন্তিত সেটে fine-tune করা হয়েছে — ১০ হাজারেরও কম মাল্টি-টার্ন (multi-turn) উদাহরণ, প্রতিটি ML ইঞ্জিনিয়ারদের দ্বারা হাতে যাচাই ও সম্পাদিত। Yi-1.5-এর জন্য SFT ডেটার পরিমাণ ৩০ লক্ষ উদাহরণে বাড়ানো হয়েছে।[1][7]
Reinforcement Learning-এর মাধ্যমে alignment
Yi-Lightning-এর জন্য বহু-ধাপ alignment প্রক্রিয়া প্রয়োগ করা হয়: SFT-এর পরে RLHF/DPO। সিন্থেটিক ডেটা Monte Carlo Tree Search (MCTS) ব্যবহার করে তৈরি করা হয়। RAISE নিরাপত্তা ফ্রেমওয়ার্ক চার স্তরের সুরক্ষা বাস্তবায়ন করে: pre-training ডেটা ফিল্টারিং, safety fine-tuning, prompt ইনপুট নিয়ন্ত্রণ এবং উত্তর আউটপুট নিয়ন্ত্রণ।[8]
Context বিস্তার
২ লক্ষ token পর্যন্ত context উইন্ডো বিস্তার RoPE ABF কৌশল ব্যবহার করে ৫ বিলিয়ন token-এ (বই + সিন্থেটিক প্রশ্নোত্তর) হালকা ক্রমাগত pre-training-এর মাধ্যমে বাস্তবায়িত হয়েছে। পরিমার্জনের পর Needle-in-a-Haystack (দীর্ঘ টেক্সটে লক্ষ্য অংশ খোঁজা) কাজে নির্ভুলতা ৯৯.৮% পৌঁছায়।[1][2]
গভীরতা স্কেলিং (Depth Upscaling)
Yi-9B তৈরি হয়েছে Yi-6B বেস মডেলের ১২–২৮ স্তর দ্বিগুণ করে এবং তারপর ৮০০ বিলিয়ন token-এ pre-training করে। এই পদ্ধতি শূন্য থেকে প্রশিক্ষণ ছাড়াই মডেলের ধারণক্ষমতা বাড়ায়।[1]
মডেল পরিবারের গঠন
মূল ভাষা মডেল
| মডেল | প্যারামিটার | ধরন | Context | রিলিজের তারিখ | লাইসেন্স | মন্তব্য |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | ৬ বিলিয়ন / ৩৪ বিলিয়ন | Base / Chat | 4K (৩২K পর্যন্ত বিস্তৃত) | নভেম্বর ২০২৩ | Apache 2.0 | শূন্য থেকে প্রশিক্ষিত বেস মডেল |
| Yi-6B-200K / Yi-34B-200K | ৬ বিলিয়ন / ৩৪ বিলিয়ন | Base | 200K | নভেম্বর ২০২৩ | Apache 2.0 | দীর্ঘ ক্রমে ক্রমাগত pre-training |
| Yi-9B | ৯ বিলিয়ন | Base | 4K (২ লক্ষ পর্যন্ত বিস্তৃত) | মার্চ ২০২৪ | Apache 2.0 | Yi-6B থেকে Depth-upscale + ৮০০ বিলিয়ন token |
| Yi-1.5-6B/9B/34B | ৬ / ৯ / ৩৪ বিলিয়ন | Base / Chat | 4K / 16K / 32K | মে ২০২৪ | Apache 2.0 | +৫০০ বিলিয়ন token + ৩০ লক্ষ SFT উদাহরণ |
| Yi-Large | ~১ ট্রিলিয়ন (MoE, সক্রিয় প্যারামিটার অপ্রকাশিত) | LLM | অপ্রকাশিত | মে ২০২৪ | বন্ধ (API) | SOTA হিসেবে উপস্থাপিত |
| Yi-Lightning | MoE (বিশেষজ্ঞের সংখ্যা অপ্রকাশিত) | LLM | 64K | অক্টোবর ২০২৪ | API | LMSYS Chatbot Arena-এ ৬ষ্ঠ স্থান |
উৎস: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi।[1][8][2]
বিশেষায়িত মডেল
| মডেল | প্যারামিটার | মোডালিটি | Context | রিলিজের তারিখ | মন্তব্য |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | ৬ / ৩৪ বিলিয়ন | টেক্সট + ছবি (448×448) | বেস মডেলের মানক | জানুয়ারি ২০২৪ | ViT এনকোডার (CLIP ViT-H/14), তিন-ধাপ প্রশিক্ষণ |
| Yi-Coder-1.5B / Yi-Coder-9B | ১.৫ / ৯ বিলিয়ন | টেক্সট (কোড) | 128K | সেপ্টেম্বর ২০২৪ | ৫২টি প্রোগ্রামিং ভাষা |
উৎস: arXiv:2403.04652; GitHub 01-ai/Yi।[1][2]
API পরিচিতি
01.AI এবং তৃতীয় পক্ষের প্রদানকারী প্ল্যাটফর্মে উদাহরণ: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate)।[6][10][11]
মূল্যায়ন ও benchmark
বেস মডেলের ফলাফল
কারিগরি প্রতিবেদন arXiv:2403.04652 থেকে ডেটা (শর্ত: benchmark অনুযায়ী 0-shot / 5-shot):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63,2 | 76,3 | 62,6 | 69,7 | 66,7 | — |
| BBH | 42,8 | 54,3 | 44,1 | — | 53,4 | — |
| C-Eval | 72,0 | 81,4 | — | 50,1 | 72,1 | 70,1 |
| CMMLU | 75,5 | 83,7 | — | 53,3 | 71,0 | 52,5 |
| GSM8K | 32,5 | 67,2 | 42,2 | 56,8 | 61,3 | 57,1 |
| HumanEval | 15,9 | 23,2 | 22,6 | 31,7 | 32,3 | 48,1 |
উৎস: arXiv:2403.04652, ফলাফলের টেবিল।[1]
Yi-34B অধিকাংশ benchmark-এ Llama 2-70B-এর চেয়ে ভালো ফলাফল দেখিয়েছে (দ্বিগুণ ছোট আকারে) এবং রিলিজের সময় C-Eval ও CMMLU-তে উন্মুক্ত মডেলগুলোর মধ্যে শীর্ষে ছিল।[1][12]
Yi-Lightning-এর ফলাফল
কারিগরি প্রতিবেদন arXiv:2412.01253 থেকে ডেটা (শর্ত: অন্যথায় উল্লেখ না থাকলে 0-shot):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50,9 | 49,1 | 45,1 |
| MATH | 76,4 | 82,7 | 67,1 |
| HumanEval | 83,5 | 86,0 | 76,2 |
| WildBench | 65,1 | 59,9 | 49,0 |
| Arena-Hard | 91,8 | 90,5 | 74,0 |
উৎস: arXiv:2412.01253।[8]
ব্যবহারকারী রেটিং
Yi-34B-Chat ২০২৩ সালের ডিসেম্বর — ২০২৪ সালের জানুয়ারিতে AlpacaEval-এ ২য় স্থান (৯৪.০৮%, GPT-4 Turbo-এর পরে) এবং LMSYS Chatbot Arena-এ Elo ~১১১০ রেটিং অর্জন করেছিল। Yi-34B রিলিজের সময় Hugging Face Open LLM Leaderboard এবং C-Eval-এ উন্মুক্ত মডেলগুলোর মধ্যে শীর্ষে ছিল।[2][1]
Yi-Lightning LMSYS Chatbot Arena-এ সামগ্রিকভাবে ৬ষ্ঠ স্থান (স্কোর ১২৮৭), চীনা ভাষায় ২য় স্থান এবং প্রতিবেদন প্রকাশের সময় 'গণিত', 'কোডিং', 'hard prompts' ও 'multi-turn' উপবিভাগে ৩য়–৪র্থ স্থান অর্জন করেছে।[8]
দ্রষ্টব্য। বিভিন্ন রিলিজ ও কনফিগারেশনের মডেলের সরাসরি তুলনার জন্য পরীক্ষার একরূপ শর্ত (একই benchmark সংস্করণ, একই জেনারেশন প্যারামিটার) প্রয়োজন। ক্রাউডসোর্সিং প্ল্যাটফর্মে বিষয়গত মূল্যায়ন অংশগ্রহণকারীদের গঠন এবং সিস্টেমে বর্তমান মডেলের সেটের উপর নির্ভর করে।[12]
প্রয়োগ
Yi পরিবার প্রাকৃতিক ভাষা প্রক্রিয়াকরণ ও মাল্টিমোডাল বিশ্লেষণের বিস্তৃত কাজে ব্যবহৃত হয়:[3][13]
- চ্যাট অ্যাসিস্ট্যান্ট ও সংলাপ সিস্টেম — Yi-34B-Chat এবং Yi-1.5-এর চ্যাট ভেরিয়েন্টের উপর ভিত্তি করে।
- কোড তৈরি ও বিশ্লেষণ — Yi-Coder ৫২টি প্রোগ্রামিং ভাষা সমর্থন করে।
- দীর্ঘ নথি বিশ্লেষণ — আইনি, কারিগরি ও বিশ্লেষণাত্মক কাজে ২ লক্ষ token context-এর ভেরিয়েন্ট।
- মাল্টিমোডাল বিশ্লেষণ — Yi-VL-এর মাধ্যমে ছবির বিবরণ ও ভিজ্যুয়াল প্রশ্নোত্তর।
- কর্পোরেট এজেন্ট — 01.AI প্ল্যাটফর্মের মাধ্যমে RAG সিস্টেম, জ্ঞান অনুসন্ধান ও ডেটা শ্রেণীবিভাগ।
- স্থানীয় deployment — vLLM, llama.cpp, Hugging Face Transformers-এর মাধ্যমে; quantized সংস্করণ (AWQ/GPTQ 4/8-bit) ভোক্তা GPU-তে deployment-এর জন্য পাওয়া যায় (যেমন Yi-34B-4bit-এর জন্য RTX 4090)।
API ভেরিয়েন্ট (Yi-Large, Yi-Lightning) চ্যাটবট, বহুভাষিক সেবা এবং কম খরচে inference-এর জন্য ব্যবহৃত হয়। ২০২৪ সাল পর্যন্ত Yi-Lightning-এর inference খরচ ছিল প্রতি মিলিয়ন token-এ ১৪ সেন্ট।[8]
সীমাবদ্ধতা ও খোলা সমস্যা
- হ্যালুসিনেশন। মডেলগুলো LLM-এর জন্য সাধারণ তথ্যগত ত্রুটির শিকার, বিশেষ করে জটিল যুক্তি এবং দীর্ঘ অনুমান শৃঙ্খলে।[1]
- প্রারম্ভিক সংস্করণে গণিত ও কোড। Yi-34B বেস মডেল জটিল কোডিং ও গণিতে বিশেষায়িত frontier মডেলের (যেমন 4-shot-এ Yi-34B MATH — ১৪.৪) তুলনায় দুর্বল ফলাফল দেখায়। এই সমস্যা Yi-1.5 ও Yi-Lightning-এ আংশিকভাবে সমাধান করা হয়েছে।[1][8]
- দীর্ঘ context। ২ লক্ষ পর্যন্ত বিস্তারের জন্য অতিরিক্ত pre-training ও গণনামূলক সম্পদ প্রয়োজন; সংক্ষিপ্ত context-এ সামান্য পারফরম্যান্স অবনতি সম্ভব।[1]
- বন্ধ মডেল। Yi-Large এবং Yi-Lightning ডাউনলোডের জন্য ওজন সরবরাহ করে না, যা আর্কিটেকচার ও ডেটার স্বাধীন যাচাইকে সীমাবদ্ধ করে।[8]
- Arena ও benchmark-এর মধ্যে ব্যবধান। Yi-Lightning ব্যবহারকারী মূল্যায়নে (Chatbot Arena) শক্তিশালী ফলাফল দেখায়, তবে স্থির একাডেমিক benchmark-এ কিছু প্রতিযোগীর চেয়ে পিছিয়ে — এটি মেট্রিক্সের অসঙ্গতির সাধারণ সমস্যার প্রতিফলন।[8]
- পুনরুৎপাদনযোগ্যতা। প্রশিক্ষণের সকল বিস্তারিত তথ্য (dataset-এর সঠিক গঠন, ডোমেন বিতরণ, হাইপারপ্যারামিটার) সম্পূর্ণরূপে প্রকাশ করা হয়নি।[13]
- Prompt-এর প্রতি সংবেদনশীলতা। অন্য LLM-এর মতো, Yi মডেলগুলো prompt-এর প্রণয়নের প্রতি সংবেদনশীল, যা অনুমানের স্থিতিশীলতাকে প্রভাবিত করে।[1]
রিলিজের পর কোনো গুরুতর রিগ্রেশন রেকর্ড করা হয়নি; সম্প্রদায় quantized সংস্করণের স্থিতিশীলতা উল্লেখ করে।[2]
নৈতিক ও নিয়ন্ত্রক দিক
Yi-Lightning-এ RAISE নিরাপত্তা ফ্রেমওয়ার্ক বাস্তবায়িত হয়েছে, যা চার স্তরের সুরক্ষা প্রদান করে:[8]
- Pre-training পর্যায়ে বিষাক্ত কন্টেন্ট, PII এবং ক্ষতিকর উপকরণ ফিল্টারিং।
- সংবেদনশীল অনুরোধ সঠিকভাবে পরিচালনার উদাহরণ সহ safety fine-tuning।
- ইনপুট নিয়ন্ত্রণ (prompt শ্রেণীবিভাগ)।
- আউটপুট নিয়ন্ত্রণ (উত্তর ফিল্টারিং)।
উন্মুক্ত মডেলের জন্য Apache 2.0 লাইসেন্স বাণিজ্যিক ব্যবহার অনুমতি দেয়; পৃথক হোস্টিং অতিরিক্ত প্রয়োজনীয়তা আরোপ করতে পারে। মডেলগুলো কর্পোরেট সমাধানের জন্য চীনা AI নিয়ন্ত্রক মানদণ্ড (CAICT সার্টিফিকেশন) পূরণ করে।[1][3]
সম্ভাবনা ও গবেষণার দিকনির্দেশনা
Yi সিরিজ প্যারামিটারের পরিমাণের চেয়ে ডেটার মানকে অগ্রাধিকার দেওয়ার পদ্ধতির কার্যকারিতা এবং হালকা স্কেলিংয়ের (continual pretraining, depth upscaling, MoE অপ্টিমাইজেশন) সম্ভাবনা প্রদর্শন করে।[1]
২০২৫ সালের পরে 01.AI-এর গুরুত্ব প্রায়োগিক সমাধানে সরে গেছে:[4]
- মাল্টি-এজেন্ট সিস্টেম এবং enterprise প্ল্যাটফর্ম WorldWise LLM Platform 2.5।
- কর্পোরেট workflow-এ তৃতীয় পক্ষের মডেলের (DeepSeek সহ) একীভূতকরণ।
- deployment-এর খরচ কমাতে inference অপ্টিমাইজেশন (quantization, FP8)।
উন্মুক্ত মডেলগুলো গবেষণা, fine-tuning এবং distillation-এর জন্য সম্প্রদায় ব্যবহার করতে থাকে।[6]
সাহিত্য
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
সংযোগসমূহ
- https://github.com/01-ai/Yi — Yi-এর সরকারি GitHub রিপোজিটরি
- https://github.com/01-ai/Yi-1.5 — Yi-1.5-এর রিপোজিটরি
- https://www.01.ai/yi-models — Yi মডেলের সরকারি পৃষ্ঠা
- https://huggingface.co/01-ai — Hugging Face-এ 01-ai সংগঠন
- https://en.wikipedia.org/wiki/01.AI — 01.AI কোম্পানি সম্পর্কে Wikipedia নিবন্ধ
টীকা
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms