Yi (01.AI) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

Yi — বৃহৎ ভাষা মডেলের (Large Language Model, LLM) এবং ভিজ্যুয়াল-ভাষা মডেলের (Vision-Language Model, VLM) একটি পরিবার, যা 01.AI (零一万物) কোম্পানি কাই-ফু লি (Kai-Fu Lee)-এর নেতৃত্বে তৈরি করেছে। মডেলগুলো উচ্চমানের দ্বিভাষিক কর্পাসে (ইংরেজি ও চীনা ভাষা) শূন্য থেকে প্রশিক্ষিত, যার পরিমাণ ৩.১ ট্রিলিয়ন token; এতে টেক্সট জেনারেশন, দীর্ঘ context প্রক্রিয়াকরণ (২ লক্ষ token পর্যন্ত), মাল্টিমোডাল ইনপুট (টেক্সট + ছবি), কোড জেনারেশন এবং Mixture-of-Experts (MoE) আর্কিটেকচার-ভিত্তিক দক্ষ inference-এর ভেরিয়েন্ট অন্তর্ভুক্ত। উন্মুক্ত ভেরিয়েন্টগুলো বাণিজ্যিক ব্যবহারের অনুমতিসহ Apache 2.0 লাইসেন্সের অধীনে বিতরণ করা হয়; বন্ধ ফ্ল্যাগশিপ মডেলগুলো (Yi-Large, Yi-Lightning) API-এর মাধ্যমে পাওয়া যায়।[1][2][3]

ইতিহাস ও উন্নয়নের কালক্রম

01.AI কোম্পানিটি ২০২৩ সালের মার্চ মাসে কাই-ফু লি প্রতিষ্ঠা করেন, যিনি Microsoft Research Asia এবং Google China-এর সাবেক প্রধান; কোম্পানির সদর দপ্তর বেইজিংয়ে। কোম্পানির মূল লক্ষ্য — ডেটার মান এবং অবকাঠামো প্রকৌশল অপ্টিমাইজেশনের উপর জোর দিয়ে দক্ষ LLM তৈরি করা। ২০২৩ সালের নভেম্বরের মধ্যে Alibaba-সহ অন্যান্যদের অংশগ্রহণে একটি ফান্ডিং রাউন্ডের পর 01.AI 'ইউনিকর্ন' মর্যাদা (১ বিলিয়ন ডলারের বেশি মূল্যায়ন) অর্জন করে।[4][5]

প্রথম প্রজন্ম (২০২৩–২০২৪)

প্রথম উন্মুক্ত মডেল Yi-6B এবং Yi-34B ২০২৩ সালের ২ নভেম্বর উপস্থাপিত হয়। পরবর্তী কয়েক সপ্তাহে ২ লক্ষ token context-এর ভেরিয়েন্ট (৫ নভেম্বর ২০২৩), চ্যাট ভেরিয়েন্ট এবং quantized মডেল (২৩ নভেম্বর ২০২৩) যোগ করে সিরিজটি সম্পূর্ণ করা হয়। ২০২৪ সালের জানুয়ারিতে মাল্টিমোডাল Yi-VL-6B এবং Yi-VL-34B প্রকাশিত হয়। ২০২৪ সালের মার্চে Yi-6B থেকে depth upscaling পদ্ধতিতে তৈরি Yi-9B মডেল উপস্থাপিত হয় এবং কারিগরি প্রতিবেদন arXiv:2403.04652 প্রকাশিত হয়।[1][2]

Yi-1.5 এবং বিশেষায়িত মডেল (২০২৪)

২০২৪ সালের ১৩ মে Yi-1.5 সিরিজ (6B/9B/34B) প্রকাশিত হয় — যা অতিরিক্ত ৫০০ বিলিয়ন token-এ ক্রমাগত pre-training এবং ৩০ লক্ষ instruction উদাহরণে fine-tuning-এর ফল। ২০২৪ সালের মে–জুনে API অ্যাক্সেসযোগ্য বন্ধ মালিকানাধীন মডেল Yi-Large উপস্থাপিত হয়, যাকে SOTA হিসেবে উপস্থাপন করা হয়। ২০২৪ সালের সেপ্টেম্বরে কোড জেনারেশনের জন্য বিশেষায়িত Yi-Coder সিরিজ (1.5B/9B) প্রকাশিত হয়, যা ১ লক্ষ ২৮ হাজার token context এবং ৫২টি প্রোগ্রামিং ভাষা সমর্থন করে।[1][6][7]

Yi-Lightning (২০২৪)

২০২৪ সালের অক্টোবরে Mixture-of-Experts (MoE) আর্কিটেকচার-ভিত্তিক ফ্ল্যাগশিপ মডেল Yi-Lightning উপস্থাপিত হয়, যা গতি ও inference দক্ষতার জন্য অপ্টিমাইজ করা হয়েছে। Yi-Lightning LMSYS Chatbot Arena-এর সামগ্রিক র‍্যাংকিংয়ে ৬ষ্ঠ স্থান (Elo 1287), চীনা ভাষায় ২য় স্থান এবং গণিত ও কোডিংয়ে ৩য়–৪র্থ স্থান অর্জন করেছে। কারিগরি প্রতিবেদন ২০২৪ সালের ডিসেম্বরে প্রকাশিত হয় (arXiv:2412.01253)।[8]

কৌশলগত পরিবর্তন (২০২৫)

২০২৫ সালের মার্চে 01.AI ঘোষণা করে যে তারা নতুন বৃহৎ ভাষা মডেলের pre-training বন্ধ করছে এবং কর্পোরেট অ্যাপ্লিকেশন, মাল্টি-এজেন্ট সিস্টেম এবং তৃতীয় পক্ষের মডেলের (DeepSeek সহ) উপর ভিত্তি করে WorldWise LLM Platform 2.5-এ মনোযোগ দিচ্ছে।[4]

সংক্ষিপ্ত কালক্রম

তারিখ ঘটনা
নভেম্বর ২০২৩ Yi-6B এবং Yi-34B রিলিজ (base, chat, 200K ভেরিয়েন্ট)
জানুয়ারি ২০২৪ মাল্টিমোডাল Yi-VL-6B এবং Yi-VL-34B
মার্চ ২০২৪ Yi-9B (depth-upscaled); কারিগরি প্রতিবেদন arXiv:2403.04652 প্রকাশ
মে ২০২৪ Yi-1.5 (6B/9B/34B); Yi-Large (বন্ধ, API)
সেপ্টেম্বর ২০২৪ Yi-Coder-1.5B/9B (কোডে বিশেষায়িত, context 128K)
অক্টোবর ২০২৪ Yi-Lightning (MoE আর্কিটেকচার, ফ্ল্যাগশিপ মডেল)
ডিসেম্বর ২০২৪ Yi-Lightning কারিগরি প্রতিবেদন প্রকাশ (arXiv:2412.01253)
মার্চ ২০২৫ নতুন LLM-এর pre-training বন্ধ; কর্পোরেট সমাধানে মনোযোগ

তাত্ত্বিক ভিত্তি ও আর্কিটেকচার

মূল আর্কিটেকচার

Yi পরিবারের সকল মডেল Vaswani et al.-এর কাজে বর্ণিত decoder-only Transformer আর্কিটেকচারের উপর ভিত্তি করে তৈরি।[9] মডেলগুলো শূন্য থেকে প্রশিক্ষিত এবং বাস্তবায়নের মিল থাকলেও LLaMA থেকে উদ্ভূত নয়।[1]

মাল্টি-হেড সেলফ-অ্যাটেনশনের (Multi-Head Self-Attention) মূল পদ্ধতিটি নিম্নলিখিত সূত্র দ্বারা বর্ণিত:

Attention(Q,K,V)=softmax(QKdk)V

যেখানে Q, K, V যথাক্রমে queries, keys এবং values-এর ম্যাট্রিক্স এবং dk হলো keys-এর মাত্রা।[9]

Yi-এর মূল আর্কিটেকচারাল পরিবর্তনসমূহ:[1]

  • Grouped-Query Attention (GQA) — query হেডগুলোকে ভাগ করা key/value হেড সহ গ্রুপে বিভক্ত করা, যা মানের সাথে আপোস না করে মেমরি ব্যবহার কমায়।
  • SwiGLU অ্যাক্টিভেশন — প্রমাণিত ReLU/GELU-এর পরিবর্তে ব্যবহার; hidden size-এর 8/3 ভাগে অ্যাক্টিভেশনের আকার কমায়।
  • Rotary Position Embedding (RoPE) অভিযোজিত মূল কম্পাঙ্কসহ (adjusted base frequency, ABF), যা আর্কিটেকচারাল পরিবর্তন ছাড়াই context বিস্তার নিশ্চিত করে।
  • শব্দভাণ্ডার (vocabulary): BPE (SentencePiece)-ভিত্তিক ৬৪,০০০ token, সংখ্যাকে অঙ্কে বিভক্ত করা এবং বিরল প্রতীকের জন্য unicode-byte fallback সহ।

মূল মডেলের কনফিগারেশন

কারিগরি প্রতিবেদন arXiv:2403.04652 থেকে আর্কিটেকচার প্যারামিটার:[1]

প্যারামিটার Yi-6B Yi-34B
Hidden Size 4096 7168
Query-heads 32 56
KV-heads 4 8
স্তরের সংখ্যা 32 60
Pre-training ক্রমের দৈর্ঘ্য (Pretrain Seq. Len) 4096 4096
সর্বোচ্চ লার্নিং রেট (Max LR) 3×10⁻⁴ 1,5×10⁻⁴

উৎস: arXiv:2403.04652, প্যারামিটার টেবিল।[1]

Yi-Lightning (MoE) আর্কিটেকচার

Yi-Lightning (২০২৪) উন্নত Mixture-of-Experts (MoE) আর্কিটেকচার ব্যবহার করে, যার বিশেষত্বগুলো হলো:[8]

  • Fine-grained expert segmentation — বিশেষায়ন বাড়ানোর জন্য FFN ব্লকগুলোকে সূক্ষ্মভাবে বিশেষজ্ঞদের মধ্যে ভাগ করা।
  • বহুস্তরীয় লোড ব্যালান্সিং — বিশেষজ্ঞদের মধ্যে token সমানভাবে বিতরণের জন্য Switch-Transformer (ST), Expert Parallel (EP) এবং Partitioned EP (PEP) লসের সমন্বয়।
  • হাইব্রিড অ্যাটেনশন — ৩টি স্লাইডিং উইন্ডো (sliding window) স্তর এবং ১টি পূর্ণ অ্যাটেনশন (full attention) স্তরের পর্যায়ক্রম, স্তরগুলোর মধ্যে KV-ক্যাশের পুনরায় ব্যবহারসহ।
  • KV-ক্যাশ মেমরি হ্রাস — দীর্ঘ ক্রম প্রক্রিয়াকরণে প্রমাণিত পদ্ধতির তুলনায় ৮২.৮% কম।
  • Context উইন্ডো ৬৪ হাজার token পর্যন্ত বিস্তৃত।

Yi-Lightning-এ বিশেষজ্ঞের সঠিক সংখ্যা এবং মোট প্যারামিটারের পরিমাণ সর্বজনীন উৎসে প্রকাশ করা হয়নি।[8]

মাল্টিমোডাল ভেরিয়েন্ট (Yi-VL)

মাল্টিমোডাল মডেল Yi-VL-এ ভাষা মডেলটি MLP প্রজেকশনের মাধ্যমে ভিজ্যুয়াল এনকোডার CLIP ViT-H/14-এর সাথে সংযুক্ত। ছবি I ভিজ্যুয়াল এনকোডার দ্বারা embedding-এর একটি ক্রমে {v1,,vK} রূপান্তরিত হয়, যা টেক্সট token-এর সাথে একযোগে ভাষা মডেলে প্রবেশ করানো হয়। প্রশিক্ষণ রেজোলিউশন বৃদ্ধির তিনটি ধাপে সম্পন্ন হয়: 224×224 → 448×448 পিক্সেল।[1]

প্রশিক্ষণ পাইপলাইন ও alignment

প্রাথমিক প্রশিক্ষণ (Pre-training)

বেস মডেল Yi-6B এবং Yi-34B ৩.১ ট্রিলিয়ন token-এর দ্বিভাষিক কর্পাসে pre-train করা হয়েছে। ডেটা ফিল্টারিং ও ডি-ডুপ্লিকেশনের একটি ধাপে ধাপে পাইপলাইনের মধ্য দিয়ে যায়: হিউরিস্টিক ফিল্টার, প্রশিক্ষিত স্কোরার (perplexity, quality, coherence, safety), ক্লাস্টারিং এবং MinHash ডি-ডুপ্লিকেশন। উৎস — Common Crawl, বই ও বৈজ্ঞানিক প্রবন্ধ।[1]

Yi-1.5-এর জন্য উচ্চমানের কর্পাসে অতিরিক্ত ৫০০ বিলিয়ন token-এ ক্রমাগত pre-training (continued pre-training) করা হয়েছে।[7]

তত্ত্বাবধায়িত fine-tuning (Supervised Fine-Tuning, SFT)

প্রথম প্রজন্মের চ্যাট ভেরিয়েন্টগুলো একটি ছোট কিন্তু সুচিন্তিত সেটে fine-tune করা হয়েছে — ১০ হাজারেরও কম মাল্টি-টার্ন (multi-turn) উদাহরণ, প্রতিটি ML ইঞ্জিনিয়ারদের দ্বারা হাতে যাচাই ও সম্পাদিত। Yi-1.5-এর জন্য SFT ডেটার পরিমাণ ৩০ লক্ষ উদাহরণে বাড়ানো হয়েছে।[1][7]

Reinforcement Learning-এর মাধ্যমে alignment

Yi-Lightning-এর জন্য বহু-ধাপ alignment প্রক্রিয়া প্রয়োগ করা হয়: SFT-এর পরে RLHF/DPO। সিন্থেটিক ডেটা Monte Carlo Tree Search (MCTS) ব্যবহার করে তৈরি করা হয়। RAISE নিরাপত্তা ফ্রেমওয়ার্ক চার স্তরের সুরক্ষা বাস্তবায়ন করে: pre-training ডেটা ফিল্টারিং, safety fine-tuning, prompt ইনপুট নিয়ন্ত্রণ এবং উত্তর আউটপুট নিয়ন্ত্রণ।[8]

Context বিস্তার

২ লক্ষ token পর্যন্ত context উইন্ডো বিস্তার RoPE ABF কৌশল ব্যবহার করে ৫ বিলিয়ন token-এ (বই + সিন্থেটিক প্রশ্নোত্তর) হালকা ক্রমাগত pre-training-এর মাধ্যমে বাস্তবায়িত হয়েছে। পরিমার্জনের পর Needle-in-a-Haystack (দীর্ঘ টেক্সটে লক্ষ্য অংশ খোঁজা) কাজে নির্ভুলতা ৯৯.৮% পৌঁছায়।[1][2]

গভীরতা স্কেলিং (Depth Upscaling)

Yi-9B তৈরি হয়েছে Yi-6B বেস মডেলের ১২–২৮ স্তর দ্বিগুণ করে এবং তারপর ৮০০ বিলিয়ন token-এ pre-training করে। এই পদ্ধতি শূন্য থেকে প্রশিক্ষণ ছাড়াই মডেলের ধারণক্ষমতা বাড়ায়।[1]

মডেল পরিবারের গঠন

মূল ভাষা মডেল

মডেল প্যারামিটার ধরন Context রিলিজের তারিখ লাইসেন্স মন্তব্য
Yi-6B / Yi-34B ৬ বিলিয়ন / ৩৪ বিলিয়ন Base / Chat 4K (৩২K পর্যন্ত বিস্তৃত) নভেম্বর ২০২৩ Apache 2.0 শূন্য থেকে প্রশিক্ষিত বেস মডেল
Yi-6B-200K / Yi-34B-200K ৬ বিলিয়ন / ৩৪ বিলিয়ন Base 200K নভেম্বর ২০২৩ Apache 2.0 দীর্ঘ ক্রমে ক্রমাগত pre-training
Yi-9B ৯ বিলিয়ন Base 4K (২ লক্ষ পর্যন্ত বিস্তৃত) মার্চ ২০২৪ Apache 2.0 Yi-6B থেকে Depth-upscale + ৮০০ বিলিয়ন token
Yi-1.5-6B/9B/34B ৬ / ৯ / ৩৪ বিলিয়ন Base / Chat 4K / 16K / 32K মে ২০২৪ Apache 2.0 +৫০০ বিলিয়ন token + ৩০ লক্ষ SFT উদাহরণ
Yi-Large ~১ ট্রিলিয়ন (MoE, সক্রিয় প্যারামিটার অপ্রকাশিত) LLM অপ্রকাশিত মে ২০২৪ বন্ধ (API) SOTA হিসেবে উপস্থাপিত
Yi-Lightning MoE (বিশেষজ্ঞের সংখ্যা অপ্রকাশিত) LLM 64K অক্টোবর ২০২৪ API LMSYS Chatbot Arena-এ ৬ষ্ঠ স্থান

উৎস: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi।[1][8][2]

বিশেষায়িত মডেল

মডেল প্যারামিটার মোডালিটি Context রিলিজের তারিখ মন্তব্য
Yi-VL-6B / Yi-VL-34B ৬ / ৩৪ বিলিয়ন টেক্সট + ছবি (448×448) বেস মডেলের মানক জানুয়ারি ২০২৪ ViT এনকোডার (CLIP ViT-H/14), তিন-ধাপ প্রশিক্ষণ
Yi-Coder-1.5B / Yi-Coder-9B ১.৫ / ৯ বিলিয়ন টেক্সট (কোড) 128K সেপ্টেম্বর ২০২৪ ৫২টি প্রোগ্রামিং ভাষা

উৎস: arXiv:2403.04652; GitHub 01-ai/Yi।[1][2]

API পরিচিতি

01.AI এবং তৃতীয় পক্ষের প্রদানকারী প্ল্যাটফর্মে উদাহরণ: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate)।[6][10][11]

মূল্যায়ন ও benchmark

বেস মডেলের ফলাফল

কারিগরি প্রতিবেদন arXiv:2403.04652 থেকে ডেটা (শর্ত: benchmark অনুযায়ী 0-shot / 5-shot):[1]

Benchmark Yi-6B Yi-34B Llama 2-34B Llama 2-70B Qwen-14B GPT-3.5
MMLU (5-shot) 63,2 76,3 62,6 69,7 66,7
BBH 42,8 54,3 44,1 53,4
C-Eval 72,0 81,4 50,1 72,1 70,1
CMMLU 75,5 83,7 53,3 71,0 52,5
GSM8K 32,5 67,2 42,2 56,8 61,3 57,1
HumanEval 15,9 23,2 22,6 31,7 32,3 48,1

উৎস: arXiv:2403.04652, ফলাফলের টেবিল।[1]

Yi-34B অধিকাংশ benchmark-এ Llama 2-70B-এর চেয়ে ভালো ফলাফল দেখিয়েছে (দ্বিগুণ ছোট আকারে) এবং রিলিজের সময় C-Eval ও CMMLU-তে উন্মুক্ত মডেলগুলোর মধ্যে শীর্ষে ছিল।[1][12]

Yi-Lightning-এর ফলাফল

কারিগরি প্রতিবেদন arXiv:2412.01253 থেকে ডেটা (শর্ত: অন্যথায় উল্লেখ না থাকলে 0-shot):[8]

Benchmark Yi-Lightning Qwen2.5-72B-Instruct Llama-3.1-70B
GPQA 50,9 49,1 45,1
MATH 76,4 82,7 67,1
HumanEval 83,5 86,0 76,2
WildBench 65,1 59,9 49,0
Arena-Hard 91,8 90,5 74,0

উৎস: arXiv:2412.01253।[8]

ব্যবহারকারী রেটিং

Yi-34B-Chat ২০২৩ সালের ডিসেম্বর — ২০২৪ সালের জানুয়ারিতে AlpacaEval-এ ২য় স্থান (৯৪.০৮%, GPT-4 Turbo-এর পরে) এবং LMSYS Chatbot Arena-এ Elo ~১১১০ রেটিং অর্জন করেছিল। Yi-34B রিলিজের সময় Hugging Face Open LLM Leaderboard এবং C-Eval-এ উন্মুক্ত মডেলগুলোর মধ্যে শীর্ষে ছিল।[2][1]

Yi-Lightning LMSYS Chatbot Arena-এ সামগ্রিকভাবে ৬ষ্ঠ স্থান (স্কোর ১২৮৭), চীনা ভাষায় ২য় স্থান এবং প্রতিবেদন প্রকাশের সময় 'গণিত', 'কোডিং', 'hard prompts' ও 'multi-turn' উপবিভাগে ৩য়–৪র্থ স্থান অর্জন করেছে।[8]

দ্রষ্টব্য। বিভিন্ন রিলিজ ও কনফিগারেশনের মডেলের সরাসরি তুলনার জন্য পরীক্ষার একরূপ শর্ত (একই benchmark সংস্করণ, একই জেনারেশন প্যারামিটার) প্রয়োজন। ক্রাউডসোর্সিং প্ল্যাটফর্মে বিষয়গত মূল্যায়ন অংশগ্রহণকারীদের গঠন এবং সিস্টেমে বর্তমান মডেলের সেটের উপর নির্ভর করে।[12]

প্রয়োগ

Yi পরিবার প্রাকৃতিক ভাষা প্রক্রিয়াকরণ ও মাল্টিমোডাল বিশ্লেষণের বিস্তৃত কাজে ব্যবহৃত হয়:[3][13]

  • চ্যাট অ্যাসিস্ট্যান্ট ও সংলাপ সিস্টেম — Yi-34B-Chat এবং Yi-1.5-এর চ্যাট ভেরিয়েন্টের উপর ভিত্তি করে।
  • কোড তৈরি ও বিশ্লেষণ — Yi-Coder ৫২টি প্রোগ্রামিং ভাষা সমর্থন করে।
  • দীর্ঘ নথি বিশ্লেষণ — আইনি, কারিগরি ও বিশ্লেষণাত্মক কাজে ২ লক্ষ token context-এর ভেরিয়েন্ট।
  • মাল্টিমোডাল বিশ্লেষণ — Yi-VL-এর মাধ্যমে ছবির বিবরণ ও ভিজ্যুয়াল প্রশ্নোত্তর।
  • কর্পোরেট এজেন্ট — 01.AI প্ল্যাটফর্মের মাধ্যমে RAG সিস্টেম, জ্ঞান অনুসন্ধান ও ডেটা শ্রেণীবিভাগ।
  • স্থানীয় deployment — vLLM, llama.cpp, Hugging Face Transformers-এর মাধ্যমে; quantized সংস্করণ (AWQ/GPTQ 4/8-bit) ভোক্তা GPU-তে deployment-এর জন্য পাওয়া যায় (যেমন Yi-34B-4bit-এর জন্য RTX 4090)।

API ভেরিয়েন্ট (Yi-Large, Yi-Lightning) চ্যাটবট, বহুভাষিক সেবা এবং কম খরচে inference-এর জন্য ব্যবহৃত হয়। ২০২৪ সাল পর্যন্ত Yi-Lightning-এর inference খরচ ছিল প্রতি মিলিয়ন token-এ ১৪ সেন্ট।[8]

সীমাবদ্ধতা ও খোলা সমস্যা

  • হ্যালুসিনেশন। মডেলগুলো LLM-এর জন্য সাধারণ তথ্যগত ত্রুটির শিকার, বিশেষ করে জটিল যুক্তি এবং দীর্ঘ অনুমান শৃঙ্খলে।[1]
  • প্রারম্ভিক সংস্করণে গণিত ও কোড। Yi-34B বেস মডেল জটিল কোডিং ও গণিতে বিশেষায়িত frontier মডেলের (যেমন 4-shot-এ Yi-34B MATH — ১৪.৪) তুলনায় দুর্বল ফলাফল দেখায়। এই সমস্যা Yi-1.5 ও Yi-Lightning-এ আংশিকভাবে সমাধান করা হয়েছে।[1][8]
  • দীর্ঘ context। ২ লক্ষ পর্যন্ত বিস্তারের জন্য অতিরিক্ত pre-training ও গণনামূলক সম্পদ প্রয়োজন; সংক্ষিপ্ত context-এ সামান্য পারফরম্যান্স অবনতি সম্ভব।[1]
  • বন্ধ মডেল। Yi-Large এবং Yi-Lightning ডাউনলোডের জন্য ওজন সরবরাহ করে না, যা আর্কিটেকচার ও ডেটার স্বাধীন যাচাইকে সীমাবদ্ধ করে।[8]
  • Arena ও benchmark-এর মধ্যে ব্যবধান। Yi-Lightning ব্যবহারকারী মূল্যায়নে (Chatbot Arena) শক্তিশালী ফলাফল দেখায়, তবে স্থির একাডেমিক benchmark-এ কিছু প্রতিযোগীর চেয়ে পিছিয়ে — এটি মেট্রিক্সের অসঙ্গতির সাধারণ সমস্যার প্রতিফলন।[8]
  • পুনরুৎপাদনযোগ্যতা। প্রশিক্ষণের সকল বিস্তারিত তথ্য (dataset-এর সঠিক গঠন, ডোমেন বিতরণ, হাইপারপ্যারামিটার) সম্পূর্ণরূপে প্রকাশ করা হয়নি।[13]
  • Prompt-এর প্রতি সংবেদনশীলতা। অন্য LLM-এর মতো, Yi মডেলগুলো prompt-এর প্রণয়নের প্রতি সংবেদনশীল, যা অনুমানের স্থিতিশীলতাকে প্রভাবিত করে।[1]

রিলিজের পর কোনো গুরুতর রিগ্রেশন রেকর্ড করা হয়নি; সম্প্রদায় quantized সংস্করণের স্থিতিশীলতা উল্লেখ করে।[2]

নৈতিক ও নিয়ন্ত্রক দিক

Yi-Lightning-এ RAISE নিরাপত্তা ফ্রেমওয়ার্ক বাস্তবায়িত হয়েছে, যা চার স্তরের সুরক্ষা প্রদান করে:[8]

  • Pre-training পর্যায়ে বিষাক্ত কন্টেন্ট, PII এবং ক্ষতিকর উপকরণ ফিল্টারিং।
  • সংবেদনশীল অনুরোধ সঠিকভাবে পরিচালনার উদাহরণ সহ safety fine-tuning।
  • ইনপুট নিয়ন্ত্রণ (prompt শ্রেণীবিভাগ)।
  • আউটপুট নিয়ন্ত্রণ (উত্তর ফিল্টারিং)।

উন্মুক্ত মডেলের জন্য Apache 2.0 লাইসেন্স বাণিজ্যিক ব্যবহার অনুমতি দেয়; পৃথক হোস্টিং অতিরিক্ত প্রয়োজনীয়তা আরোপ করতে পারে। মডেলগুলো কর্পোরেট সমাধানের জন্য চীনা AI নিয়ন্ত্রক মানদণ্ড (CAICT সার্টিফিকেশন) পূরণ করে।[1][3]

সম্ভাবনা ও গবেষণার দিকনির্দেশনা

Yi সিরিজ প্যারামিটারের পরিমাণের চেয়ে ডেটার মানকে অগ্রাধিকার দেওয়ার পদ্ধতির কার্যকারিতা এবং হালকা স্কেলিংয়ের (continual pretraining, depth upscaling, MoE অপ্টিমাইজেশন) সম্ভাবনা প্রদর্শন করে।[1]

২০২৫ সালের পরে 01.AI-এর গুরুত্ব প্রায়োগিক সমাধানে সরে গেছে:[4]

  • মাল্টি-এজেন্ট সিস্টেম এবং enterprise প্ল্যাটফর্ম WorldWise LLM Platform 2.5।
  • কর্পোরেট workflow-এ তৃতীয় পক্ষের মডেলের (DeepSeek সহ) একীভূতকরণ।
  • deployment-এর খরচ কমাতে inference অপ্টিমাইজেশন (quantization, FP8)।

উন্মুক্ত মডেলগুলো গবেষণা, fine-tuning এবং distillation-এর জন্য সম্প্রদায় ব্যবহার করতে থাকে।[6]

সাহিত্য

সংযোগসমূহ

টীকা

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
  3. 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
  4. 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
  5. Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
  6. 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
  7. 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
  8. 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
  9. 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
  10. Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
  11. Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
  12. 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
  13. 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms