DBRX (language model) (BN)
DBRX — এটি একটি উন্মুক্ত বৃহৎ ভাষা মডেল (LLM), যা Databricks কোম্পানির অন্তর্গত Mosaic AI গবেষণা দল কর্তৃক তৈরি করা হয়েছে। মডেলটি আনুষ্ঠানিকভাবে ২০২৪ সালের ২৭ মার্চ প্রকাশিত হয়েছে এবং এটিকে কর্পোরেট ব্যবহারের জন্য একটি উচ্চ-কার্যক্ষমতাসম্পন্ন সমাধান হিসেবে উপস্থাপন করা হয়েছে[1]।
DBRX একটি সূক্ষ্ম-দানাদার মিশ্রণ-of-বিশেষজ্ঞ (MoE) আর্কিটেকচারের উপর নির্মিত এবং এটি উচ্চ কার্যক্ষমতার সাথে প্রশিক্ষণ ও inference-এর দক্ষতার সমন্বয় ঘটায়। প্রকাশের সময় DBRX মূল benchmark-গুলোতে সমস্ত উন্মুক্ত মডেলের মধ্যে সেরা ফলাফল প্রদর্শন করেছিল, LLaMA 2, Mixtral এবং Grok-1-এর মতো মডেলগুলোকে ছাড়িয়ে গিয়েছিল এবং GPT-3.5 Turbo স্তরের বন্ধ মডেলগুলোর সাথে প্রতিযোগিতামূলক ফলাফল দেখিয়েছিল[2]।
উন্নয়নের ইতিহাস
DBRX-এর আবির্ভাব ছিল উন্মুক্ত জেনারেটিভ মডেল উন্নয়নে Databricks-এর কৌশলের ধারাবাহিকতা। ২০২৩ সালের জুন মাসে Databricks MosaicML স্টার্টআপটি অধিগ্রহণ করে, যেটি বৃহৎ মডেল প্রশিক্ষণে বিশেষজ্ঞ ছিল, এবং এর ভিত্তিতে Mosaic AI বিভাগ গঠন করা হয়[3]।
প্রধান নিউরাল নেটওয়ার্ক আর্কিটেক্ট জোনাথান ফ্র্যাঙ্কলের নেতৃত্বে Mosaic AI দল একটি নতুন বৃহৎ LLM তৈরির কাজ শুরু করে, যার লক্ষ্য ছিল উন্মুক্ত বিন্যাসে সেরা মালিকানাধীন সিস্টেমগুলোর সমকক্ষ মান অর্জন করা। প্রকল্পটির নাম দেওয়া হয় DBRX। মডেলের উন্নয়ন ও প্রি-ট্রেনিং প্রায় ২.৫ মাস সময় নিয়েছিল এবং আনুমানিক $১০ মিলিয়ন খরচ হয়েছিল বলে ধারণা করা হয়[3]।
আর্কিটেকচার
DBRX একটি decoder-only ট্রান্সফর্মার মডেল এবং এটি মিশ্রণ-of-বিশেষজ্ঞ (MoE)-এর একটি সূক্ষ্ম-দানাদার (fine-grained) আর্কিটেকচার বাস্তবায়ন করে।
আর্কিটেকচারের মূল বৈশিষ্ট্যসমূহ:
- মোট parameter সংখ্যা: ১৩২ বিলিয়ন।
- বিশেষজ্ঞ: মডেলটি ১৬টি ছোট বিশেষায়িত সাব-মডেল («বিশেষজ্ঞ») নিয়ে গঠিত।
- সক্রিয়করণ পদ্ধতি: প্রতিটি ইনপুট token-এর জন্য ১৬টি বিশেষজ্ঞের মধ্যে কেবল ৪টি সক্রিয় হয়। এর অর্থ হলো inference-এর সময় কেবল ৩৬ বিলিয়ন parameter সক্রিয় থাকে, যা উচ্চ গতি ও দক্ষতা নিশ্চিত করে। এই পদ্ধতি Mixtral মডেলের (৮ বিশেষজ্ঞ, ২টি সক্রিয়) তুলনায় ৬৫ গুণ বেশি সম্ভাব্য বিশেষজ্ঞ সমন্বয় প্রদান করে[1]।
- উপাদানসমূহ: আধুনিক আর্কিটেকচারাল সমাধান ব্যবহার করা হয়েছে, যেমন রোটারি পজিশনাল embedding (RoPE), gated linear units (GLU) এবং grouped query attention (GQA)।
- প্রসঙ্গ দৈর্ঘ্য: ৩২,৭৬৮ token।
এই আর্কিটেকচার মডেলটিকে বিপুল সংখ্যক parameter-এর সুবিধা (জ্ঞান সংরক্ষণের জন্য) এবং ছোট মডেলের দক্ষতার (আউটপুটের গতির জন্য) সমন্বয় করতে সক্ষম করে।
প্রশিক্ষণ
DBRX-এর প্রি-ট্রেনিং সতর্কতার সাথে কিউরেট করা ১২ ট্রিলিয়ন token-এর একটি dataset-এ পরিচালিত হয়েছিল, যা টেক্সট ও কোড নিয়ে গঠিত। ডেটার মান ছিল মূল অগ্রাধিকার: ডেভেলপাররা ডেটা পরিষ্কার, প্রস্তুতি ও নিরীক্ষার জন্য Databricks ক্লাউড প্ল্যাটফর্ম (Apache Spark, Databricks Notebooks, Unity Catalog) ব্যবহার করেছেন[1]।
প্রশিক্ষণে curriculum learning পদ্ধতি প্রয়োগ করা হয়েছিল, যেখানে বিভিন্ন পর্যায়ে ডেটার ধরনের অনুপাত পরিবর্তন করা হয়েছিল। উদাহরণস্বরূপ, প্রশিক্ষণের চূড়ান্ত অংশ জটিল কার্যক্রমের ক্রমান্বয়ে প্রবর্তনে নিবেদিত ছিল, যা ডেভেলপারদের মতে মানের উল্লেখযোগ্য উন্নতি দিয়েছে। প্রশিক্ষণ ৩,০৭২টি Nvidia H100 GPU-এর একটি ক্লাস্টারে পরিচালিত হয়েছিল।
প্রি-ট্রেনিংয়ের পরে মূল মডেলটি অতিরিক্ত fine-tuning (instruction tuning) প্রক্রিয়ার মধ্য দিয়ে গেছে, যার ফলে ব্যবহারকারীর নির্দেশ পালনের জন্য অপ্টিমাইজ করা ইন্টারেক্টিভ সংস্করণ DBRX Instruct তৈরি হয়েছে।
কার্যক্ষমতা
প্রকাশের সময় DBRX বিস্তৃত benchmark-এ উন্মুক্ত LLM-এর জন্য মানের নতুন মানদণ্ড স্থাপন করেছিল।
উন্মুক্ত মডেলগুলোর সাথে তুলনা
| Benchmark | কার্যক্রম | DBRX Instruct | পরবর্তী সেরা (Mixtral/Grok-1) |
|---|---|---|---|
| Hugging Face Open LLM Leaderboard (AVG) | সাধারণ জ্ঞান | 74,5% | 72,7% (Mixtral Instruct) |
| HumanEval | প্রোগ্রামিং | 70,1% | 63,2% (Grok-1) |
| GSM8K | গাণিতিক যুক্তি | 66,9% | 62,9% (Grok-1) |
| MMLU | সাধারণ জ্ঞান | 73,7% | 71,5% (Mixtral Instruct) |
DBRX Hugging Face Open LLM Leaderboard-এর সামগ্রিক র্যাংকিং এবং Databricks LLM Gauntlet-এর ব্যাপক পরীক্ষা উভয়েই প্রথম স্থান অর্জন করেছে এবং পূর্ববর্তীদের থেকে উল্লেখযোগ্য ব্যবধান প্রদর্শন করেছে[1]।
বন্ধ মডেলগুলোর সাথে তুলনা
DBRX Instruct MMLU (৭৩.৭% বনাম ৭০.০%) এবং HumanEval (৭০.১% বনাম ৪৮.১%) সহ বেশ কিছু মূল সূচকে GPT-3.5 Turbo-কে ছাড়িয়ে যায়। কিছু benchmark-এ (যেমন MTBench) উত্তরের মানের দিক থেকে মডেলটি Gemini 1.0 Pro এবং GPT-4-এর প্রাথমিক সংস্করণের স্তরের কাছাকাছি পৌঁছেছে[1]।
প্রশিক্ষণ ও inference-এর দক্ষতা
- প্রশিক্ষণের দক্ষতা: MoE আর্কিটেকচার ব্যবহার সমতুল্য মানের ঘন মডেলগুলোর তুলনায় FLOPS-এ ২-৪ গুণ খরচ কমাতে সক্ষম করেছে।
- Inference-এর দক্ষতা: কেবল ৩৬ বিলিয়ন parameter সক্রিয় করার মাধ্যমে DBRX সমতুল্য আকারের ঘন মডেলগুলোর (যেমন LLaMA2-70B) তুলনায় ২-৩ গুণ বেশি থ্রুপুট (আউটপুটের গতি) প্রদান করে[1]।
লাইসেন্সিং ও প্রাপ্যতা
DBRX বিশেষভাবে তৈরি করা Databricks Open Model License-এর অধীনে বিতরণ করা হয়। এটি বাণিজ্যিক ব্যবহার সহ মুক্ত ব্যবহার ও পরিবর্তনের অনুমতি দেয়, তবে কিছু বিধিনিষেধ রয়েছে। বিশেষত, LLaMA 2-এর লাইসেন্সের মতোই, DBRX-ভিত্তিক পরিষেবাগুলো মাসে ৭০০ মিলিয়ন-এর বেশি সক্রিয় ব্যবহারকারীর কাছে পৌঁছালে Databricks-এর কাছ থেকে আলাদা অনুমতি নিতে হবে।
মডেলের প্রি-ট্রেন করা ওজন (মূল ও Instruct সংস্করণ উভয়) Hugging Face-এর রিপোজিটরির মাধ্যমে ডাউনলোডের জন্য উপলব্ধ[4]।
সাহিত্য
- Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
- Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
- Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
- Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
- Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.
টীকা
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [১]
- ↑ «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [২]
- ↑ 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [৩]
- ↑ «databricks/dbrx-base». Hugging Face. [৪]