LLaMA (Meta AI) (BN)
LLaMA (Large Language Model Meta AI) — প্রধানত উন্মুক্ত সোর্স কোডসহ একটি বৃহৎ ভাষা মডেল (LLM) পরিবার, যা Meta AI-এর গবেষণা বিভাগ দ্বারা তৈরি করা হচ্ছে। LLaMA মডেলগুলো পরিবর্তিত transformer আর্কিটেকচারের উপর নির্মিত এবং উচ্চ কম্পিউটেশনাল দক্ষতা, অত্যাধুনিক AI প্রযুক্তিতে গণতান্ত্রিক প্রবেশাধিকার এবং বিশেষায়িত কাজে সহজ অভিযোজনের লক্ষ্যে পরিচালিত। এই পরিবারটি প্রাথমিক গবেষণামূলক রিলিজ LLaMA 1 (ফেব্রুয়ারি ২০২৩) থেকে মাল্টিমোডাল মডেল LLaMA 4 (২০২৬ সালে পরিকল্পিত রিলিজ) পর্যন্ত বিবর্তিত হয়েছে।
নামকরণ
LLaMA সংক্ষিপ্ত রূপটি Large Language Model Meta AI (বৃহৎ ভাষা মডেল Meta AI) থেকে এসেছে।
- Large Language Model — মডেলগুলোর বিশালতাকে নির্দেশ করে, যেগুলোর প্যারামিটার সংখ্যা কোটি থেকে শত কোটি পর্যন্ত পরিমাপ করা হয়।
- Meta AI — নির্মাতা প্রতিষ্ঠান Meta-এর গবেষণা দলকে নির্দেশ করে।
ইতিহাস
LLaMA-এর উন্নয়ন ২০২২ সালের শেষের দিকে শুরু হয়েছিল, OpenAI-এর ChatGPT-এর সাফল্যের প্রতি Meta-এর কৌশলগত প্রতিক্রিয়া হিসেবে। মার্ক জাকারবার্গ FAIR (Facebook AI Research) ল্যাবরেটরির গবেষকদের সমন্বয়ে একটি আন্তঃবিভাগীয় দল গঠন করেন। প্রকল্পের দর্শনে গুরুত্বপূর্ণ ভূমিকা পালন করেন FAIR-এর প্রধান ইয়ান লেকুন, যিনি ২০১৩ সাল থেকে ল্যাবরেটরির সমস্ত গবেষণা সম্পূর্ণ উন্মুক্ত রাখার নীতি অনুসরণ করে আসছেন।
প্রথম সংস্করণ, LLaMA 1, ফেব্রুয়ারি ২০২৩ সালে গবেষণা লাইসেন্সসহ প্রকাশিত হয়েছিল। রিলিজের কিছুক্ষণ পরে, মার্চ ২০২৩ সালে, মডেলের ওজন BitTorrent-এর মাধ্যমে ইন্টারনেটে ছড়িয়ে পড়ে। এই ঘটনাটি, উদ্বেগের বিপরীতে, প্রকল্পের অগ্রগতি থামায়নি, বরং তা ত্বরান্বিত করেছে, কারণ এটি বিশ্বজুড়ে স্বাধীন গবেষক এবং উৎসাহীদের মডেলটি নিয়ে পরীক্ষা-নিরীক্ষার সুযোগ দিয়েছে। ফলে Hugging Face প্ল্যাটফর্মে হাজার হাজার ডেরিভেটিভ মডেল তৈরি হয়েছে। পরবর্তী সংস্করণগুলো, LLaMA 2 থেকে শুরু করে, বাণিজ্যিক লাইসেন্সসহ প্রকাশিত হয়েছে[1], যা উন্মুক্ত AI মডেলের বাজারে LLaMA-কে একটি মূল খেলোয়াড় হিসেবে প্রতিষ্ঠিত করেছে।
মডেলের বিবর্তন এবং রিলিজের কালক্রম
| সংস্করণ | প্রকাশের তারিখ | প্যারামিটারের পরিসর | মূল উদ্ভাবন ও বৈশিষ্ট্য |
|---|---|---|---|
| LLaMA 1 | ফেব্রুয়ারি ২০২৩ | 7B – 65B | মূল আর্কিটেকচার (RMSNorm, SwiGLU, RoPE)। ১.৪ ট্রিলিয়ন token-এ প্রশিক্ষণ। Context window ২০৪৮ token। গবেষণা লাইসেন্স। |
| LLaMA 2 | জুলাই ২০২৩ | 7B – 70B | কথোপকথনের জন্য fine-tuning (RLHF)। Grouped-Query Attention (GQA) প্রবর্তন। Context window ৪০৯৬ token। প্রথম বাণিজ্যিক লাইসেন্স। |
| Code Llama | আগস্ট ২০২৩ | 7B – 70B | কোডের জন্য বিশেষায়িত সংস্করণ। ৫০০ বিলিয়ন token কোডে fine-tuning। ভেরিয়েন্ট: বেস, Python-বিশেষায়িত, instruction-tuned। |
| LLaMA 3 | এপ্রিল ২০২৪ | 8B, 70B | ১৫ ট্রিলিয়ন token-এ প্রশিক্ষণ। ১২৮ হাজার token-এর vocabulary সহ উন্নত tokenizer। উচ্চ কর্মক্ষমতা (MMLU-তে ৮২%)। |
| LLaMA 3.1 | জুলাই ২০২৪[2] | 8B, 70B, 405B | GPT-4o-এর সমতুল্য কর্মক্ষমতাসম্পন্ন ফ্ল্যাগশিপ মডেল 405B। Context window ১২৮ হাজার token পর্যন্ত। ছবি প্রক্রিয়াকরণের সক্ষমতা যুক্ত হয়েছে। |
| LLaMA 4 | (পরিকল্পনা: এপ্রিল ২০২৫) | 109B (Scout), 400B (Maverick), 2T (Behemoth) | Mixture-of-Experts (MoE) আর্কিটেকচার। নেটিভ মাল্টিমোডালিটি (টেক্সট, ছবি, ভিডিও)। Context window ১০ মিলিয়ন token পর্যন্ত। |
আর্কিটেকচার
LLaMA অটোরিগ্রেসিভ decoder-only transformer আর্কিটেকচার ব্যবহার করে, তবে কম্পিউটেশনাল দক্ষতা এবং উৎপন্ন টেক্সটের মান উন্নত করে এমন কিছু গুরুত্বপূর্ণ উন্নতি প্রবর্তন করে:
- Pre-normalization (পূর্ব-নরমালাইজেশন)। নরমালাইজেশন transformer-এর প্রতিটি সাব-লেয়ারের আউটপুটে নয়, ইনপুটে প্রয়োগ করা হয়। এই পদ্ধতি অত্যন্ত গভীর নেটওয়ার্কের প্রশিক্ষণকে স্থিতিশীল করে এবং gradient সমস্যা প্রতিরোধ করে।
- RMSNorm (Root Mean Square Layer Normalization)। স্ট্যান্ডার্ড LayerNorm-এর পরিবর্তে RMSNorm ব্যবহার করা হয়। এই নরমালাইজেশন কৌশলটি গড় বিয়োগের অপারেশন বাদ দেয়, যা স্থিতিশীলতা বজায় রেখে গণনাকে ১০–৫০% ত্বরান্বিত করে।
- SwiGLU (Swish-Gated Linear Unit)। ReLU বা GELU-এর পরিবর্তে activation function হিসেবে SwiGLU ব্যবহার করা হয়। এই gating mechanism আরও মসৃণ gradient প্রবাহ তৈরি করে এবং মডেলের মান উন্নত করে।
- RoPE (Rotary Position Embeddings, ঘূর্ণায়মান অবস্থানগত embedding)। Token-এর অবস্থান এনকোড করতে আপেক্ষিক অবস্থানগত embedding RoPE ব্যবহার করা হয়, যা মডেলকে প্রশিক্ষণে ব্যবহৃত দৈর্ঘ্যের চেয়ে বেশি দীর্ঘ ক্রমগুলোতে আরও ভালোভাবে এক্সট্রাপোলেট করতে সক্ষম করে।
- GQA (Grouped-Query Attention)। LLaMA 2-তে প্রবর্তিত এই কৌশলটি মাল্টি-হেড attention-এর একটি অপ্টিমাইজেশন, যা মেমোরির প্রয়োজনীয়তা উল্লেখযোগ্যভাবে হ্রাস করে এবং টেক্সট জেনারেশন ত্বরান্বিত করে।
- Mixture-of-Experts (MoE) (LLaMA 4-এ পরিকল্পিত)। এই আর্কিটেকচার মডেলের প্যারামিটারগুলোকে "বিশেষজ্ঞ" সাব-নেটওয়ার্কে বিভক্ত করে, প্রতিটি অনুরোধের জন্য কেবল একটি ছোট অংশ সক্রিয় করে। এটি inference-এর কম্পিউটেশনাল খরচ উল্লেখযোগ্যভাবে হ্রাস করে।
LLaMA 1-এর কনফিগারেশন
| মডেল | প্যারামিটার | হিডেন স্টেটের মাত্রা | লেয়ারের সংখ্যা | Attention হেডের সংখ্যা | প্রশিক্ষণ ডেটার পরিমাণ |
|---|---|---|---|---|---|
| 7B | 6.7B | 4096 | 32 | 32 | 1.0T token |
| 13B | 13.0B | 5120 | 40 | 40 | 1.0T token |
| 33B | 32.5B | 6656 | 60 | 52 | 1.4T token |
| 65B | 65.2B | 8192 | 80 | 64 | 1.4T token |
প্রশিক্ষণ ডেটা
প্রশিক্ষণ কর্পাসের আয়তন LLaMA 1-এর জন্য ১.৪ ট্রিলিয়ন token থেকে LLaMA 3-এর জন্য ১৫ ট্রিলিয়ন token পর্যন্ত বৃদ্ধি পেয়েছে। প্রশিক্ষণের জন্য সর্বজনীনভাবে উপলব্ধ উৎস ব্যবহার করা হয়, যার মধ্যে রয়েছে Common Crawl (ডেটার ৬৭% পর্যন্ত), C4, GitHub, Wikipedia, Books, ArXiv এবং Stack Exchange। LLaMA 3-এর জন্য উচ্চমানের বেসরকারি ডেটাও ব্যবহার করা হয়েছিল।
কর্মক্ষমতা এবং তুলনা
- benchmark-এ: LLaMA 3.1 (405B) মডেল GPT-4o-এর কাছাকাছি ফলাফল দেখায়: MMLU পরীক্ষায় এটি ৮৮.৬% অর্জন করে, GPT-4o-এর চেয়ে মাত্র ০.১ শতাংশ পয়েন্ট পিছিয়ে। কোড জেনারেশন টাস্ক HumanEval-এ LLaMA 3.1 ৮৯% দেখায় (GPT-4o — ৯০.২%)।
- প্যারামিট্রিক দক্ষতা: কম প্যারামিটারের LLaMA মডেলগুলো প্রায়ই প্রতিযোগীদের বড় মডেলকে ছাড়িয়ে যায়। উদাহরণস্বরূপ, LLaMA 1 (13B) বেশিরভাগ পরীক্ষায় GPT-3 (175B)-কে ছাড়িয়ে গেছে।
- খরচ: স্থানীয়ভাবে হোস্ট করা হলে LLaMA-এর inference খরচ মালিকানাধীন API ব্যবহারের তুলনায় ৫০ গুণ পর্যন্ত কম হতে পারে, যা প্রযুক্তিটিকে ক্ষুদ্র ও মাঝারি ব্যবসার জন্য সুলভ করে তোলে।
লাইসেন্সিং
- LLaMA 1 অনুরোধের ভিত্তিতে প্রবেশাধিকারসহ অবাণিজ্যিক গবেষণা লাইসেন্সের অধীনে বিতরণ করা হয়েছিল।
- LLaMA 2 এবং পরবর্তী সংস্করণগুলো Llama Community License-এর অধীনে বিতরণ করা হয়, যা বাণিজ্যিক ব্যবহার এবং পরিবর্তনের অনুমতি দেয়। তবে লাইসেন্সে বিধিনিষেধ রয়েছে: মাসে ৭০০ মিলিয়নেরও বেশি সক্রিয় ব্যবহারকারী আছে এমন কোম্পানিগুলোকে Meta-এর কাছ থেকে বিশেষ অনুমতি নিতে হবে। এটি LLaMA সম্পূর্ণ উন্মুক্ত মডেল কিনা তা নিয়ে বিতর্কের জন্ম দেয়।
প্রয়োগ
LLaMA মডেলগুলো হাজার হাজার কোম্পানির পণ্যে একীভূত হয়েছে এবং বিভিন্ন ক্ষেত্রে ব্যবহৃত হচ্ছে:
- কর্পোরেট সেক্টর: Zoom মিটিং সারসংক্ষেপের জন্য AI Companion-এ LLaMA ব্যবহার করে; Shopify পণ্যের মেটাডেটা সমৃদ্ধ করতে প্রতিদিন ৪০–৬০ মিলিয়ন অনুরোধ প্রক্রিয়া করতে; Instacart অভ্যন্তরীণ সহকারী Ava-তে।
- বিজ্ঞান ও সমাজ: Meditron (LLaMA-এর একটি অভিযোজন) সীমিত সম্পদের অঞ্চলে চিকিৎসা নির্ণয়ের জন্য ব্যবহৃত হয়;
- সরকারি খাত ও শিল্প: Meta, Lockheed Martin এবং Palantir-এর সাথে অংশীদারিত্ব করেছে। NASA আন্তর্জাতিক মহাকাশ স্টেশনে (ISS) পৃথিবীর সাথে যোগাযোগ ছাড়াই গুরুত্বপূর্ণ অপারেশন সম্পাদনের জন্য অফলাইন সহকারী হিসেবে LLaMA 3 ব্যবহার করে।
সীমাবদ্ধতা ও সমালোচনা
- পক্ষপাত এবং নিরাপত্তা: স্বাধীন নিরীক্ষায় দেখা গেছে যে LLaMA মডেলগুলো, নিরাপত্তা ব্যবস্থা থাকা সত্ত্বেও, ক্ষতিকর স্টেরিওটাইপ পুনরুৎপাদন করতে পারে। LLaMA 1-এর ওজন ফাঁস হওয়া প্রযুক্তির সম্ভাব্য দূরভিসন্ধিমূলক ব্যবহার সম্পর্কে প্রশ্ন তীব্র করেছে।
- জ্ঞানের ফাঁক: অত্যন্ত বিশেষায়িত ক্ষেত্রে LLaMA দুর্বলতা প্রদর্শন করতে পারে। উদাহরণস্বরূপ, চিকিৎসা পরীক্ষা nephSAP-এ নির্ভুলতা ছিল ১৭–৩০%, যেখানে GPT-4 ৭৩% অর্জন করেছে।
- শক্তি খরচ: বড় মডেলের প্রশিক্ষণে বিশাল সম্পদ প্রয়োজন। LLaMA 1-এর প্রশিক্ষণে ২,৬৩৮ MWh বিদ্যুৎ প্রয়োজন হয়েছিল, যা ১,০১৫ টন CO₂ নির্গমনের সমতুল্য।
ভবিষ্যৎ
Meta ২০২৫ সালের মধ্যে AI অবকাঠামোতে ৬৫ বিলিয়ন ডলার পর্যন্ত বিনিয়োগ করার পরিকল্পনা করছে। ২ ট্রিলিয়ন প্যারামিটারের মডেল LLaMA 4 Behemoth উন্নয়নাধীন রয়েছে, যা ২০০টিরও বেশি ভাষা সমর্থন করবে এবং মেটাভার্স পণ্যগুলোর সাথে গভীরভাবে একীভূত হবে।
সাহিত্য
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
- Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
- Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
- Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.
টীকা
- ↑ Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
- ↑ LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.
আরও দেখুন
- GPT
- বৃহৎ ভাষা মডেল
- Transformer (নিউরাল নেটওয়ার্ক আর্কিটেকচার)