PaLM (Pathways Language Model) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

PaLM (Pathways Language Model) — এটি Google কোম্পানির তৈরি বৃহৎ ভাষা মডেলের (LLM) একটি পরিবার। ২০২২ সালের এপ্রিলে উপস্থাপিত মডেলের প্রথম সংস্করণে ৫৪০ বিলিয়ন প্যারামিটার ছিল এবং এটি তৎকালীন বিশ্বের অন্যতম বৃহত্তম ভাষা মডেল হিসেবে স্বীকৃত হয়, যা বিশাল মাত্রায় স্কেলিংয়ের ফলে যুগান্তকারী সক্ষমতা প্রদর্শন করেছিল[1]

PaLM-এর মূল প্রযুক্তিগত ভিত্তি হলো Pathways — Google-এর Machine Learning সিস্টেমের একটি নতুন আর্কিটেকচার, যা হাজার হাজার অ্যাক্সেলারেটর চিপে বিতরণকৃত গণনা কার্যকরভাবে সমন্বয় করতে সক্ষম[2]। PaLM এই সিস্টেমের প্রথম বৃহৎ মাত্রার প্রদর্শনী হয়ে ওঠে এবং বিশাল স্কেলে অভূতপূর্ব প্রশিক্ষণ দক্ষতা প্রদর্শন করে।

Pathways সিস্টেম: স্কেলিংয়ের ভিত্তি

২০২১ সালে Google কর্তৃক উপস্থাপিত Pathways ধারণাটি এমন একটি একক নিউরাল নেটওয়ার্ক তৈরির লক্ষ্য নিয়ে গঠিত, যা বিভিন্ন ডোমেনে কার্যকরভাবে জ্ঞান সাধারণীকরণ করতে এবং একই সাথে হাজারো কাজ সম্পাদন করতে পারে। PaLM এই সিস্টেমের প্রথম বৃহৎ মাত্রার প্রয়োগ হয়ে ওঠে: এর প্রশিক্ষণ দুটি ক্লাউড ক্লাস্টারে (TPU v4 Pods) একত্রিত ৬১৪৪ বিশেষায়িত প্রসেসর TPU v4-এ সমান্তরালভাবে পরিচালিত হয়েছিল[1]

তৈরির সময় এটি ছিল একটি মডেল প্রশিক্ষণে ব্যবহৃত TPU-এর বৃহত্তম কনফিগারেশন। সিস্টেমটি হার্ডওয়্যার সক্ষমতা ব্যবহারে রেকর্ড দক্ষতা অর্জন করে (৫৭.৮% FLOPs), যা পূর্ববর্তী প্রকল্পগুলিকে স্কেলে উল্লেখযোগ্যভাবে ছাড়িয়ে যেতে এবং অর্ধ ট্রিলিয়নেরও বেশি প্যারামিটার সহ একটি মডেল সফলভাবে প্রশিক্ষণ দিতে সক্ষম করেছিল[3]

আর্কিটেকচার এবং প্রশিক্ষণ ডেটা

মডেলের আর্কিটেকচার

PaLM হলো একটি ঘন (অবিরল) ভাষা মডেল যা "শুধুমাত্র-ডিকোডার" (decoder-only) আর্কিটেকচার সহ, যা GPT সিরিজের মডেলের অনুরূপ। এই আর্কিটেকচারটি পরবর্তী token পূর্বাভাস দেওয়ার কাজে নিবেদিত এবং টেক্সট জেনারেশনের জন্য উপযুক্ত। স্ট্যান্ডার্ড transformer আর্কিটেকচারের বিপরীতে, PaLM দক্ষতা বৃদ্ধির জন্য বেশ কয়েকটি মূল পরিবর্তন ব্যবহার করে[1]:

  • সমান্তরাল স্তর: Attention মেকানিজম এবং ফুলি-কানেক্টেড স্তরগুলি সমান্তরালভাবে গণনা করা হয়, যা প্রশিক্ষণকে প্রায় ১৫% ত্বরান্বিত করেছে।
  • SwiGLU অ্যাক্টিভেশন: স্ট্যান্ডার্ড ReLU-এর পরিবর্তে SwiGLU অ্যাক্টিভেশন ফাংশন ব্যবহার, যা মডেলের মান উল্লেখযোগ্যভাবে উন্নত করেছে।

প্রশিক্ষণ ডেটা

PaLM ৭৮০ বিলিয়ন token-এর একটি উচ্চমানের ডেটা সংগ্রহে প্রশিক্ষিত হয়েছিল। ডেটাসেটটি বহুভাষিক এবং বৈচিত্র্যময় ছিল, যার মধ্যে অন্তর্ভুক্ত[1]:

  • উচ্চমানের ওয়েব নথি এবং বই।
  • উইকিপিডিয়া নিবন্ধ।
  • সামাজিক নেটওয়ার্ক থেকে সংলাপ (সংগ্রহের ৫০%)।
  • GitHub থেকে সোর্স কোড (সংগ্রহের ৫%)।

প্রায় ৭৮% ডেটা ইংরেজিতে ছিল এবং বাকি ২২% ছিল বহুভাষিক সংগ্রহ। Tokenization-এর জন্য একটি বিশেষ "ক্ষতিহীন" পদ্ধতি ব্যবহার করা হয়েছিল, যা সমস্ত স্পেস সংরক্ষণ করত (কোডের জন্য অত্যন্ত গুরুত্বপূর্ণ) এবং অচেনা Unicode অক্ষরগুলিকে বাইটে বিভক্ত করত।

সক্ষমতা এবং ফলাফল

এমার্জেন্ট ক্ষমতা এবং few-shot শিক্ষণ

PaLM প্রদর্শন করেছে যে মডেলের মাত্রা, ডেটার পরিমাণ এবং গণনা শক্তি বৃদ্ধি এমার্জেন্ট (অপ্রত্যাশিতভাবে উদ্ভূত) ক্ষমতার দিকে নিয়ে যেতে পারে। অনেক কাজে মডেলের কার্যক্ষমতা কেবলমাত্র সর্বোচ্চ মাত্রায় পৌঁছানোর পরেই দ্রুত এবং অরৈখিকভাবে বৃদ্ধি পেয়েছিল, যা পূর্বে কখনো পর্যবেক্ষণ করা হয়নি এমন নতুন সক্ষমতার উদ্ভবের ইঙ্গিত দেয়[3]

মডেলটি few-shot শিক্ষণ মোডে মূল্যায়ন করা হয়েছিল (fine-tuning ছাড়া, prompt-এ কয়েকটি উদাহরণ সহ) এবং ২৯টি জনপ্রিয় NLP benchmark-এর মধ্যে ২৮টিতে পূর্ববর্তী বড় মডেলগুলিকে (যেমন GPT-3 এবং LaMDA) ছাড়িয়ে গেছে। জটিল কাজের সংগ্রহ BIG-bench-এ PaLM প্রথম মডেল হয়ে উঠেছে যার ফলাফল মানব পরীক্ষকদের গড় স্তর অতিক্রম করেছে[1]

Chain-of-Thought রিজনিং

PaLM-এর সবচেয়ে উল্লেখযোগ্য অর্জনগুলির মধ্যে একটি হলো "chain-of-thought prompting" কৌশল ব্যবহার করে বহু-ধাপীয় যৌক্তিক রিজনিং করার ক্ষমতা[1]। এই পদ্ধতিতে মডেলকে এমন উদাহরণ দেওয়া হয় যেখানে কাজের সমাধান ধাপে ধাপে বর্ণনা করা থাকে। এই ধরনের উদাহরণে প্রশিক্ষিত হয়ে, PaLM নতুন জটিল কাজ সমাধানের জন্য নিজস্ব "চিন্তার শৃঙ্খল" তৈরি করতে সক্ষম হয়েছে, যেমন:

  • গণিতের সমস্যা: GSM8K পরীক্ষায় (প্রাথমিক বিদ্যালয়ের স্তরের সমস্যা) PaLM ৫৮% সমস্যা সমাধান করেছে, যা fine-tuned মডেলের দ্বারা অর্জিত পূর্ববর্তী state-of-the-art ফলাফলকে ছাড়িয়ে গেছে।
  • সাধারণ জ্ঞানের কাজ: মডেলটি অ-তুচ্ছ সমস্যার জন্য বিস্তারিত ব্যাখ্যা তৈরি করতে পেরেছে, উদাহরণস্বরূপ, পূর্বে দেখা যায়নি এমন কৌতুকের ব্যাখ্যা প্রদান করতে।

এই ক্ষমতা মডেলের "চিন্তা" প্রক্রিয়াকে আরো স্বচ্ছ এবং মানবিক চিন্তার মতো করে তুলেছে।

কোড জেনারেশন এবং বহুভাষিকতা

যদিও সোর্স কোড প্রশিক্ষণ ডেটার মাত্র ৫% ছিল, PaLM কোড জেনারেশন এবং রূপান্তরের কাজে OpenAI-এর বিশেষায়িত মডেল Codex-এর সাথে তুলনীয় স্তর প্রদর্শন করেছে। মডেলটি অনুবাদসহ বহুভাষিক কাজেও শক্তিশালী সক্ষমতা প্রদর্শন করেছে[3]

বিবর্তন এবং উত্তরসূরি: PaLM পরিবার

PaLM Google কর্তৃক তৈরি মডেলের একটি সম্পূর্ণ পরিবারের ভিত্তি হয়ে উঠেছে।

PaLM 2

২০২৩ সালের মে মাসে উপস্থাপিত PaLM 2 একটি আরো দক্ষ এবং বহুভাষিক উত্তরসূরি হয়ে উঠেছে। প্যারামিটারের সংখ্যার পিছনে না ছুটে, প্রশিক্ষণ ডেটার মান এবং আর্কিটেকচারের দক্ষতার উপর জোর দেওয়া হয়েছে। PaLM 2 ১০০টিরও বেশি ভাষার টেক্সটে প্রশিক্ষিত এবং যুক্তি, প্রোগ্রামিং ও অনুবাদে উন্নত সক্ষমতা প্রদর্শন করে[4]। মডেলটি চারটি আকারে (সবচেয়ে ছোট থেকে বড়) প্রকাশিত হয়: Gecko, Otter, Bison এবং Unicorn। সবচেয়ে কম্প্যাক্ট ভেরিয়েন্ট (Gecko) অফলাইন মোডে মোবাইল ডিভাইসে চলার জন্য যথেষ্ট হালকা।

বিশেষায়িত সংস্করণ

PaLM এবং PaLM 2-এর উপর ভিত্তি করে নির্দিষ্ট ডোমেনের জন্য সংস্করণ তৈরি করা হয়েছে:

  • Med-PaLM 2: চিকিৎসার জন্য বিশেষায়িত মডেল। মার্কিন যুক্তরাষ্ট্রের চিকিৎসক লাইসেন্স পরীক্ষার প্রশ্নে (USMLE) বিশেষজ্ঞ স্তর অর্জনকারী প্রথম AI সিস্টেম হয়ে উঠেছে[4]
  • Sec-PaLM 2: সাইবারসিকিউরিটি-কেন্দ্রিক মডেল, যা দুর্বলতা শনাক্ত করতে এবং ক্ষতিকর কোড বিশ্লেষণ করতে প্রশিক্ষিত[5]

PaLM-E: মাল্টিমোডাল সংস্করণ

PaLM-E (Pathways Language Model Embodied) — এটি একটি মাল্টিমোডাল মডেল যা PaLM ভাষা মডেলকে Vision Transformer (ViT)-এর দৃশ্যমান ডেটার সাথে একত্রিত করে। এটি মডেলকে টেক্সট এবং চিত্র উভয়ই প্রক্রিয়া করতে সক্ষম করে, ভৌত জগতের সাথে সম্পর্কিত কাজ সমাধান করতে, উদাহরণস্বরূপ, রোবট নিয়ন্ত্রণের জন্য[6]

নৈতিক দিক এবং সীমাবদ্ধতা

PaLM-এর নির্মাতারা বৃহৎ ভাষা মডেল তৈরিতে দায়িত্বশীল পদ্ধতির প্রয়োজনীয়তার উপর জোর দেন। আনুষ্ঠানিক বৈজ্ঞানিক নিবন্ধে মডেলকৃত টেক্সটে সম্ভাব্য পক্ষপাত এবং বিষাক্ততার বিশ্লেষণ করা হয়েছিল। স্বচ্ছতা নিশ্চিত করতে Google PaLM-এর জন্য মডেল কার্ড (Model Card) এবং ডেটা পাসপোর্ট (Datasheet) প্রকাশ করেছে, যেখানে dataset-এর বৈশিষ্ট্য, পরীক্ষার ফলাফল এবং চিহ্নিত সীমাবদ্ধতাগুলি নথিভুক্ত করা হয়েছে[1]। এই পদক্ষেপগুলি দায়িত্বশীল AI-এর আধুনিক অনুশীলনের সাথে সামঞ্জস্যপূর্ণ এবং পক্ষপাত ও ক্ষতিকর কন্টেন্ট জেনারেশন সম্পর্কিত ঝুঁকি হ্রাস করার লক্ষ্যে প্রণীত।

তথ্যসূত্র

  • PaLM সম্পর্কে Google-এর অফিসিয়াল ব্লগ
  • ডেভেলপারদের জন্য PaLM API

সাহিত্য

  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
  • Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
  • Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
  • Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
  • Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.

টীকা

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [১]
  2. «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [২]
  3. 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [৩]
  4. 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [৪]
  5. «New AI capabilities that can help address your security challenges». Google Cloud Blog. [৫]
  6. «PaLM-E: An embodied multimodal language model». Google Research Blog. [৬]