Google's large language models — Google-এর বৃহৎ ভাষা মডেল

From Systems analysis Wiki
Jump to navigation Jump to search

Google-এর বৃহৎ ভাষা মডেল — এটি Google-এর বিভিন্ন বিভাগ কর্তৃক তৈরি বৃহৎ ভাষা মডেলের (LLM) একটি সিরিজ, যার মধ্যে রয়েছে Google AI (পূর্বে Google Brain নামে পরিচিত) এবং DeepMind। গভীর শিক্ষণ (deep learning) এবং Transformer আর্কিটেকচারের ক্ষেত্রে অন্যতম পথিকৃৎ হিসেবে Google আধুনিক LLM-এর বিকাশে মৌলিক অবদান রেখেছে। এই মডেলগুলোর বিকাশের ইতিহাস সংকীর্ণ বিশেষায়িত ভাষা বোঝার ব্যবস্থা থেকে শুরু করে বৃহৎ মাল্টিমোডাল ও এজেন্টিক সিস্টেম পর্যন্ত একটি পথচলার প্রতিফলন, যা Google-এর অনেক পণ্যের ভিত্তি গঠন করে এবং সমগ্র AI শিল্পের বিকাশের গতিপথ নির্ধারণ করে।

Google মডেলের ইতিহাস ও বিবর্তন

প্রাথমিক অর্জন এবং নিউরাল নেটওয়ার্কভিত্তিক অনুবাদ (২০১১–২০১৬)

Google-এ LLM বিকাশের ভিত্তি স্থাপিত হয়েছিল Google Brain প্রকল্পের (২০১১) আওতায়, যা গভীর নিউরাল নেটওয়ার্কের প্রয়োগের উপর দৃষ্টি নিবদ্ধ করেছিল। প্রথম দিককার অগ্রগতির একটি ছিল Word2Vec (২০১৩) অ্যালগরিদম, যা টমাশ মিকোলভ তৈরি করেছিলেন। এটি শব্দগুলোকে ভেক্টর (embedding) হিসেবে উপস্থাপন করার সুযোগ দিয়েছিল, যা তাদের আর্থগত প্রেক্ষাপট প্রতিফলিত করে এবং নিউরাল নেটওয়ার্কে ভাষা বোঝার জন্য একটি মৌলিক পদ্ধতি হয়ে উঠেছিল।

পরবর্তী পদক্ষেপ ছিল seq2seq (২০১৪)-এর মতো ক্রম মডেলে রূপান্তর, যা Google Neural Machine Translation (GNMT) (২০১৬)-এর ভিত্তি হয়ে ওঠে। LSTM-ভিত্তিক নিউরাল নেটওয়ার্ক আর্কিটেকচারে Google Translate-এর স্থানান্তর মেশিন অনুবাদের মান উল্লেখযোগ্যভাবে উন্নত করেছিল। একই সময়ে, ২০১৪ সালে Google কর্তৃক অধিগ্রহণ করা সহযোগী প্রতিষ্ঠান DeepMind বিশ্ব গো চ্যাম্পিয়নের বিরুদ্ধে AlphaGo সিস্টেমের বিজয়ের মাধ্যমে গভীর শিক্ষণের শক্তি প্রদর্শন করেছিল, যা AI-এর সম্ভাবনার প্রতি বিশ্বাসকে দৃঢ় করেছিল।

Transformer বিপ্লব এবং BERT-এর জন্ম (২০১৭–২০১৮)

২০১৭ সালে Google Brain-এর গবেষকরা «Attention Is All You Need» নামক গবেষণাপত্রে Transformer আর্কিটেকচার উপস্থাপন করেন। self-attention প্রক্রিয়ার উপর ভিত্তি করে তৈরি এই আর্কিটেকচার ক্রমগুলোকে পর্যায়ক্রমে নয়, বরং সমান্তরালভাবে প্রক্রিয়া করতে সক্ষম করেছিল, যা NLP-তে একটি বিপ্লব এবং সমস্ত আধুনিক LLM-এর ভিত্তি হয়ে উঠেছিল।

এই সাফল্যের ধারায় ২০১৮ সালে Google BERT (Bidirectional Encoder Representations from Transformers) মডেল উপস্থাপন করে। BERT ছিল প্রথম গভীরভাবে দ্বিমুখী (bidirectional) মডেল, যা একই সাথে বামে ও ডানে একটি শব্দের প্রেক্ষাপট বিবেচনা করেছিল। এটি ভাষা বোঝার অনেক কাজে (GLUE, SQuAD) রেকর্ড ফলাফল অর্জন করতে এবং একটি নতুন শিল্পমান প্রতিষ্ঠা করতে সক্ষম করেছিল। BERT দুটি সংস্করণে (BASE ১১০ মিলিয়ন parameter এবং LARGE ৩৪০ মিলিয়ন parameter) উন্মুক্ত কোড ও weight সহ প্রকাশিত হয়েছিল, যা এর ব্যাপক বিস্তারে সহায়তা করেছিল। ২০১৯ সাল থেকে BERT Google অনুসন্ধানে প্রশ্ন আরও ভালোভাবে বোঝার জন্য ব্যবহৃত হতে শুরু করে।

মাত্রার বৃদ্ধি এবং কথোপকথন মডেলের যুগ (২০১৯–২০২২)

BERT-এর পরে Google মাত্রা ও আর্কিটেকচার নিয়ে পরীক্ষা-নিরীক্ষা অব্যাহত রাখে:

  • T5 (Text-to-Text Transfer Transformer, ২০১৯): একটি একীভূত মডেল যা যেকোনো NLP কাজকে «টেক্সট-থেকে-টেক্সট» রূপান্তর হিসেবে বিবেচনা করে। বিশাল C4 (Colossal Clean Crawled Corpus) কর্পাসে প্রশিক্ষিত T5-ও একাধিক আকারে (১১ বিলিয়ন parameter পর্যন্ত) উন্মুক্ত অ্যাক্সেসে প্রকাশিত হয়েছিল।
  • Meena (২০২০): Google-এর প্রথম বিশেষায়িত কথোপকথন মডেল, যার ২.৬ বিলিয়ন parameter ছিল এবং যা উন্মুক্ত সংলাপ পরিচালনায় উচ্চ মান প্রদর্শন করেছিল।
  • LaMDA (Language Model for Dialogue Applications, ২০২১): কথোপকথন মডেলের একটি পরিবার (১৩৭ বিলিয়ন parameter পর্যন্ত), যা বিশাল সংলাপ কর্পাসে (১.৫৬ ট্রিলিয়ন শব্দ) প্রশিক্ষিত হয়েছিল। LaMDA আরও স্বাভাবিক ও অর্থবহ কথোপকথন তৈরির লক্ষ্যে পরিচালিত হয়েছিল এবং একজন Google প্রকৌশলী এটিকে «সচেতন» বলে দাবি করার পর ব্যাপক পরিচিতি লাভ করেছিল।
  • Gopher এবং Chinchilla (DeepMind, ২০২১–২০২২): সমান্তরালভাবে DeepMind স্কেলিং আইন নিয়ে গবেষণা করেছিল। Gopher মডেলটি (২৮০ বিলিয়ন parameter) দেখিয়েছিল কীভাবে মাত্রা মানকে প্রভাবিত করে। আর Chinchilla মডেলটি (৭০ বিলিয়ন) প্রমাণ করেছিল যে সর্বোত্তম কার্যক্ষমতার জন্য সর্বাধিক parameter সংখ্যার চেয়ে গুরুত্বপূর্ণ হলো মডেলের আকার ও প্রশিক্ষণ ডেটার পরিমাণের মধ্যে সঠিক ভারসাম্য। এই সিদ্ধান্ত «Chinchilla আইন» নামে পরিচিতি পেয়েছে এবং সমগ্র শিল্পে LLM প্রশিক্ষণের কৌশলকে প্রভাবিত করেছে।

অতিবৃহৎ ও মাল্টিমোডাল মডেলের যুগ (২০২২–বর্তমান)

  • PaLM (Pathways Language Model, ২০২২): ঘোষণার সময় Google-এর বৃহত্তম ঘন (dense) মডেল, যার ৫৪০ বিলিয়ন parameter ছিল এবং যা নতুন Pathways বিতরণকৃত পরিকাঠামোতে প্রশিক্ষিত হয়েছিল। PaLM যৌক্তিক বিশ্লেষণে যুগান্তকারী সক্ষমতা প্রদর্শন করেছিল, বিশেষত Chain-of-Thought (CoT) prompting কৌশল ব্যবহার করে। এর ভিত্তিতে Med-PaLM-এর মতো বিশেষায়িত সংস্করণ তৈরি করা হয়েছিল। ২০২৩ সালে উন্নত সংস্করণ PaLM 2 (~৩৪০ বিলিয়ন parameter) প্রকাশিত হয়, যা আপডেট হওয়া Bard চ্যাটবটের ভিত্তি হয়ে ওঠে।
  • Gemini (২০২৩–বর্তমান): Google DeepMind-এর সম্মিলিত দল কর্তৃক তৈরি মডেলের নতুন প্রজন্ম। Gemini শুরু থেকেই একটি নেটিভ মাল্টিমোডাল সিস্টেম হিসেবে ডিজাইন করা হয়েছিল, যা টেক্সট, কোড, ছবি, অডিও এবং ভিডিও প্রক্রিয়া করতে সক্ষম। এটি বেশ কয়েকটি সংস্করণে প্রকাশিত হয়েছে:
    • Gemini Ultra: জটিল কাজের জন্য সবচেয়ে শক্তিশালী মডেল।
    • Gemini Pro: বিস্তৃত কাজের জন্য সর্বজনীন মডেল।
    • Gemini Nano: মোবাইল ডিভাইসে কাজ করার জন্য কম্প্যাক্ট মডেল।

২০২৪–২০২৫ সালে পরিবারটি Gemini 1.5 (১ মিলিয়ন token পর্যন্ত প্রেক্ষাপট উইন্ডো সহ) এবং Gemini 2.0 সংস্করণ দিয়ে বিস্তৃত হয়েছে, যা এজেন্টিক সক্ষমতা অর্জন করেছে।

আর্কিটেকচার এবং প্রযুক্তিগত বৈশিষ্ট্য

ভিত্তি: Encoder, Decoder এবং হাইব্রিড

Google কাজের ধরন অনুযায়ী Transformer আর্কিটেকচারের বিভিন্ন রূপ ব্যবহার করে:

  • Encoder-only: BERT-ধরনের মডেল। এগুলো সম্পূর্ণ টেক্সট প্রক্রিয়া করে এবং সমৃদ্ধ প্রেক্ষাপটগত উপস্থাপনা তৈরি করে। টেক্সট বিশ্লেষণ ও বোঝার কাজে (শ্রেণিবিন্যাস, সত্তা নিষ্কাশন) আদর্শ, তবে উৎপাদনের জন্য নয়।
  • Decoder-only: LaMDA এবং PaLM-ধরনের মডেল (GPT-এর অনুরূপ)। এগুলো অটোরিগ্রেসিভ, অর্থাৎ token-এর পর token করে টেক্সট পূর্বাভাস দেয়। এগুলো স্বাভাবিক জেনারেটর যা টেক্সট অব্যাহত রাখা, সংলাপ এবং প্রশ্নের উত্তর দেওয়ার জন্য উপযুক্ত।
  • Encoder-Decoder: T5 এবং GNMT-ধরনের মডেল। এদের উভয় অংশ রয়েছে: encoder ইনপুট ক্রম প্রক্রিয়া করে, আর decoder আউটপুট তৈরি করে। এটি রূপান্তর কাজের জন্য সর্বজনীন আর্কিটেকচার, যেমন অনুবাদ বা সারসংক্ষেপ।

মাত্রা: Parameter, ডেটা এবং পরিকাঠামো

LLM-এ Google-এর সাফল্য মূলত তিনটি বিষয়ের উপর নির্ভরশীল:

  1. মডেলের মাত্রা: কোটি (BERT) থেকে শত শত বিলিয়ন (PaLM, Gemini) parameter পর্যন্ত পদ্ধতিগত বৃদ্ধি।
  2. ডেটার মাত্রা: বিশ্বের অন্যতম বৃহত্তম ডেটা কর্পাসে (Google ওয়েব ইন্ডেক্স, YouTube, Google Books) অ্যাক্সেস, যা ট্রিলিয়ন token-এ মডেল প্রশিক্ষণ দেওয়ার সুযোগ দেয়।
  3. পরিকাঠামো: নিজস্ব বিশেষায়িত চিপ Tensor Processing Unit (TPU) এবং বিতরণকৃত Pathways সিস্টেমের ব্যবহার, যা অতিবৃহৎ মডেলগুলো কার্যকরভাবে ও স্থিতিশীলভাবে প্রশিক্ষণ দেওয়ার সুযোগ দেয়।

মাল্টিমোডালিটি এবং এজেন্টনেস

Google-এর সর্বশেষ মডেলগুলো, বিশেষত Gemini, গভীর মাল্টিমোডালিটি এবং এজেন্টনেসের দিকে এগিয়ে চলেছে।

  • নেটিভ মাল্টিমোডালিটি মানে হলো একটি একক মডেল শুরু থেকেই বিভিন্ন ধরনের ডেটা (টেক্সট, ছবি, অডিও) বুঝতে ও সমন্বিত করতে প্রশিক্ষিত, শুধু আলাদা মডিউল জুড়ে দেওয়া নয়।
  • এজেন্টনেস (Agentic AI) হলো মডেলের কেবল প্রশ্নের উত্তর না দিয়ে লক্ষ্য অর্জনের জন্য স্বাধীনভাবে কর্মের পরিকল্পনা করার ও একটি ক্রম সম্পাদন করার সক্ষমতা (যেমন, অনুসন্ধান বা ক্যালকুলেটরের মতো বাহ্যিক সরঞ্জাম ব্যবহার করা)।

মূল মডেলের সারসংক্ষেপ তালিকা

Google-এর প্রধান ভাষা মডেলের তুলনা
মডেল প্রকাশের বছর Parameter (আনুমানিক) আর্কিটেকচার মূল বৈশিষ্ট্যসমূহ
BERT ২০১৮ ১১০–৩৪০ মিলিয়ন Encoder দ্বিমুখী প্রেক্ষাপট বোঝার সক্ষমতা, NLP কাজে SOTA।
T5 ২০১৯ ৬০ মিলিয়ন – ১১ বিলিয়ন Encoder-Decoder সকল কাজের জন্য একীভূত «টেক্সট-থেকে-টেক্সট» পদ্ধতি।
LaMDA ২০২১ ১৩৭ বিলিয়ন Decoder উন্মুক্ত, অর্থবহ সংলাপে বিশেষজ্ঞতা।
PaLM ২০২২ ৫৪০ বিলিয়ন Decoder যৌক্তিক বিশ্লেষণে অগ্রগতি (Chain-of-Thought), বৃহৎ মাত্রার প্রশিক্ষণ।
Chinchilla ২০২২ ৭০ বিলিয়ন Decoder «Compute-optimal» মডেল, যা ডেটা ও parameter-এর ভারসাম্যের গুরুত্ব প্রমাণ করেছে।
Gemini 1.0 ২০২৩ ~১ ট্রিলিয়ন পর্যন্ত (Ultra) মাল্টিমোডাল (সম্ভবত MoE) নেটিভ মাল্টিমোডালিটি, একাধিক benchmark-এ SOTA (MMLU)।
Gemini 1.5 ২০২৪ প্রকাশ করা হয়নি মাল্টিমোডাল (MoE) ১-২ মিলিয়ন token পর্যন্ত প্রেক্ষাপট উইন্ডো, উচ্চ দক্ষতা।
Gemini 2.0 ২০২৪ প্রকাশ করা হয়নি মাল্টিমোডাল + Tools অন্তর্নির্মিত এজেন্টিক সক্ষমতা, ছবি/অডিও উৎপাদন।

পণ্য ও ইকোসিস্টেমে প্রয়োগ

Google তার পণ্যের সম্পূর্ণ পরিসরে নিজস্ব LLM সক্রিয়ভাবে সংযুক্ত করছে:

  • Google অনুসন্ধান: BERT, MUM এবং Gemini জটিল প্রশ্ন আরও ভালোভাবে বোঝার জন্য এবং AI Overviews (পূর্বে SGE) ফরম্যাটে সরাসরি উত্তর প্রদানের জন্য ব্যবহৃত হচ্ছে।
  • Google Assistant এবং Bard (বর্তমানে Gemini): সহজ ভয়েস কমান্ড থেকে LaMDA, PaLM 2 এবং Gemini-ভিত্তিক পূর্ণাঙ্গ কথোপকথন সহকারীতে রূপান্তর।
  • Google Workspace: Duet AI (বর্তমানে Gemini for Workspace) ফিচারগুলো Gmail-এ চিঠি লিখতে, Docs-এ টেক্সট তৈরি করতে এবং Slides-এ উপস্থাপনা তৈরি করতে সহায়তা করে।
  • Android: Gemini Nano Pixel-এর মতো ডিভাইসে গোপনীয়তা ও গতি বৃদ্ধির জন্য AI ফিচারগুলো স্থানীয়ভাবে পরিচালনা করে।
  • Google Cloud AI: Vertex AI প্ল্যাটফর্ম প্রতিষ্ঠানগুলোকে নিজস্ব অ্যাপ্লিকেশন তৈরির জন্য API-এর মাধ্যমে PaLM এবং Gemini মডেলে অ্যাক্সেস প্রদান করে।

প্রতিযোগিতামূলক পরিবেশে ভূমিকা

Google «AI প্রতিযোগিতায়» অন্যতম মূল খেলোয়াড়, যেখানে তার প্রধান প্রতিযোগীরা হলো OpenAI (Microsoft-এর সমর্থনে) এবং Meta।

  • OpenAI-এর সাথে প্রতিদ্বন্দ্বিতা: যদিও Google অনেক মৌলিক প্রযুক্তিতে (Transformer সহ) পথিকৃৎ ছিল, ২০২২ সালের শেষে ChatGPT-এর লঞ্চ Google-কে তার পণ্যগুলো বাজারে আনার গতি ত্বরান্বিত করতে বাধ্য করেছিল (যেমন Bard)। প্রতিযোগিতা মডেলের মান (Gemini Ultra বনাম GPT-4), প্রেক্ষাপট উইন্ডোর আকার এবং API-এর সুবিধার ক্ষেত্রে চলছে।
  • Meta-র সাথে বৈসাদৃশ্য: Meta উন্মুক্ত সোর্স কোড-এর উপর বাজি রেখেছে (LLaMA মডেল), Google ও OpenAI-এর বন্ধ মডেলগুলোর একটি শক্তিশালী বিকল্প তৈরি করেছে। এর প্রতিক্রিয়ায় Google-ও Gemma-র মতো উন্মুক্ত মডেল প্রকাশ করা শুরু করেছে, ডেভেলপার সম্প্রদায়কে সহায়তা করতে এবং Meta-র কাছে ইকোসিস্টেম না হারাতে।
  • কৌশলগত জোট: Google Anthropic (Claude মডেলের নির্মাতা) স্টার্টআপের মতো অন্যান্য খেলোয়াড়দের মধ্যে বিনিয়োগ করছে, পদ্ধতিগুলো বৈচিত্র্যময় করতে এবং ক্লাউড প্রতিযোগিতায় তার অবস্থান মজবুত করতে।

সাহিত্য

  • Vaswani, A. et al. (2017). Attention Is All You Need. NIPS.
  • Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL.
  • Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. JMLR.
  • Thoppilan, R. et al. (2022). LaMDA: Language Models for Dialog Applications. arXiv:2201.08239.
  • Hoffmann, R. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. JMLR.
  • Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.

তথ্যসূত্র

  • Google AI-এর অফিসিয়াল পোর্টাল
  • Google DeepMind-এর অফিসিয়াল ওয়েবসাইট