Decoder-only models (architecture) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

শুধুমাত্র-ডিকোডার মডেল (ইংরেজি: Decoder-Only Models) — এটি বৃহৎ ভাষা মডেলের (LLM) আর্কিটেকচারের একটি প্রভাবশালী শ্রেণি, যা সম্পূর্ণরূপে Transformer আর্কিটেকচারের ডিকোডিং অংশের (ডিকোডার) উপর ভিত্তি করে গড়ে উঠেছে। এই মডেলগুলো টেক্সট জেনারেশন কাজে বিশেষজ্ঞ এবং আধুনিক অধিকাংশ চ্যাটবট ও AI-অ্যাসিস্ট্যান্টের ভিত্তি হিসেবে কাজ করে।

এই পদ্ধতিকে জনপ্রিয় করে তোলা ফ্ল্যাগশিপ সিরিজটি হলো OpenAI-এর GPT মডেল সিরিজ।

ধারণা ও আর্কিটেকচার

শুধুমাত্র-ডিকোডার মডেলের মূল ধারণা হলো অটোরিগ্রেসিভ জেনারেশন (autoregressive generation) পদ্ধতিতে ক্রম তৈরি করা। এর অর্থ হলো, মডেলটি পূর্বে তৈরি হওয়া সমস্ত token-এর উপর ভিত্তি করে পরবর্তী token পূর্বানুমান করে। ব্যবহারকারীর প্রদত্ত prompt (ইনপুট অনুরোধ) এবং ইতোমধ্যে তৈরি হওয়া টেক্সটকে একটি একক ক্রম হিসেবে বিবেচনা করা হয়, যা মডেলটি আরও এগিয়ে নিয়ে যায়।

আর্কিটেকচারের দিক থেকে, মডেলটি Nটি অভিন্ন ডিকোডার স্তরের একটি স্তূপ নিয়ে গঠিত। প্রতিটি স্তরে এনকোডার বা সম্পূর্ণ ডিকোডারের বিপরীতে কেবল দুটি মূল উপ-স্তর থাকে:

  1. মাস্কড মাল্টি-হেড সেলফ-অ্যাটেনশন (Masked Multi-Head Self-Attention): এটি একটি মূল প্রক্রিয়া যা অটোরিগ্রেসিভ বৈশিষ্ট্য নিশ্চিত করে। ক্রম প্রক্রিয়াকরণের সময় একটি বিশেষ কজাল মাস্ক (causal mask) প্রতিটি token-কে পরবর্তী token-গুলো "দেখতে" বাধা দেয়। এভাবে, i অবস্থানের পূর্বানুমান কেবল <i অবস্থানগুলোর token-এর উপর নির্ভর করে।
  2. ফিড-ফরওয়ার্ড নেটওয়ার্ক (Feed-Forward Network): প্রতিটি token-এর উপস্থাপনায় অরৈখিক রূপান্তর প্রয়োগ করে।

শুধুমাত্র-ডিকোডার মডেলে ক্রস-অ্যাটেনশন (cross-attention) প্রক্রিয়া অনুপস্থিত, কারণ এখানে কোনো এনকোডার নেই যার প্রতি "মনোযোগ দেওয়া" যাবে।

প্রাক-প্রশিক্ষণের কাজ

শুধুমাত্র-ডিকোডার মডেলগুলো একটিমাত্র কিন্তু অত্যন্ত শক্তিশালী স্ব-নিয়ন্ত্রিত কাজে প্রশিক্ষিত হয়:

কজাল ল্যাঙ্গুয়েজ মডেলিং (Causal Language Modeling, CLM)

  • কার্যপদ্ধতি: মডেলটি একটি ক্রমের পরবর্তী token পূর্বানুমান করতে শেখে। প্রশিক্ষণের প্রতিটি ধাপে এটি একটি টেক্সট অংশ ইনপুট হিসেবে পায় এবং পরবর্তী token-এর জন্য সম্ভাবনার বিতরণ তৈরি করতে হয়।
  • লক্ষ্য: বিশাল পরিমাণ টেক্সট ডেটায় সঠিক পরবর্তী token-এর সম্ভাবনা সর্বোচ্চ করা। প্রথম দর্শনে সরল মনে হওয়া এই কাজটি মডেলকে ব্যাকরণ, বাক্যগঠন, বিশ্ব সম্পর্কিত তথ্য এবং ভাষার জটিল নিয়মকানুন শিখতে বাধ্য করে।

প্রয়োগ

অটোরিগ্রেসিভ প্রকৃতির কারণে, শুধুমাত্র-ডিকোডার মডেলগুলো টেক্সট জেনারেশনের প্রয়োজন এমন যেকোনো কাজের জন্য আদর্শ:

  • মুক্ত আকারে টেক্সট জেনারেশন: নিবন্ধ, কবিতা, চিত্রনাট্য ইত্যাদি লেখা।
  • কথোপকথন ব্যবস্থা ও চ্যাটবট: কথোপকথনমূলক ভঙ্গিতে ব্যবহারকারীর প্রশ্নের উত্তর দেওয়া।
  • সারসংক্ষেপ: দীর্ঘ টেক্সটের সংক্ষিপ্ত বিবরণ তৈরি করা।
  • মেশিন ট্রান্সলেশন: যদিও এর জন্য প্রায়ই এনকোডার-ডিকোডার মডেল ব্যবহার করা হয়, শুধুমাত্র-ডিকোডার মডেলগুলোও অনুবাদ করতে পারে যদি কাজটি prompt-এ সংজ্ঞায়িত করা হয় (যেমন, "ইংরেজি থেকে বাংলায় অনুবাদ করো: ...")।
  • কোড লেখা: টেক্সট বিবরণ থেকে কোড তৈরি করা।
  • ইন-কনটেক্সট লার্নিং (In-context learning): বড় আকারের কারণে, বড় ডিকোডার মডেলগুলো fine-tuning ছাড়াই সরাসরি prompt-এ মাত্র কয়েকটি উদাহরণ (few-shot) বা এমনকি কোনো উদাহরণ ছাড়াই (zero-shot) নতুন কাজ সমাধান করার সক্ষমতা প্রদর্শন করে।

প্রধান মডেল ও তাদের বিকাশ

  • GPT সিরিজ (২০১৮-বর্তমান): এই পদ্ধতির পথিকৃৎ ও জনপ্রিয়তাকারী। GPT-1 প্রাক-প্রশিক্ষণের কার্যকারিতা দেখিয়েছে, GPT-2 মাপকাঠি বৃদ্ধির শক্তি প্রদর্শন করেছে, এবং GPT-3 — few-shot সক্ষমতার আবির্ভাব ঘটিয়েছে। ChatGPT এবং GPT-4 এই আর্কিটেকচারকে AI-অ্যাসিস্ট্যান্টের মানদণ্ড হিসেবে প্রতিষ্ঠিত করেছে।
  • LLaMA (২০২৩-বর্তমান): Meta-এর উন্মুক্ত মডেলের একটি সিরিজ, যা শক্তিশালী LLM-এর অ্যাক্সেসকে গণতান্ত্রিক করেছে এবং সম্প্রদায়ে উদ্ভাবনের ঢেউ তুলেছে।
  • Claude (২০২৩-বর্তমান): Anthropic-এর মডেল পরিবার, যা Constitutional AI ব্যবহার করে নিরাপত্তা ও নিয়ন্ত্রণযোগ্যতার উপর দৃষ্টি নিবদ্ধ করেছে।
  • PaLMGemini (২০২২-বর্তমান): Google-এর ফ্ল্যাগশিপ মডেল। Gemini একটি নেটিভলি মাল্টিমোডাল শুধুমাত্র-ডিকোডার মডেলও বটে।

অন্যান্য আর্কিটেকচারের সাথে তুলনা

Transformer-ভিত্তিক মূল আর্কিটেকচারগুলোর তুলনা
আর্কিটেকচার প্রধান কাজ প্রসঙ্গের দিকনির্দেশনা সাধারণ মডেল
শুধুমাত্র-ডিকোডার টেক্সট জেনারেশন একমুখী (বাম থেকে ডানে) GPT, LLaMA, Claude, Gemini
শুধুমাত্র-এনকোডার টেক্সট বোঝা দ্বিমুখী BERT, RoBERTa
এনকোডার-ডিকোডার ক্রম থেকে ক্রমে রূপান্তর দ্বিমুখী (এনকোডার) + একমুখী (ডিকোডার) T5, BART, মূল Transformer

আরও দেখুন

  • GPT