Large language model — বৃহৎ ভাষা মডেল

From Systems analysis Wiki
Jump to navigation Jump to search

বৃহৎ ভাষা মডেল (large language model, LLM) — এটি Machine Learning মডেলের একটি প্রকার, যা গভীর Neural Network ব্যবহার করে বাস্তবায়িত হয়, যেখানে বিপুল সংখ্যক parameter থাকে (সাধারণত কোটি কোটি বা তারও বেশি) এবং যা বিশাল পরিমাণ পাঠ্য data-তে প্রশিক্ষিত হয়। এই প্রসঙ্গে «বৃহৎ» বলতে একই সাথে parameter-এর মাত্রা এবং প্রশিক্ষণ corpus-এর আয়তন উভয়কেই বোঝায়, যা আধুনিক ব্যবস্থায় কয়েক petabyte এবং ট্রিলিয়ন token পর্যন্ত পৌঁছায়। LLM মডেলগুলো প্রধানত self-/semi-supervised পদ্ধতিতে প্রশিক্ষিত হয়, ক্রমধারায় পরবর্তী token-এর পূর্বাভাস দিয়ে এবং এর মাধ্যমে ভাষার পরিসংখ্যানগত নিয়মকানুন আয়ত্ত করে। Parameter, data এবং গণনামূলক ধাপের বৃদ্ধি পূর্বানুমানযোগ্য মান উন্নতির দিকে নিয়ে যায়, যা scaling laws দ্বারা নিশ্চিত হয়।

BERT (২০১৭) এবং বিশেষত GPT-3 (২০২০)-এর আবির্ভাবের পর LLM পদ্ধতি প্রাকৃতিক ভাষা প্রক্রিয়াকরণে আধিপত্য বিস্তার করতে শুরু করে। আধুনিক মডেলগুলো (GPT-4o, Claude 3, Gemini 1.5, LLaMA 3 প্রভৃতি) বিশেষ কোনো কনফিগারেশন ছাড়াই পাঠ্য ও প্রোগ্রামিং কোড লিখতে, অনুবাদ করতে, সারসংক্ষেপ তৈরি করতে, প্রশ্নের উত্তর দিতে এবং যুক্তিতর্কের শৃঙ্খল গড়তে সক্ষম; মাল্টিমোডাল সংস্করণগুলো ছবি, শব্দ ও ভিডিও বিশ্লেষণ করতে পারে। প্রয়োগিক কাজে অভিযোজন fine-tuning বা prompt engineering, in-context learning-এর মাধ্যমে করা হয়। LLM-এর অর্জনের পাশাপাশি এগুলো মূল data-র পক্ষপাত ও ত্রুটি বহন করে, «হ্যালুসিনেশন»-প্রবণ এবং বৃহৎ গণনামূলক সম্পদ দাবি করে, তাই আজকের গবেষণা আচরণ সংযোজন, corpus ফিল্টারিং এবং শক্তি-সাশ্রয়ী আর্কিটেকচারের উপর কেন্দ্রীভূত।

আর্কিটেকচার

আধুনিক LLM-এ প্রায় সবসময়ই Transformer (ট্রান্সফর্মার) আর্কিটেকচার ব্যবহার করা হয় — যা self-attention প্রক্রিয়াযুক্ত একটি নেটওয়ার্ক। ট্রান্সফর্মার মডেলটি প্রথম ২০১৭ সালে Google-এর গবেষকদের Attention is All You Need নামক প্রবন্ধে প্রস্তাব করা হয়।

Transformer আর্কিটেকচার হলো ক্রমধারার সাথে কাজ করার জন্য একটি মৌলিক Neural Network কাঠামো, যেখানে দুটি যৌক্তিক মডিউল রয়েছে — এনকোডার (ইনপুট কোড করে) এবং ডিকোডার (আউটপুট তৈরি করে)। ইনপুট হিসেবে একটি ক্রমধারা গ্রহণ করা হয়, তার vector representation (ইংরেজিতে embedding) তৈরি করা হয়, positional encoding vector যোগ করা হয়, এরপর ক্রমধারায় ক্রমের বিবেচনা ছাড়াই উপাদানগুলোর সেট কোডিং উপাদানে (parallel processing) প্রবেশ করে, এবং তারপর ডিকোডিং উপাদান সেই ক্রমধারার একটি অংশ এবং কোডিং উপাদানের আউটপুট ইনপুট হিসেবে পায়। ফলে একটি নতুন আউটপুট ক্রমধারা তৈরি হয়।

ট্রান্সফর্মারের কোডিং উপাদান কয়েকটি একইরকম এনকোডার স্তর নিয়ে গঠিত; ডিকোডিং উপাদানটিও একইভাবে সাজানো। ট্রান্সফর্মার নিজেই হলো attention মডেলের একটি ধারা, যা মূল vector ক্রমধারাকে একটি নতুন ক্রমধারায় রূপান্তরিত করে, যেখানে প্রতিটি উপাদান বাকিদের প্রেক্ষাপট বিবেচনা করে। এনকোডার ইনপুট data-র লুকানো representation তৈরি করে, উপাদানগুলোর পারস্পরিক সম্পর্কের তথ্য সংরক্ষণ করে। ডিকোডার লুকানো representation-এর ভিত্তিতে আউটপুট token-এর জন্য নতুন embedding ক্রমধারা তৈরি করে। এরপর এই embedding-এর ভিত্তিতে ভাষা মডেলের সাহায্যে চূড়ান্ত আউটপুট উপাদান তৈরি হয়।

যেহেতু ট্রান্সফর্মারগুলো মূলত Machine Translation-এর মতো কাজের জন্য তৈরি হয়েছিল, তাই তাদের আর্কিটেকচারে এনকোডার (ইনপুট পাঠ্য প্রক্রিয়াকরণ করে, যেমন উৎস বাক্য) এবং ডিকোডার (আউটপুট তৈরি করে, যেমন অনুবাদ) অন্তর্ভুক্ত রয়েছে। তবে অনেক ভাষা মডেলে কেবল ডিকোডার অংশটি ব্যবহার করা হয়, যা autoregressive পদ্ধতিতে কাজ করে।

ট্রান্সফর্মার তিনটি প্রধান কনফিগারেশনে ব্যবহৃত হয়, প্রতিটি এনকোডার ও ডিকোডারকে ভিন্নভাবে ব্যবহার করে এবং নিজস্ব কাজের ক্ষেত্রে কেন্দ্রীভূত:

  • এনকোডার-ট্রান্সফর্মার (দ্বিমুখী) ইচ্ছাকৃতভাবে লুকানো পাঠ্যাংশ পুনরুদ্ধার করতে শেখে, তাই এগুলো «বোঝাপড়া»র কাজের জন্য উপযুক্ত — শ্রেণীবিভাগ, তথ্য নিষ্কাশন, semantic অনুসন্ধান।
  • ডিকোডার-ট্রান্সফর্মার (autoregressive) পরবর্তী token পূর্বাভাসের জন্য অপ্টিমাইজ করা হয় এবং যেখানে প্রবাহমান আউটপুট প্রয়োজন সেখানে ব্যবহৃত হয়: সংলাপ agent, কোড স্বয়ংক্রিয় সম্পূর্ণতা, সৃজনশীল উৎপাদন।
  • সম্পূর্ণ «এনকোডার + ডিকোডার» কাঠামো উভয় পদ্ধতি একত্রিত করে: এনকোডার সম্পূর্ণ ইনপুট পাঠ্যের representation তৈরি করে, আর ডিকোডার তার উপর নির্ভর করে ধাপে ধাপে ফলাফল গড়ে তোলে। এই কনফিগারেশন Machine Translation, সারসংক্ষেপ এবং প্রশ্নোত্তর ব্যবস্থার জন্য সবচেয়ে কার্যকর।

Tokenization - টোকেনাইজেশন

Tokenization — বৃহৎ ভাষা মডেলে পাঠ্য প্রক্রিয়াকরণের একটি মূল প্রাথমিক ধাপ। এই ধাপে অবিচ্ছিন্ন character string-কে পৃথক একক — token-এ বিভক্ত করা হয়। Tokenization হলো character ক্রমধারাকে কাঠামোগত উপাদানের ক্রমধারায় রূপান্তরিত করার কাজ, যা Neural Network-এর কার্যকর কাজ নিশ্চিত করে।

ভাষাতাত্ত্বিক দৃষ্টিকোণ থেকে tokenization কিছুটা ভাষার ন্যূনতম একক চিহ্নিত করার প্রক্রিয়ার সাথে সাদৃশ্যপূর্ণ হতে পারে, যেগুলোর স্বাধীন অর্থ বা কার্যকরী ভার রয়েছে, যেমন শব্দ, morpheme বা তাদের খণ্ড। তবে প্রায়শই token হলো পরিসংখ্যানগতভাবে ঘন ঘন দেখা যাওয়া character ক্রমধারা, তাই সব token-এর ভাষাতাত্ত্বিক অর্থপূর্ণতাকে অতিমূল্যায়ন না করা গুরুত্বপূর্ণ। নির্বাচিত পদ্ধতির উপর নির্ভর করে একটি token হতে পারে: সম্পূর্ণ শব্দ, subword, পৃথক character, সহায়ক চিহ্ন (যেমন, ক্রমধারার শুরু ও শেষের চিহ্নক)।

Tokenization-এর সুবিধা:

  • শব্দভাণ্ডারের আকার গ্রহণযোগ্য সীমার মধ্যে রাখা;
  • বিরল ও নতুন শব্দ সঠিকভাবে প্রক্রিয়াকরণ;
  • পাঠ্যকে সাংখ্যিক শনাক্তকারীর ক্রমধারায় একমুখীভাবে ম্যাপ করার নিশ্চয়তা।

পাঠ্য বিভক্ত করতে subword অ্যালগরিদম ব্যবহার করা হয়, যেগুলোর মধ্যে সবচেয়ে প্রচলিত হলো Byte Pair Encoding (BPE), WordPiece এবং UnigramLM। প্রতিটি corpus-এর সবচেয়ে ঘন ঘন দেখা যাওয়া খণ্ড থেকে শব্দভাণ্ডার তৈরি করে এবং যেকোনো ইনপুট পাঠ্যের ক্রমিক বিভাজনের জন্য এটি ব্যবহার করে।

Tokenization ধাপের পরে পাঠ্যের প্রতিটি একক — token — Neural Network-এর বোধগম্য সাংখ্যিক representation-এ রূপান্তরিত হয়। এই প্রক্রিয়ায় কয়েকটি ক্রমিক ধাপ রয়েছে:

  • Token-কে শনাক্তকারীতে রূপান্তর: প্রতিটি token আগে থেকে তৈরি token শব্দভাণ্ডারের ভিত্তিতে একটি অনন্য সাংখ্যিক সূচকের সাথে মেলানো হয়। পাঠ্য token-গুলো তাদের অনন্য সাংখ্যিক শনাক্তকারী (ID) দিয়ে প্রতিস্থাপিত হয়। প্রতিটি ID হলো আগে থেকে তৈরি শব্দভাণ্ডারে token-এর ক্রমসংখ্যা, যা Neural Network-কে শব্দের পরিবর্তে সংখ্যা নিয়ে কাজ করতে দেয়।
  • শনাক্তকারীকে embedding-এ রূপান্তর: প্রতিটি token শনাক্তকারীর জন্য নির্দিষ্ট মাত্রার একটি vector বের করা বা গণনা করা হয় — embedding। এই বহুমাত্রিক সাংখ্যিক representation ID-কে প্রতিস্থাপন করে এবং ইতোমধ্যে token-এর অর্থ ও প্রাসঙ্গিক বৈশিষ্ট্য সম্পর্কে তথ্য ধারণ করে। প্রক্রিয়াকরণের সুবিধার জন্য সব embedding-এর দৈর্ঘ্য সমান।
  • Positional encoding যোগ: যেহেতু Transformer আর্কিটেকচার নিজে উপাদানগুলোর ক্রম বিবেচনা করে না, তাই embedding-এ positional encoding যোগ করা হয়, যা ক্রমধারায় token-এর অবস্থান সম্পর্কে তথ্য প্রদান করে। অর্থাৎ এর মাধ্যমে মডেল «জানে» বাক্যে কোন token প্রথম, দ্বিতীয়, তৃতীয় ইত্যাদি।
  • ইনপুট matrix গঠন: আউটপুটে [длина последовательности × размерность эмбеддинга] মাত্রার একটি matrix পাওয়া যায়, যা পাঠ্যের প্রাথমিক representation হিসেবে কাজ করে এবং Neural Network-এ, বিশেষত Transformer-এর self-attention ব্লকে প্রবেশ করানো হয়। এই matrix-এর প্রতিটি সারি একটি token-এর সাথে সম্পর্কিত, এবং এতে থাকা vector তার অর্থগত মান (embedding) এবং পাঠ্যে তার অবস্থানের তথ্য (positional encoding) উভয়ই বহন করে।
Текст → Токены → Идентификаторы → Эмбеддинги + Позиционные кодировки → Вход в модель

Attention Mechanism - মনোযোগ প্রক্রিয়া

Attention mechanism — Transformer আর্কিটেকচারের একটি মূল উপাদান, যা ক্রমধারায় token-গুলোর মধ্যে নির্ভরতা বিবেচনা করার সুযোগ দেয়, তাদের মধ্যকার দূরত্ব নির্বিশেষে। ইনপুট পাঠ্য vector ক্রমধারায় রূপান্তরিত হওয়ার পর, এই ক্রমধারা ট্রান্সফর্মারের কেন্দ্রীয় উপাদান — attention block-এ প্রবেশ করে।

Attention mechanism হলো Neural Network-এর জন্য একটি উপায় যা নির্ধারণ করে যে ক্রমধারার প্রতিটি উপাদান প্রক্রিয়াকরণের সময় ইনপুট data-র কোন অংশে বেশি মনোযোগ দেওয়া উচিত। এর মাধ্যমে পাঠ্যের পৃথক অংশের vector পরস্পরের সাথে যোগাযোগ করতে পারে, তথ্যে সমৃদ্ধ হয় এবং আশেপাশের প্রেক্ষাপট বিবেচনা করে তাদের মান আপডেট করে। এর ফলে মডেল token-গুলোর মধ্যে স্থানীয় ও দূরবর্তী উভয় নির্ভরতা কার্যকরভাবে ধরতে পারে, যা জটিল পাঠ্য কাঠামো ব্যাখ্যা করার ক্ষমতা উল্লেখযোগ্যভাবে বাড়ায়।

প্রাকৃতিক ভাষায় কোনো শব্দ বা অভিব্যক্তির অর্থ বিচ্ছিন্নভাবে নির্ধারিত হয় না — এটি প্রেক্ষাপটের উপর নির্ভরশীল, অর্থাৎ আশেপাশের অন্য শব্দ ও কাঠামোর উপর। Neural Network-এ পাঠ্য vector representation — embedding-এর মাধ্যমে কোড করা হয়, যা token-এর শাব্দিক ও বাক্যতাত্ত্বিক বৈশিষ্ট্য সাংখ্যিকভাবে প্রতিফলিত করে। সরাসরি attention প্রক্রিয়া ছাড়া (Transformer-এর মতো), প্রেক্ষাপটের তথ্য বড় দূরত্বে হারিয়ে যেত (সহজ মডেলের মতো), অথবা ক্রমানুসারে প্রেরণ হতো, যা দূরবর্তী সম্পর্ক ধরার ক্ষেত্রে কম কার্যকর। তবে প্রাকৃতিক ভাষায় শব্দ বা বাক্যতাত্ত্বিক গঠনের অর্থ গতিশীল, এবং প্রেক্ষাপটের উপর নির্ভর করে এর ব্যাখ্যা অভিযোজিত হতে হয়। Attention mechanism vector representation-এর প্রাসঙ্গিকীকরণ সম্পন্ন করে, যার অর্থ হলো (বা শুধু :):

  • প্রতিটি token বাক্যের অন্য token-গুলোর সাপেক্ষে তার গুরুত্ব «মূল্যায়ন» করে।
  • আপডেটের প্রক্রিয়ায় vector representation পারস্পরিক তথ্যে সমৃদ্ধ হয়, বাক্যতাত্ত্বিক নির্ভরতা, অর্থগত ভূমিকা ও ব্যাবহারিক প্রেক্ষাপট প্রতিফলিত করে।


এই তথ্য বিনিময়ের ফলে আপডেটেড vector শুধু token-এর নিজস্ব অর্থ নয়, বরং তার ব্যাকরণগত সম্পর্ক (syntax), বর্ণিত পরিস্থিতিতে তার ভূমিকা (semantics) এবং প্রেক্ষাপটে সামগ্রিক অর্থ (pragmatics) কোড করতে শুরু করে।

Входные векторы токенов (с позициями) → Механизм Внимания (Взаимодействие векторов) → Контекстуализированные векторы токенов (Векторы обогащенные информацией о связях с другими токенами)

Attention Mechanism-এর কারিগরি বাস্তবায়ন

Attention mechanism-এর অভ্যন্তরীণ গঠনে কয়েকটি মূল গণনামূলক ধাপ ও উপাদান রয়েছে। প্রতিটি ইনপুট vector-এর জন্য তিনটি vector তৈরি হয়: Query (প্রশ্ন), Key (চাবি) এবং Value (মান)। তাদের পারস্পরিক ক্রিয়ার ভিত্তিতে attention weight গণনা করা হয়, যা পরে আপডেটেড, প্রাসঙ্গিকীকৃত vector representation পেতে ব্যবহৃত হয়। Multi-Head Attention আর্কিটেকচার সমান্তরাল তথ্য প্রক্রিয়াকরণের জন্য একটি প্রচলিত পদ্ধতি।

Query (প্রশ্ন), Key (চাবি), Value (মান)

Attention mechanism গণনার ভিত্তিতে রয়েছে প্রতিটি ইনপুট vector-কে (যা token embedding এবং তার positional encoding-এর যোগফল) তিনটি ভিন্ন vector representation-এ রূপান্তর: Query (Q), Key (K) এবং Value (V)।

ধারণাগতভাবে এই তিনটি vector attention mechanism-এ নিম্নলিখিত ভূমিকা পালন করে:

  • Query (প্রশ্ন): বর্তমান token-এর vector-কে উপস্থাপন করে, যা ক্রমধারায় প্রাসঙ্গিক তথ্য অনুসন্ধান প্রক্রিয়া শুরু করে। এটিকে একটি «প্রশ্ন» বা «অনুসন্ধান যন্ত্র» হিসেবে দেখা যায়, যা বর্তমান token-এর সাপেক্ষে অন্য token-গুলোর গুরুত্ব মূল্যায়নে ব্যবহৃত হয়।
  • Key (চাবি): একটি শনাক্তকারী বা «লেবেল» হিসেবে কাজ করে, যা প্রতিটি token-এর বিষয়বস্তুর দিক বর্ণনা করে। বর্তমান token-এর Query (Q) vector ক্রমধারার সব Key (K) vector-এর সাথে (নিজেরটি সহ) তুলনা করা হয় তাদের সামঞ্জস্য বা প্রাসঙ্গিকতার মাত্রা নির্ধারণের জন্য।
  • Value (মান): প্রতিটি token-এর সাথে যুক্ত প্রকৃত তথ্য বা representation ধারণ করে, যা পরে প্রেরণ করা হবে। Query ও Key-এর পারস্পরিক ক্রিয়ার ভিত্তিতে attention weight গণনার পর, এই weight গুলো Value vector-এ প্রয়োগ করা হয় চূড়ান্ত ভারযুক্ত representation তৈরি করতে, যা প্রদত্ত token-এর জন্য attention mechanism-এর আউটপুট।

বৃহৎ ভাষা মডেলের প্রশিক্ষণ

LLM-এর প্রশিক্ষণ প্রধানত দুটি ধাপে হয়:

  1. Pretraining (পূর্বপ্রশিক্ষণ) এই ধাপে মডেল self-supervised learning পদ্ধতিতে বিশাল অচিহ্নিত পাঠ্য corpus-এ প্রশিক্ষিত হয়। কাজটি হলো ক্রমধারায় পরবর্তী token পূর্বাভাস দেওয়া (autoregression) বা লুকানো অংশ পুনরুদ্ধার করা (masked training)। Pretraining মডেলকে ভাষার ব্যাপক পরিসংখ্যানগত নিয়মকানুন, ব্যাকরণ, বিশ্ব সম্পর্কে তথ্য এবং যুক্তির মৌলিক রূপ আয়ত্ত করতে দেয়।
  2. Fine-tuning (সূক্ষ্ম সমন্বয়) Pretraining-এর পরে মডেল নির্দিষ্ট কাজ সম্পাদনের জন্য বিশেষায়িত data-তে আরও প্রশিক্ষিত হয়, যেমন উত্তর তৈরি, পাঠ্য শ্রেণীবিভাগ বা নির্দেশনা পালন। আধুনিক পদ্ধতিগুলোর মধ্যে রয়েছে:
    • চিহ্নিত dataset-এ fine-tuning (supervised fine-tuning)।
    • মানব অংশগ্রহণ সহ Reinforcement Learning (RLHF, reinforcement learning from human feedback) মডেলের আচরণ লক্ষ্য মান, নিরাপত্তা ও উপযোগিতা অনুযায়ী সংশোধন করতে।

সমস্যা ও সীমাবদ্ধতা

চমৎকার অগ্রগতি সত্ত্বেও আধুনিক বৃহৎ ভাষা মডেলগুলোর (LLM) বেশ কিছু সমস্যা ও সীমাবদ্ধতা রয়েছে:


I. গণনামূলক ও আর্কিটেকচারগত সীমাবদ্ধতা

  1. উচ্চ গণনামূলক ব্যয়: LLM-এর প্রশিক্ষণ ও পরিচালনায় উল্লেখযোগ্য গণনামূলক শক্তি, সময় ও শক্তি প্রয়োজন, যা উচ্চ অর্থনৈতিক ও পরিবেশগত ব্যয় সৃষ্টি করে। এছাড়াও উৎপাদনের autoregressive প্রকৃতি (token-এর ক্রমিক তৈরি) সমান্তরালকরণ সীমিত করে এবং non-autoregressive পদ্ধতির তুলনায় আউটপুট গতি কমিয়ে দেয়।
  2. প্রেক্ষাপটের দৈর্ঘ্য সীমাবদ্ধতা: Transformer আর্কিটেকচারে ক্রমধারার দৈর্ঘ্যের উপর গণনামূলক ব্যয় ও মেমোরি চাহিদার দ্বিঘাতীয় নির্ভরতা রয়েছে। এটি মডেল একসাথে প্রক্রিয়া করতে পারে এমন পাঠ্যের পরিমাণের উপর নির্দিষ্ট সীমা (context window) আরোপ করতে বাধ্য করে, যা দীর্ঘ নথি কেটে ফেলে এবং window-এর বাইরের তথ্য হারায়।


II. উৎপাদনের নির্ভরযোগ্যতা ও নির্ভুলতার সমস্যা

  1. হ্যালুসিনেশন: তথ্যগতভাবে ভুল কিন্তু বিশ্বাসযোগ্য শোনানো তথ্য তৈরি। এটি মডেলের বিশ্বের প্রকৃত বোঝাপড়ার অভাব, data-র পরিসংখ্যানগত নিয়মকানুনের উপর নির্ভরশীলতা এবং তৈরি বক্তব্য যাচাইয়ের অক্ষমতার সাথে সম্পর্কিত।
  2. ত্রুটি সঞ্চয় (Error Propagation): এমন একটি প্রক্রিয়া যেখানে উৎপাদনের প্রাথমিক ধাপে করা ভুলগুলো বৃদ্ধি পায় এবং পরবর্তী ধাপে ক্রমবর্ধমান অনির্ভুলতার দিকে নিয়ে যায়, পাঠ্যের সামগ্রিক গুণমান ও সংগতি কমায়।
  3. সীমিত compositionality: বহু-ধাপের যৌক্তিক অনুমান বা নির্ভুল গণনা (যেমন বহু অঙ্কের সংখ্যার গুণ, ধাঁধা সমাধান) প্রয়োজন এমন কাজে অসুবিধা। এ ধরনের কাজে মডেলের নির্ভুলতা জটিলতা বৃদ্ধির সাথে autoregressive উৎপাদনের প্রকৃতির কারণে দ্রুত হ্রাস পায়।
  4. পুনরাবৃত্তি: শব্দ বা বাক্যাংশের অতিরিক্ত পুনরাবৃত্তির প্রবণতা, যা পাঠ্যের তথ্যমূল্য ও পাঠযোগ্যতা কমায়। এটি প্রশিক্ষণের বৈশিষ্ট্য এবং decoding অ্যালগরিদমের (পরবর্তী token নির্বাচন) সাথে সম্পর্কিত।
  5. বিপরীত অভিশাপ (Reversal Curse): মডেলের জ্ঞান বিপরীত দিকে স্বয়ংক্রিয়ভাবে সাধারণীকরণ করতে অক্ষমতা: «A হলো B» বক্তব্যে প্রশিক্ষিত হয়ে মডেল প্রায়ই «B হলো A» অনুমান করতে পারে না।
  6. সৃজনশীলতা-নির্ভুলতার আপোস: বৈচিত্র্যময়, মৌলিক উত্তর তৈরি এবং তথ্যগত নির্ভুলতা বজায় রাখার মধ্যে ভারসাম্য রক্ষার প্রয়োজনীয়তা। একটি দিক বৃদ্ধি প্রায়ই অন্যটিতে নেতিবাচক প্রভাব ফেলে, যেমন উচ্চ সৃজনশীলতা হ্যালুসিনেশন বৃদ্ধির সাথে সম্পর্কযুক্ত হতে পারে।

III. মিথস্ক্রিয়া ও নিয়ন্ত্রণের সমস্যা:

  1. নিম্ন নিয়ন্ত্রণযোগ্যতা: তৈরি পাঠ্যের শৈলী, সুর, বিষয়বস্তু বা জটিল নির্দেশনা অনুসরণের উপর সঠিক নিয়ন্ত্রণের জটিলতা। নিয়ন্ত্রণযোগ্যতা ব্যাপকভাবে ইনপুট নির্দেশনার («prompt») গুণমান ও fine-tuning পদ্ধতির উপর নির্ভর করে।
  2. প্রণয়নের প্রতি সংবেদনশীলতা: ইনপুট query (prompt)-এ সামান্য পরিবর্তন উল্লেখযোগ্যভাবে ভিন্ন উত্তর দিতে পারে, এমনকি query-এর semantics অপরিবর্তিত থাকলেও। এটি স্থিতিশীল ও পূর্বানুমানযোগ্য ফলাফল পেতে অসুবিধা সৃষ্টি করে।


IV. নৈতিক ও সামাজিক দিক:

  1. পক্ষপাত ও ন্যায্যতার সমস্যা: মডেলগুলো প্রশিক্ষণ data-য় বিদ্যমান সামাজিক স্টেরিওটাইপ, পক্ষপাত বা বিষাক্ততা পুনরুৎপাদন ও বৃদ্ধি করতে পারে। মডেলের ন্যায্যতা ও নিরাপত্তা নিশ্চিত করা একটি জটিল কাজ।
  2. সংযোজন সমস্যা (LLM Alignment): আরও সাধারণ একটি সমস্যা, যা পূর্ববর্তী বিষয়টি অন্তর্ভুক্ত করে। এটি মডেলের আচরণ মানবিক মূল্যবোধ, উদ্দেশ্য ও নৈতিক নিয়মের সাথে সামঞ্জস্যপূর্ণ করার কাজ। এতে পক্ষপাত, হ্যালুসিনেশন, ক্ষতিকর বিষয়বস্তু উৎপাদনের বিরুদ্ধে লড়াই এবং নিয়ন্ত্রণযোগ্যতা বৃদ্ধি অন্তর্ভুক্ত।
  3. দুরভিসন্ধিমূলক ব্যবহারের ঝুঁকি: বৃহৎ ভাষা মডেল ব্যবহার করে ভুল তথ্য তৈরি ও ব্যাপকভাবে ছড়িয়ে দেওয়া, phishing, spam, ক্ষতিকর কোড বা বিশ্বাসযোগ্য ভুয়া পাঠ্য তৈরির সম্ভাবনা, যা তথ্য ও ব্যক্তিগত নিরাপত্তার হুমকি এবং সমাজে আস্থা ক্ষয়ের কারণ হয়।

তথ্যসূত্র:

  • «বৃহৎ ভাষা মডেল» // উইকিপিডিয়া (রাশিয়ান সংস্করণ)
  • Large Language Model // Wikipedia (English version)
  • Grand Modèle de Langage // Wikipédia (Version française)
  • Sprachmodell // Wikipedia (Deutsche version)
  • Naveed H. এবং অন্যান্য. // A Comprehensive Overview of Large Language Models // arXiv:2307.06435, 2023

সাহিত্য

  • Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
  • Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
  • Brown, T. et al. (2020). Language Models Are Few-Shot Learners. arXiv:2005.14165.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.
  • OpenAI. (2023). GPT-4 Technical Report. arXiv:2303.08774.
  • Touvron, H. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.