Embedding (NLP) (BN)
এমবেডিং (ইংরেজি embedding — «স্থাপন/নিমজ্জন» থেকে) — এটি Machine Learning এবং প্রাকৃতিক ভাষা প্রক্রিয়াকরণের একটি মৌলিক প্রযুক্তি, যা বিচ্ছিন্ন বা জটিল বস্তু (যেমন শব্দ, বাক্য, চিত্র) কে নির্দিষ্ট মাত্রার সংখ্যাসূচক ভেক্টর উপস্থাপনায় রূপান্তরিত করে। এই ভেক্টরগুলো, বা এমবেডিংগুলো, বহুমাত্রিক স্থানে এমনভাবে অবস্থান করে যাতে অর্থগতভাবে সমগোত্রীয় বস্তুগুলো পরস্পরের নিকটে থাকে।
সংজ্ঞা ও ধারণা
আনুষ্ঠানিকভাবে, এমবেডিং হলো একটি ম্যাপিং ফাংশন , যেখানে হলো বস্তুর উৎস স্থান (যেমন শব্দের অভিধান), এবং হলো মাত্রাবিশিষ্ট বহুমাত্রিক ভেক্টর স্থান (এমবেডিং স্থান)। মাত্রা উৎস স্থানের মাত্রার তুলনায় উল্লেখযোগ্যভাবে ছোট, যা এই উপস্থাপনাগুলোকে ঘন (dense) করে তোলে।
শব্দের ভেক্টর উপস্থাপনার তাত্ত্বিক ভিত্তি হলো বিতরণমূলক অর্থবিজ্ঞান (distributive semantics), যা দাবি করে যে কোনো শব্দের অর্থ তার ব্যবহারের প্রেক্ষাপট দ্বারা নির্ধারিত হয়। অর্থাৎ, যেসব শব্দ একই ধরনের প্রেক্ষাপটে পাওয়া যায়, তাদের অর্থ অনুরূপ এবং সুতরাং তাদের ভেক্টর উপস্থাপনাও নিকটবর্তী।
এমবেডিংয়ের মূল নীতিসমূহ
- নির্দিষ্ট মাত্রা: উৎস ডেটার আকার (যেমন বাক্যের দৈর্ঘ্য) নির্বিশেষে সমস্ত বস্তু একই দৈর্ঘ্যের ভেক্টরে ম্যাপ করা হয়।
- অর্থগত নৈকট্য: ভেক্টরগুলোর মধ্যে দূরত্ব (প্রায়শই cosine similarity দিয়ে পরিমাপ করা হয়) উৎস বস্তুগুলোর অর্থগত নৈকট্য প্রতিফলিত করে।
- গাণিতিক অপারেশনের সমর্থন: ভেক্টরগুলো অর্থগত সম্পর্ক সংরক্ষণ করে, যা তাদের উপর বীজগাণিতিক অপারেশন সম্পাদনের সুযোগ দেয়। ক্লাসিক উদাহরণ: ।
ইতিহাস ও বিকাশ
প্রাথমিক পদ্ধতি (১৯৮০–২০০০-এর দশক)
ভেক্টর উপস্থাপনার প্রথম ধারণাগুলো ১৯৮০-এর দশকে Neural Network গবেষণার অংশ হিসেবে আবির্ভূত হয়। প্রাথমিক পদ্ধতিগুলো শব্দের সহ-আবির্ভাবের পরিসংখ্যানগত বিশ্লেষণের উপর ভিত্তি করে গড়ে উঠেছিল।
Word2Vec-এর যুগ (২০১৩)
যুগান্তকারী মুহূর্তটি এলো ২০১৩ সালে তোমাস মিকোলভের নেতৃত্বে Google-এর দল কর্তৃক Word2Vec উদ্ভাবনের মাধ্যমে। Word2Vec শব্দ এমবেডিং প্রশিক্ষণের জন্য দুটি কার্যকর ও গণনামূলকভাবে সাশ্রয়ী আর্কিটেকচার প্রস্তাব করেছিল:
- CBOW (Continuous Bag of Words): আশেপাশের প্রেক্ষাপটের উপর ভিত্তি করে কেন্দ্রীয় শব্দ পূর্বাভাস দেয়।
- Skip-gram: কেন্দ্রীয় শব্দের উপর ভিত্তি করে প্রেক্ষাপটীয় শব্দ পূর্বাভাস দেয়।
Word2Vec মুক্ত সোর্স কোড এবং উচ্চ গতির কারণে ভেক্টর উপস্থাপনার প্রথম জনপ্রিয় বাস্তবায়ন হয়ে ওঠে।
বিকল্প পদ্ধতির বিকাশ
Word2Vec-এর পরে আরও কিছু উল্লেখযোগ্য স্থির এমবেডিং মডেল আবির্ভূত হয়:
- GloVe (২০১৪): স্ট্যানফোর্ড বিশ্ববিদ্যালয়ে উদ্ভাবিত একটি মডেল, যা ভেক্টর প্রশিক্ষণের জন্য শব্দের সহ-আবির্ভাবের বৈশ্বিক পরিসংখ্যান ব্যবহার করে।
- FastText (২০১৫): Facebook-এর একটি মডেল, যা প্রতিটি শব্দকে তার character n-gram ভেক্টরের সমষ্টি হিসেবে উপস্থাপন করে শব্দের রূপতত্ত্ব বিবেচনা করে। এটি প্রশিক্ষণ অভিধানে অনুপস্থিত শব্দগুলোর জন্যও এমবেডিং তৈরি করতে সক্ষম (Out-of-Vocabulary শব্দ)।
Transformer এবং প্রেক্ষাপটীয় এমবেডিংয়ের যুগ (২০১৮–বর্তমান)
Transformer আর্কিটেকচার এবং BERT মডেলের (২০১৮) আবির্ভাবের সাথে সাথে সাফল্য আসে। এটি প্রেক্ষাপটীয় এমবেডিংয়ের উদ্ভব ঘটায়, যেখানে কোনো শব্দের ভেক্টর উপস্থাপনা তার ব্যবহারের প্রেক্ষাপটের উপর নির্ভর করে। স্থির উপস্থাপনার বিপরীতে, যেখানে «চাবি» শব্দটি «দরজার চাবি» এবং «সুরের চাবি» বাক্যে একই ভেক্টর পেত, প্রেক্ষাপটীয় মডেলগুলো প্রতিটি ক্ষেত্রে আলাদা এমবেডিং তৈরি করে।
এমবেডিংয়ের প্রকারভেদ
উপস্থাপনার স্তর অনুযায়ী
- শব্দ এমবেডিং: মৌলিক ধরন, যেখানে প্রতিটি শব্দ আলাদা ভেক্টর দ্বারা উপস্থাপিত হয় (Word2Vec, GloVe)।
- বাক্য ও দলিল এমবেডিং: সম্পূর্ণ বাক্যাংশ, বাক্য বা দলিলকে একটি একক ভেক্টর দ্বারা উপস্থাপন করে (PV-DM, PV-DBOW)।
- ব্যবহারকারী ও বস্তু এমবেডিং: ব্যবহারকারীর আগ্রহ এবং পণ্যের বৈশিষ্ট্য উপস্থাপনের জন্য সুপারিশ ব্যবস্থায় ব্যবহৃত হয়।
প্রেক্ষাপটীয়তা অনুযায়ী
- স্থির এমবেডিং: প্রেক্ষাপট নির্বিশেষে প্রতিটি শব্দকে একটি নির্দিষ্ট ভেক্টর দেওয়া হয় (Word2Vec, GloVe, FastText)।
- প্রেক্ষাপটীয় এমবেডিং: একই শব্দের জন্য তার পারিপার্শ্বিকতার উপর ভিত্তি করে ভিন্ন উপস্থাপনা তৈরি করে। প্রধান প্রতিনিধি:
- BERT: Transformer-ভিত্তিক দ্বিমুখী মডেল।
- ELMo: দ্বিমুখী LSTM মডেল।
- RoBERTa, DistilBERT, ALBERT: BERT-এর উন্নত সংস্করণ।
মোডালিটি অনুযায়ী
- পাঠ্য এমবেডিং: সর্বাধিক প্রচলিত ধরন, যার মধ্যে শব্দ, বাক্য ও দলিলের উপস্থাপনা অন্তর্ভুক্ত।
- দৃশ্যমান এমবেডিং: কম্পিউটার ভিশনের কাজের জন্য চিত্রের উপস্থাপনা।
- মাল্টিমোডাল এমবেডিং: বিভিন্ন ধরনের ডেটা (পাঠ্য, চিত্র, অডিও) একটি একক ভেক্টর স্থানে একত্রিত করে। উদাহরণ হলো ImageBind, যা ছয়টি মোডালিটির ডেটা সংযুক্ত করতে সক্ষম।
আর্কিটেকচার ও প্রশিক্ষণ পদ্ধতি
ক্লাসিক পদ্ধতি
- One-hot কোডিং: সবচেয়ে সহজ পদ্ধতি, যেখানে প্রতিটি শব্দকে অভিধানের আকারের একটি ভেক্টর দিয়ে কোড করা হয়, সংশ্লিষ্ট অবস্থানে একটি এবং বাকি সব শূন্য। অসুবিধাসমূহ: উচ্চ বিরলতা এবং অর্থগত তথ্যের অনুপস্থিতি।
- ম্যাট্রিক্স ফ্যাক্টরাইজেশন: শব্দের সহ-আবির্ভাব ম্যাট্রিক্সে প্রয়োগকৃত মাত্রা হ্রাসের পদ্ধতি (যেমন LSA)।
Neural Network আর্কিটেকচার
- অগভীর Neural Network: Word2Vec-এ CBOW এবং Skip-gram আর্কিটেকচার কার্যকর প্রশিক্ষণের জন্য দুই-স্তরীয় Neural Network ব্যবহার করে।
- Transformer: একটি আর্কিটেকচার যা attention মেকানিজমের মাধ্যমে এই ক্ষেত্রে বিপ্লব এনেছে।
আধুনিক পদ্ধতি
- মাস্ক দিয়ে স্ব-শিক্ষণ: BERT প্রেক্ষাপটীয় উপস্থাপনা প্রশিক্ষণের জন্য মুখোশাবৃত শব্দ পূর্বাভাসের কাজ ব্যবহার করে।
- কনট্রাস্টিভ লার্নিং: এমন পদ্ধতি যা অর্থগতভাবে নিকটবর্তী (ইতিবাচক) জোড়াগুলোর মধ্যে সাদৃশ্য সর্বাধিক করে এবং দূরবর্তী (নেতিবাচক) জোড়াগুলোর মধ্যে সাদৃশ্য হ্রাস করে।
এমবেডিংয়ের প্রয়োগ
এমবেডিং বিভিন্ন ক্ষেত্রে ব্যাপকভাবে ব্যবহৃত হয়:
প্রাকৃতিক ভাষা প্রক্রিয়াকরণ
- অনুসন্ধান ও তথ্য পুনরুদ্ধার: কীওয়ার্ড নয়, অর্থের ভিত্তিতে দলিল খোঁজার সুযোগ দিয়ে অর্থগত অনুসন্ধানের মান উন্নত করা।
- পাঠ্য শ্রেণিবিভাগ: ভেক্টর উপস্থাপনা শ্রেণিকারকগুলোর নির্ভুলতা বাড়িয়ে তাদের ইনপুট ডেটা হিসেবে কাজ করে।
- অনুভূতি বিশ্লেষণ: প্রেক্ষাপট বিবেচনা করে পাঠ্যের আবেগগত রং নির্ধারণ।
- যন্ত্র অনুবাদ: উৎস ও লক্ষ্য ভাষার অর্থ বোঝার উন্নতি।
সুপারিশ ব্যবস্থা
ব্যবহারকারী ও পণ্যের এমবেডিং ব্যক্তিগতকৃত সুপারিশ ব্যবস্থার ভিত্তি গঠন করে, যার মধ্যে রয়েছে:
- কোলাবোরেটিভ ফিল্টারিং: ব্যবহারকারীর আচরণের এমবেডিংয়ের উপর ভিত্তি করে।
- কন্টেন্ট ফিল্টারিং: পণ্যের বৈশিষ্ট্যের এমবেডিং ব্যবহার করে।
কম্পিউটার ভিশন
- চিত্র শ্রেণিবিভাগ ও অনুসন্ধান: Convolutional Neural Network এবং Vision Transformer চিত্রের এমবেডিং তৈরি করে তাদের শ্রেণিবিভাগ ও দৃশ্যগতভাবে অনুরূপ চিত্র অনুসন্ধানের জন্য।
বায়োইনফরম্যাটিক্স ও চিকিৎসা
- চিকিৎসা ডেটা বিশ্লেষণ: ক্লিনিক্যাল রেকর্ড ও রোগ নির্ণয়ের বিশ্লেষণ।
- আণবিক উপস্থাপনা: রাসায়নিক যৌগের বৈশিষ্ট্য পূর্বাভাসের জন্য এমবেডিং তৈরি।
প্রযুক্তিগত দিক ও অপ্টিমাইজেশন
- মাত্রা অপ্টিমাইজেশন পদ্ধতি: Matryoshka Representation Learning (MRL) — একটি উদ্ভাবনী পদ্ধতি যা একটি মডেল থেকে বিভিন্ন মাত্রার এমবেডিং পেতে দেয়, ভেক্টরের শুরুতে গুরুত্বপূর্ণ তথ্য কেন্দ্রীভূত করে।
- এমবেডিং কোয়ান্টাইজেশন: গণনা ত্বরান্বিত করতে ও মেমরি সাশ্রয়ের জন্য সংখ্যার উপস্থাপনার নির্ভুলতা হ্রাস (যেমন ৮ বা ৪ বিটে)।
- ডেটাবেসের সাথে একীভূতকরণ: আধুনিক ভেক্টর ডেটাবেস (যেমন Milvus, Pinecone) এবং প্রচলিত DBMS-এর এক্সটেনশন (যেমন PostgreSQL-এর জন্য pgvector) এমবেডিং কার্যকরভাবে সংরক্ষণ ও অনুসন্ধানের সুযোগ দেয়।
তথ্যসূত্র
- শব্দের ভেক্টর উপস্থাপনা — উইকিপিডিয়া
- শব্দের ভেক্টর উপস্থাপনা — NEERC
সাহিত্য
- Mikolov, T. et al. (2013). Efficient Estimation of Word Representations in Vector Space. arXiv:1301.3781.
- Mikolov, T. et al. (2013). Distributed Representations of Words and Phrases and their Compositionality. arXiv:1310.4546.
- Pennington, J.; Socher, R.; Manning, C. (2014). GloVe: Global Vectors for Word Representation. PDF.
- Bojanowski, P. et al. (2017). Enriching Word Vectors with Subword Information. arXiv:1607.04606.
- Joulin, A. et al. (2017). Bag of Tricks for Efficient Text Classification. arXiv:1607.01759.
- Peters, M. E. et al. (2018). Deep Contextualized Word Representations. ACL Anthology.
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- Reimers, N.; Gurevych, I. (2019). Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. arXiv:1908.10084.
- Kusupati, A. et al. (2022). Matryoshka Representation Learning. arXiv:2205.13147.
- Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision. PMLR 139.
- Girdhar, R. et al. (2023). ImageBind: One Embedding Space To Bind Them All. CVPR 2023.