BERT (language model) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

BERT (Bidirectional Encoder Representations from Transformers, ट्रांसफॉर्मर्स से द्विदिशात्मक एनकोडर प्रतिनिधित्व) — यह एक बड़ी भाषा मॉडल (LLM) है जो प्राकृतिक भाषा की समझ के लिए बनाई गई है। इसे Google के शोधकर्ताओं ने विकसित किया और 2018 में प्रस्तुत किया। BERT ने प्राकृतिक भाषा प्रसंस्करण (NLP) में एक नए युग की शुरुआत की, जिसने कार्यों की एक विस्तृत श्रृंखला पर अभूतपूर्व प्रदर्शन प्रदर्शित किया और «pre-train & fine-tune» की प्रतिमान को उद्योग में मानक के रूप में स्थापित किया।

BERT की मुख्य नवीनता इसकी गहरी द्विदिशात्मक architecture है, जो मॉडल को नेटवर्क की सभी परतों में एक साथ बाएँ और दाएँ दोनों ओर से शब्द के संदर्भ को ध्यान में रखने की अनुमति देती है। यह एक नई pre-training कार्य — Masked Language Modeling (MLM) — के माध्यम से प्राप्त किया जाता है।

नामकरण और कार्य सिद्धांत

संक्षिप्त नाम BERT का पूर्ण रूप Bidirectional Encoder Representations from Transformers है।

  • Bidirectional (द्विदिशात्मक): यह मॉडल की मुख्य विशेषता को दर्शाता है — शब्द के संदर्भ को एक साथ दोनों दिशाओं (बाएँ से दाएँ और दाएँ से बाएँ) में संसाधित करने की क्षमता। एकदिशात्मक मॉडलों (जैसे GPT) के विपरीत, जो किसी शब्द को संसाधित करते समय केवल उससे पहले का संदर्भ देखते हैं, BERT पूरी अनुक्रम को एक साथ देखता है, जिससे वह शब्द के अर्थ की गहरी और अधिक सटीक समझ बना पाता है।
  • Encoder (एनकोडर): इसका अर्थ है कि BERT Transformer architecture के केवल एनकोडिंग भाग का उपयोग करता है। एनकोडर का कार्य इनपुट टेक्स्ट अनुक्रम को पढ़ना और प्रत्येक token के लिए एक समृद्ध संदर्भात्मक प्रतिनिधित्व (वेक्टर) बनाना है। BERT को decoder मॉडलों की तरह स्वतंत्र रूप से टेक्स्ट उत्पन्न करने के लिए नहीं बनाया गया है।
  • Representations (प्रतिनिधित्व): मॉडल शब्दों और वाक्यों के लिए उच्च-गुणवत्ता वाले संख्यात्मक प्रतिनिधित्व (वेक्टर या embedding) बनाने के लिए प्रशिक्षित होता है, जिन्हें बाद में विभिन्न NLP कार्यों को हल करने के लिए उपयोग किया जा सकता है।
  • from Transformers: यह इंगित करता है कि मॉडल की architecture पूरी तरह से Transformer पर आधारित है।

निर्माण का इतिहास

BERT का विकास NLP में कई प्रमुख सफलताओं का परिणाम था:

  1. संदर्भात्मक embedding: Word2vec और GloVe जैसे मॉडल शब्दों के लिए स्थिर वेक्टर बनाते थे, जो संदर्भ को ध्यान में नहीं रखते थे। ELMo मॉडल (2018) ने द्विदिशात्मक LSTM नेटवर्क का उपयोग करके संदर्भ-निर्भर प्रतिनिधित्व उत्पन्न करके एक कदम आगे बढ़ाया, हालाँकि यह द्विदिशात्मकता «सतही» थी (दो एकदिशात्मक मॉडलों का संयोजन)।
  2. Transfer Learning और GPT: 2018 के मध्य में OpenAI ने GPT मॉडल प्रस्तुत किया, जिसने बिना लेबल वाले डेटा पर एक बड़े transformer मॉडल को pre-train करने और फिर विशिष्ट कार्यों पर fine-tuning करने की प्रभावशीलता को प्रदर्शित किया। हालाँकि, GPT सख्त रूप से एकदिशात्मक (left-to-right) था, जिसने पूर्ण संदर्भ की समझ की आवश्यकता वाले कार्यों में इसकी क्षमताओं को सीमित किया।

इन सीमाओं को पहचानते हुए, Jacob Devlin के नेतृत्व में Google के शोधकर्ताओं ने BERT विकसित किया ताकि एक वास्तव में गहरी द्विदिशात्मक मॉडल बनाई जा सके। BERT पर लेख अक्टूबर 2018 में arXiv पर प्रकाशित हुआ, और कोड तथा pre-trained मॉडल सार्वजनिक रूप से उपलब्ध कराए गए, जिससे वैज्ञानिक समुदाय में जबरदस्त रुचि पैदा हुई। BERT ने NLP के 11 प्रमुख benchmark पर रिकॉर्ड तोड़े, जिनमें GLUE और SQuAD शामिल हैं, और इसे NLP के लिए «ImageNet का क्षण» कहा गया, क्योंकि एक सार्वभौमिक मॉडल को कई कार्यों के लिए आसानी से अनुकूलित किया जा सकता था।

Architecture

BERT पूरी तरह से Transformer architecture के एनकोडिंग भाग (encoder) पर आधारित है। यह एक-दूसरे के ऊपर रखी कई समान परतों से बना है। दो मुख्य संस्करण हैं:

  • BERT-Base: 12 परतें, 12 attention head, hidden state का आकार 768, कुल पैरामीटर संख्या ~110 मिलियन।
  • BERT-Large: 24 परतें, 16 attention head, hidden state का आकार 1024, कुल पैरामीटर संख्या ~340 मिलियन।

प्रत्येक परत में दो मुख्य उप-परतें होती हैं:

  1. Multi-Head Self-Attention तंत्र: यह इनपुट अनुक्रम में प्रत्येक token को अन्य सभी token पर «ध्यान देने» की अनुमति देता है, जिससे अपने स्वयं के संदर्भात्मक अर्थ को निर्धारित करने के लिए उनके महत्व का भार निर्धारण होता है।
  2. पूर्ण-संयोजित तंत्रिका नेटवर्क (Feed-Forward Network): प्रत्येक token पर अलग-अलग लागू किया जाता है।

इनपुट डेटा

सही ढंग से कार्य करने के लिए BERT को इनपुट डेटा के विशेष स्वरूपण की आवश्यकता होती है। इनपुट पर दिए जाने वाले token अनुक्रम की शुरुआत हमेशा विशेष token `[CLS]` (classification) से होती है, जिसका उपयोग पूरे टेक्स्ट के वर्गीकरण कार्यों के लिए किया जाता है। यदि इनपुट पर एक जोड़ी वाक्य दिए जाते हैं (उदाहरण के लिए, प्रश्न-उत्तर प्रणाली के कार्यों में), तो उन्हें token `[SEP]` (separator) से अलग किया जाता है।

इनपुट पर प्रत्येक token का अंतिम प्रतिनिधित्व तीन embedding का योग होता है:

  • Token embedding: शब्दकोश से किसी विशेष token के अनुरूप वेक्टर (BERT WordPiece tokenization का उपयोग करता है)।
  • Segment embedding: यह इंगित करता है कि token किस वाक्य (पहले या दूसरे) से संबंधित है।
  • Positional embedding: अनुक्रम में token की स्थिति को इंगित करता है, क्योंकि Transformer architecture स्वयं शब्दों के क्रम को ध्यान में नहीं रखती।

Pre-training कार्य

गहरी द्विदिशात्मकता सुनिश्चित करने के लिए, BERT को एक साथ दो अनूठे कार्यों पर प्रशिक्षित किया जाता है।

Masked Language Modeling (MLM)

यह BERT की प्रमुख नवीनता है। मानक भाषा मॉडलों की तरह अगले शब्द की भविष्यवाणी करने के बजाय, BERT वाक्य में यादृच्छिक रूप से «मास्क किए गए» शब्दों की भविष्यवाणी करता है। प्रक्रिया इस प्रकार दिखती है:

  • इनपुट अनुक्रम से 15% token यादृच्छिक रूप से चुने जाते हैं।
  • इन 15% में से:
    • 80% को विशेष token `[MASK]` से बदल दिया जाता है।
    • 10% को शब्दकोश से एक यादृच्छिक token से बदल दिया जाता है।
    • 10% अपरिवर्तित रहते हैं।
  • मॉडल का कार्य इन 15% token के मूल मान की भविष्यवाणी करना है, उनके आस-पास के (बाएँ और दाएँ) संदर्भ के आधार पर।

यह योजना मॉडल को शब्दों के बीच गहरे शब्दार्थ और वाक्यात्मक संबंधों का अध्ययन करने के लिए बाध्य करती है और उसे वास्तव में द्विदिशात्मक बनाती है।

Next Sentence Prediction (NSP)

इस कार्य को BERT को वाक्यों के बीच संबंधों को समझना सिखाने के लिए विकसित किया गया था, जो प्रश्न-उत्तर प्रणाली या पाठ निहितार्थ विश्लेषण (NLI) जैसे कार्यों के लिए अत्यंत महत्वपूर्ण है। मॉडल को इनपुट पर वाक्यों की एक जोड़ी (A और B) दी जाती है, और उसे भविष्यवाणी करनी होती है कि क्या वाक्य B, वाक्य A का तार्किक अनुसरण है।

  • 50% मामलों में B वास्तव में मूल टेक्स्ट से अगला वाक्य होता है।
  • 50% मामलों में B corpus में किसी अन्य स्थान से लिया गया एक यादृच्छिक वाक्य होता है।

बाद के शोधों (उदाहरण के लिए, RoBERTa मॉडल में) ने दिखाया कि NSP कार्य MLM की तुलना में कम महत्वपूर्ण है, और अधिक प्रभावी प्रशिक्षण योजनाओं के पक्ष में इसे छोड़ा जा सकता है, लेकिन मूल BERT में इसने महत्वपूर्ण भूमिका निभाई।

अनुप्रयोग और Fine-Tuning

BERT की शक्ति transfer learning की प्रतिमान में निहित है। विशाल corpus (Wikipedia + BooksCorpus) पर व्यापक और महंगे pre-training के बाद, pre-trained मॉडल को किसी विशिष्ट व्यावहारिक कार्य के लिए आसानी और तेजी से fine-tune किया जा सकता है।

Fine-tuning की प्रक्रिया आमतौर पर इस प्रकार दिखती है: 1. Pre-trained BERT की architecture में एक छोटी, अप्रशिक्षित, कार्य-विशिष्ट परत जोड़ी जाती है (उदाहरण के लिए, भावना विश्लेषण के लिए एक classifier)। 2. पूरे मॉडल (BERT के वज़न और नई परत सहित) को उस विशिष्ट कार्य के लिए एक छोटे, लेबल किए गए dataset पर प्रशिक्षित किया जाता है।

ऐसे कार्यों के उदाहरण जिनके लिए BERT अनुकूलित किया जाता है:

  • टेक्स्ट वर्गीकरण (भावना विश्लेषण, स्पैम फ़िल्टर): `[CLS]` token के आउटपुट में एक classifier जोड़ा जाता है।
  • प्रश्न-उत्तर प्रणाली (उदाहरण के लिए, SQuAD): मॉडल दिए गए टेक्स्ट में उत्तर के प्रारंभिक और अंतिम token की भविष्यवाणी करना सीखता है।
  • नामित इकाई पहचान (NER): प्रत्येक token के आउटपुट में एक classifier जोड़ा जाता है जो यह निर्धारित करता है कि token किसी नाम, संगठन, तारीख आदि का हिस्सा है या नहीं।

प्रकार और व्युत्पन्न मॉडल

BERT की सफलता ने उसके विचारों पर आधारित मॉडलों के एक पूरे परिवार को जन्म दिया:

  • RoBERTa (Facebook AI से): «मज़बूती से अनुकूलित BERT»। यह एक नई architecture नहीं है, बल्कि BERT के अधिक सावधानीपूर्वक और लंबे प्रशिक्षण का परिणाम है: अधिक डेटा पर, NSP कार्य के बिना और dynamic masking के साथ। RoBERTa ने दिखाया कि मूल BERT «कम प्रशिक्षित» था, और सभी प्रमुख benchmark पर उसे पीछे छोड़ दिया।
  • DistilBERT (Hugging Face से): Knowledge distillation तकनीक का उपयोग करके बनाया गया BERT का एक छोटा संस्करण। DistilBERT आकार में 40% छोटा, गति में 60% तेज़ है और BERT के 97% प्रदर्शन को बनाए रखता है, जो इसे production उपयोग और सीमित संसाधनों वाले उपकरणों के लिए आदर्श बनाता है।
  • ALBERT (A Lite BERT, Google से): पैरामीटर की संख्या कम करने के लिए अनुकूलित संस्करण। दो प्रमुख तकनीकों का उपयोग करता है: embedding का फैक्टराइज़ेशन और cross-layer parameter sharing। यह कम पैरामीटर के साथ बहुत बड़े मॉडल बनाने की अनुमति देता है।
  • mBERT (Multilingual BERT): BERT का एक संस्करण जिसे एक साथ 104 भाषाओं पर pre-train किया गया। इसने cross-lingual ज्ञान हस्तांतरण की놀라उकी क्षमता प्रदर्शित की।
  • डोमेन-विशिष्ट मॉडल: कई मॉडल जिन्हें विशिष्ट क्षेत्रों के डेटा पर fine-tune किया गया है, जैसे BioBERT (जैव-चिकित्सा), SciBERT (वैज्ञानिक टेक्स्ट) और FinBERT (वित्त)।
  • ModernBERT (2024-2025): Answer.AI और LightOn कंपनियों के BERT-जैसे मॉडलों की नई पीढ़ी, जिसमें RoPE (Rotary Position Embeddings) और लंबे context के लिए समर्थन (8192 token तक) जैसे आधुनिक architectural सुधार शामिल हैं, साथ ही BERT के मूल सिद्धांतों को बनाए रखा गया है।

अन्य मॉडलों से तुलना

BERT की अन्य प्रमुख architectures से तुलना
मॉडल डेवलपर Architecture संदर्भ की दिशा मुख्य कार्य
BERT Google Encoder द्विदिशात्मक टेक्स्ट समझ, वर्गीकरण, निष्कर्षण
GPT OpenAI Decoder एकदिशात्मक (बाएँ से दाएँ) टेक्स्ट उत्पादन, अनुक्रम जारी रखना
XLNet Google / CMU Autoregressive (permutation-based) द्विदिशात्मक (सिद्धांत में) टेक्स्ट समझ (MLM का विकल्प)
T5 Google Encoder-Decoder द्विदिशात्मक (encoder) + एकदिशात्मक (decoder) सार्वभौमिक «text-to-text» रूपांतरण

प्रभाव

BERT ने NLP में एक वास्तविक क्रांति उत्पन्न की और कई बाद के विकासों की नींव रखी:

  1. «pre-train + fine-tune» प्रतिमान को NLP में प्रमुख दृष्टिकोण के रूप में स्थापित किया।
  2. भाषा की समझ के लिए गहरे द्विदिशात्मक संदर्भ के महत्व को सिद्ध किया।
  3. उच्च-प्रदर्शन NLP प्रणालियों के निर्माण के लिए प्रवेश की बाधा को कम किया, क्योंकि शोधकर्ताओं और डेवलपर्स को अब प्रत्येक कार्य के लिए शुरू से जटिल architecture बनाने की आवश्यकता नहीं थी।
  4. Google Search में एकीकृत किया गया, जो खोज इंजन के पूरे इतिहास में सबसे बड़े अद्यतनों में से एक बन गया और मॉडल के व्यावहारिक लाभ को स्पष्ट रूप से प्रदर्शित किया।
  5. व्युत्पन्न मॉडलों, उपकरणों और शोधों («BERTology») की एक पूरी पारिस्थितिकी तंत्र को जन्म दिया, AI के क्षेत्र में सबसे अधिक उद्धृत कार्यों में से एक बन गया।

हालाँकि GPT-3 और GPT-4 जैसे नए और बड़े मॉडलों ने कई benchmark पर BERT को पीछे छोड़ दिया है (विशेष रूप से उत्पादन कार्यों में), BERT और उसके प्रकार आज भी गहरी टेक्स्ट समझ की आवश्यकता वाले कार्यों के लिए एक शक्तिशाली और व्यापक रूप से उपयोग किए जाने वाले उपकरण बने हुए हैं।

संदर्भ

  • GitHub पर BERT का आधिकारिक repository
  • Google AI ब्लॉग पर BERT की घोषणा
  • The Illustrated BERT — BERT architecture की दृश्य व्याख्या

साहित्य

  • Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
  • Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
  • Peters, M. E. et al. (2018). Deep Contextualized Word Representations. arXiv:1802.05365.
  • Liu, Y. et al. (2019). RoBERTa: A Robustly Optimized BERT Pretraining Approach. arXiv:1907.11692.
  • Lan, Z. et al. (2020). ALBERT: A Lite BERT for Self-supervised Learning of Language Representations. arXiv:1909.11942.
  • Sanh, V. et al. (2020). DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter. arXiv:1910.01108.
  • Yang, Z. et al. (2019). XLNet: Generalized Autoregressive Pretraining for Language Understanding. arXiv:1906.08237.
  • Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683.
  • Lee, J. et al. (2020). BioBERT: a pre-trained biomedical language representation model for biomedical text mining. arXiv:1901.08746.
  • Warner, B. et al. (2024). Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference. arXiv:2412.13663.