METEOR (metric) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

METEOR — यह नाम प्राकृतिक भाषा प्रसंस्करण (NLP) के क्षेत्र में कई संबंधित, किंतु भिन्न अवधारणाओं के लिए प्रयुक्त होता है। सबसे पहले, यह मशीनी अनुवाद की गुणवत्ता मूल्यांकन के लिए एक प्रसिद्ध स्वचालित मेट्रिक है। इसके अतिरिक्त, वर्ष 2024 में इसी नाम से बड़े भाषा मॉडलों (LLM) से संबंधित दो स्वतंत्र शोध परियोजनाएँ प्रस्तुत की गईं: एक विकासवादी प्रशिक्षण विधि और एक मल्टीमोडल भाषा मॉडल।

METEOR - अनुवाद गुणवत्ता मूल्यांकन मेट्रिक

METEOR (संक्षिप्त रूप Metric for Evaluation of Translation with Explicit ORdering) — मशीनी अनुवाद की गुणवत्ता मूल्यांकन के लिए एक स्वचालित मेट्रिक है, जिसे 2005 में कार्नेगी मेलन विश्वविद्यालय के शोधकर्ताओं सतनजीव बनर्जी और एलोन लावी द्वारा प्रस्तावित किया गया था[1]। इसका उद्देश्य स्वचालित मूल्यांकनों और मानवीय निर्णयों के बीच सहसंबंध को बढ़ाना था, विशेष रूप से वाक्य स्तर पर, तथा पूर्ववर्ती मेट्रिक BLEU की कुछ कमियों को दूर करना था।

METEOR मेट्रिक की प्रमुख विशेषताएँ:

  • सटीकता और पूर्णता का ध्यान: BLEU के विपरीत, जो केवल precision पर केंद्रित है, METEOR precision और recall के बीच हार्मोनिक माध्य की गणना करता है, जिससे महत्वपूर्ण शब्दों को छोड़ने पर अनुवाद को दंडित किया जाता है।
  • लचीला शब्द मिलान: METEOR अनुवाद को संदर्भ के साथ मिलाने के लिए भाषाई विशेषताओं का उपयोग करता है। यह न केवल सटीक मिलान, बल्कि शब्दों के विभिन्न रूपों (stemming के माध्यम से) और पर्यायवाची शब्दों (WordNet के माध्यम से) को भी ध्यान में रखता है।
  • शब्द क्रम उल्लंघन पर दंड: इस मेट्रिक में एक दंड शामिल किया गया है जो उम्मीदवार अनुवाद में गलत शब्द क्रम के लिए दंडित करता है, भले ही सभी शब्द संदर्भ से मेल खाते हों।

ये सुधार METEOR मेट्रिक को BLEU की तुलना में मानवीय मूल्यांकनों के साथ काफी बेहतर सहसंबंध स्थापित करने में सक्षम बनाते हैं[2]। यह मेट्रिक मशीनी अनुवाद, स्वचालित सारांशीकरण और छवि विवरण मूल्यांकन के शोध में व्यापक रूप से प्रयुक्त होती है[3]

METEOR - LLM के विकासवादी प्रशिक्षण की विधि

वर्ष 2024 में चीनी शोधकर्ताओं के एक समूह ने METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth नामक विधि प्रस्तुत की[4]। यह विधि संकीर्ण विषय क्षेत्रों (जैसे वित्त, चिकित्सा) में विशेषज्ञ LLM के कुशल प्रशिक्षण के लिए बनाई गई है, जिसमें मॉडल को शुरू से प्रशिक्षित करने की आवश्यकता नहीं होती।

लेखक LLM की «विकास» की तीन-चरणीय योजना का वर्णन करते हैं:

  1. शक्तिशाली मॉडल से कमजोर मॉडल में ज्ञान आसवन (weak-to-strong data distillation): प्रशिक्षण डेटा उत्पन्न करने के लिए एक अधिक शक्तिशाली «शिक्षक» मॉडल (जैसे GPT-4) का उपयोग किया जाता है। इसमें डोमेन मॉडल पहले समाधान की योजना बनाता है, और शक्तिशाली मॉडल उस योजना का अनुसरण करते हुए उत्तर तैयार करता है। इससे ज्ञान का वितरण संतुलित होता है और लक्ष्य मॉडल उसे अधिक प्रभावी ढंग से आत्मसात कर पाता है।
  2. बाहरी प्रतिक्रिया के साथ पुनरावृत्त प्रशिक्षण (guided iterative training): पहले चरण में प्रशिक्षित मॉडल स्वतंत्र रूप से कार्य हल करता है, और शक्तिशाली मॉडल «रेफरी» की भूमिका निभाते हुए उत्तरों का मूल्यांकन करता है तथा त्रुटियों की ओर संकेत करता है। यह चिंतनशील चक्र डोमेन मॉडल में आत्म-परीक्षण की क्षमता विकसित करता है।
  3. स्व-विकास (self-evolution): मॉडल बिना किसी बाहरी संरक्षक के अपने संचित कौशल का उपयोग करते हुए नए डेटा के निर्माण और सुधार के माध्यम से स्वयं को बेहतर बनाता रहता है।

यह विधि विशिष्ट उद्योगों के लिए संक्षिप्त और किफायती LLM विशेषज्ञों के निर्माण हेतु एक व्यावहारिक दृष्टिकोण प्रस्तुत करती है[5]

METEOR - मल्टीमोडल LLM मॉडल

इसी वर्ष 2024 में KAIST के शोधकर्ताओं की एक टीम ने METEOR: Mamba-based Traversal of Rationales नामक एक बड़ा मल्टीमोडल भाषा मॉडल प्रस्तुत किया[6]। यह मॉडल दृश्य जानकारी की समग्र समझ और दृश्य प्रश्नों के उत्तर उत्पन्न करने के लिए बनाया गया है।

METEOR की मुख्य विशेषता विस्तृत तर्क-श्रृंखलाओं (rationales) का उपयोग है। मॉडल केवल अंतिम उत्तर प्रदान नहीं करता, बल्कि एक छिपी हुई «तर्क-श्रृंखला» उत्पन्न करता है और उस पर निर्भर करता है — एक क्रमिक स्पष्टीकरण कि उस उत्तर तक कैसे पहुँचा जाए, ठीक उसी प्रकार जैसे कोई मनुष्य तर्क करता है।

METEOR की वास्तुकला में Mamba मॉडल पर आधारित एक विशेष मॉड्यूल का उपयोग किया गया है — यह बहुत लंबी अनुक्रमों की प्रसंस्करण के लिए एक कुशल वास्तुकला है। यह मॉड्यूल लंबी तर्क-श्रृंखलाओं को एन्कोड करता है, जिनमें छवि में वस्तुओं का वर्णन, उनके स्थानिक संबंध और कार्य हल करने के चरण शामिल हो सकते हैं[7]

इस मॉडल का जटिल मल्टीमोडल benchmark परीक्षणों पर सफलतापूर्वक परीक्षण किया गया, जैसे MME, AI2D (आरेख समझ) और MathVista (दृश्य संदर्भ में गणितीय समस्या समाधान)। इसने उच्च परिणाम दिखाए, बिना किसी अतिरिक्त बाहरी कंप्यूटर दृष्टि मॉड्यूल की आवश्यकता के, जो इसके अपने मापदंडों के कुशल उपयोग का संकेत देता है[7]

टिप्पणियाँ

  1. Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [१]
  2. Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [२]
  3. «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [३]
  4. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [४]
  5. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [५]
  6. Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [६]
  7. 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [७]