ROUGE (metric) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

ROUGE (अंग्रेज़ी Recall-Oriented Understudy for Gisting Evaluation का संक्षिप्त रूप — «सारांशीकरण के लिए पूर्णता-उन्मुख प्रतिस्थापन मूल्यांकक») — यह स्वचालित प्रणालियों द्वारा उत्पन्न पाठ सारांशों (संक्षेपों) की गुणवत्ता मापने के लिए स्वचालित मेट्रिक्स का एक समूह है। मूल्यांकन स्वचालित रूप से उत्पन्न सारांश की तुलना एक या अधिक मानव-निर्मित संदर्भ (reference) सारांशों से करके किया जाता है[1]

मूल रूप से यह मेट्रिक स्वचालित पाठ सारांशीकरण के कार्यों के लिए विकसित की गई थी, परंतु इसका उपयोग मशीनी अनुवाद की गुणवत्ता मूल्यांकन में भी किया जाता है। BLEU मेट्रिक से भिन्न, जो सटीकता (precision) मापती है, ROUGE पूर्णता (recall) पर केंद्रित है — यह दर्शाती है कि संदर्भ सारांश के कितने महत्वपूर्ण अंश उत्पन्न पाठ में पुनः प्रस्तुत किए गए।

ROUGE मेट्रिक्स का समूह 2004 में दक्षिणी कैलिफ़ोर्निया विश्वविद्यालय के सूचना विज्ञान संस्थान के शोधकर्ता चिन-यु लिन (Chin-Yew Lin) द्वारा प्रस्तावित किया गया था[2]। ROUGE मेट्रिक्स सारांशीकरण एल्गोरिदम के मूल्यांकन के लिए वास्तविक मानक (de facto standard) बन गई हैं, विशेष रूप से DUC (Document Understanding Conference) जैसी बड़ी प्रतियोगिताओं में इनके उपयोग के बाद।

ROUGE मेट्रिक्स के मुख्य प्रकार

ROUGE परिवार में कई संबंधित मेट्रिक्स शामिल हैं, जिनमें से प्रत्येक विभिन्न मानदंडों के अनुसार सामग्री का प्रतिच्छेदन मापती है[3]:

  • ROUGE-N: n-ग्राम (n शब्दों के अनुक्रम) के आधार पर प्रतिच्छेदन मापती है।
    • ROUGE-1 एकग्राम (unigram) अर्थात् अलग-अलग शब्दों का प्रतिच्छेदन परिकलित करती है।
    • ROUGE-2 द्विग्राम (bigram) अर्थात् क्रमिक शब्दों के जोड़ों का प्रतिच्छेदन परिकलित करती है।
  • ROUGE-L: उत्पन्न और संदर्भ सारांश के बीच दीर्घतम उभयनिष्ठ उपक्रम (Longest Common Subsequence, LCS) पर आधारित है। यह मेट्रिक वाक्य-संरचना स्तर पर मिलान को ध्यान में रखती है, क्योंकि यह एक ही क्रम में आने वाले, परंतु आवश्यक रूप से लगातार न होने वाले शब्दों के सबसे लंबे अनुक्रम को मापती है।
  • ROUGE-W: ROUGE-L का एक संशोधन (Weighted LCS) है, जो उन उभयनिष्ठ उपक्रमों को अधिक भार देता है जो लगातार शब्दों से मिलकर बने हों, ताकि निरंतर वाक्यांश-मिलान को प्रोत्साहित किया जा सके।
  • ROUGE-S और ROUGE-SU: छोड़ी हुई द्विग्राम (skip-bigrams) के मिलान पर आधारित मेट्रिक्स हैं। छोड़ी हुई द्विग्राम शब्दों का वह जोड़ा है जो दोनों पाठों में एक ही क्रम में, परंतु आवश्यक रूप से लगातार नहीं, उपस्थित हो। इससे शब्दों के बीच छोड़ों वाले मिलान को भी ध्यान में रखा जा सकता है।
    • ROUGE-SU ROUGE-S का विस्तार है जो एकग्राम मिलान को भी ध्यान में रखता है, ताकि बिना किसी मिलान वाले शब्द-जोड़े वाले सारांशों के लिए शून्य स्कोर से बचा जा सके।

प्रत्येक मेट्रिक की गणना पूर्णता (recall), सटीकता (precision) या उनके हार्मोनिक माध्य (F-माप) के रूप में की जा सकती है। परंपरागत रूप से सारांशीकरण कार्यों में पूर्णता (ROUGE-N recall) पर बल दिया जाता है, क्योंकि यह महत्वपूर्ण है कि मॉडल मूल पाठ से अधिकतम प्रमुख जानकारी निकाल सके।

उपयोग एवं महत्व

ROUGE मेट्रिक्स सारांशीकरण एल्गोरिदम के वस्तुनिष्ठ मूल्यांकन के लिए एक मानक उपकरण बन गई हैं। 2000 के दशक के मध्य से, स्वचालित सारांशीकरण पर लगभग सभी प्रतियोगिताओं (जैसे DUC और TAC) ने प्रणालियों की रैंकिंग के लिए ROUGE का उपयोग किया। मेट्रिक की लोकप्रियता इसकी सरलता और सिद्ध प्रभावशीलता से उत्पन्न होती है: n-ग्राम प्रतिच्छेदन सारांश सामग्री को प्रतिबिंबित करने के लिए पर्याप्त विश्वसनीय संकेतक साबित हुआ।

नेटवर्क-आधारित मॉडलों और LLM के आगमन के साथ ROUGE की भूमिका बनी रही, परंतु इसकी व्याख्या जटिल हो गई। आधुनिक मॉडल इतने उच्च गुणवत्ता वाले सारांश उत्पन्न करते हैं कि पारंपरिक मेट्रिक्स एक «सीमा» तक पहुँच सकती हैं और गुणवत्ता की बारीकियों में खराब भेद कर सकती हैं, जिसने नए मूल्यांकन विधियों के विकास को प्रोत्साहित किया है[4]

सीमाएँ और आलोचना

लोकप्रियता के बावजूद, ROUGE की कुछ ज्ञात सीमाएँ हैं:

  • सतही प्रकृति: मेट्रिक केवल शाब्दिक मिलान पर निर्भर करती है और शब्दार्थ समतुल्यता का मूल्यांकन करने में असमर्थ है। यह एक अच्छे सारांश का स्कोर कम कर सकती है यदि उसमें पर्यायवाची शब्द या पुनः शब्दांकन का उपयोग किया गया हो।
  • पाठ गुणवत्ता की उपेक्षा: ROUGE व्याकरणिक शुद्धता, संसक्तता या पठनीयता का मूल्यांकन नहीं करती। कोई मॉडल संदर्भ से महत्वपूर्ण अंशों को केवल दोहराकर उच्च स्कोर प्राप्त कर सकता है, भले ही परिणामी पाठ असंबद्ध हो।
  • संदर्भ सारांश पर निर्भरता: मूल्यांकन की गुणवत्ता सीधे संदर्भ सारांश की गुणवत्ता और पूर्णता पर निर्भर करती है। यदि संदर्भ खराब तरीके से लिखा गया हो, तो मूल्यांकन अविश्वसनीय होगा।
  • तथ्य मूल्यांकन का अभाव: मेट्रिक तथ्यात्मक सटीकता की जाँच करने में असमर्थ है। यदि गलत तथ्य संदर्भ के बजाय स्रोत से कॉपी किए गए हों तो कोई सारांश उच्च ROUGE स्कोर प्राप्त कर सकता है, परंतु उसमें गलत तथ्य हो सकते हैं।

विकल्प एवं आधुनिक दृष्टिकोण

ROUGE की सीमाओं ने वैकल्पिक मूल्यांकन विधियों के विकास को प्रोत्साहित किया:

  • शब्दार्थ-उन्मुख मेट्रिक्स: शब्दों के सटीक मिलान के बजाय अर्थ स्तर पर समानता मापने का प्रयास करती हैं। उदाहरणों में BERTScore शामिल है, जो उत्पन्न और संदर्भ पाठों के सदिश प्रतिनिधित्व (embedding) की तुलना करता है।
  • संयुक्त मेट्रिक्स: शाब्दिक और शब्दार्थ मानदंडों को मिलाती हैं। उदाहरण के लिए, ROUGE-SEM दृष्टिकोण क्लासिक ROUGE को embedding-आधारित शब्दार्थ समानता मॉड्यूल के साथ पूरक बनाता है, ताकि पुनः शब्दांकित पाठों का बेहतर मूल्यांकन किया जा सके[5]
  • LLM-आधारित मेट्रिक्स: आधुनिक दृष्टिकोण, जिनमें शक्तिशाली मॉडल (जैसे GPT) कई मानदंडों के आधार पर सारांश गुणवत्ता का मूल्यांकन करने के लिए «न्यायाधीश» की भूमिका निभाते हैं, मानव विशेषज्ञ मूल्यांकन का अनुकरण करते हुए।

निष्कर्षतः, ROUGE ने स्वचालित सारांशीकरण के मूल्यांकन के लिए एक सरल और प्रभावी उपकरण के रूप में अपनी पहचान स्थापित की है। अधिक जटिल मेट्रिक्स के उद्भव के बावजूद, ROUGE अपनी सभी कमियों के साथ भी NLP शोधकर्ताओं के शस्त्रागार में एक अपरिहार्य आधारभूत उपकरण बनी हुई है।

संदर्भ सूत्र

  • ROUGE पर चिन-यु लिन का मूल शोधपत्र (2004)

टिप्पणियाँ

  1. «ROUGE (metric)». Wikipedia. [१]
  2. Lin, Chin-Yew. «ROUGE: A Package for Automatic Evaluation of Summaries». Proceedings of the ACL-04 Workshop on Text Summarization Branches Out, 2004. [२]
  3. «ROUGE (Recall-Oriented Understudy for Gisting Evaluation) Performance Metric». GM-RKB. [३]
  4. Deutsch, Daniel, and Rotem Dror. «A Statistical Analysis of Summarization Evaluation Metrics». Transactions of the Association for Computational Linguistics, vol. 9, 2021, pp. 495-508. [४]
  5. Zhang, M., et al. «ROUGE-SEM: Better evaluation of summarization using ROUGE combined with semantics». Expert Systems with Applications, vol. 237, 2024, p. 121364. [५]