ROUGE (metric) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

ROUGE (সংক্ষিপ্ত রূপ ইংরেজি Recall-Oriented Understudy for Gisting Evaluation থেকে — «পূর্ণতা-কেন্দ্রিক সারসংক্ষেপ মূল্যায়নের বিকল্প মূল্যায়নকারী») — এটি স্বয়ংক্রিয় পদ্ধতিতে সিস্টেম-জেনারেটেড টেক্সট সারসংক্ষেপের (সংক্ষিপ্তসার) মান মূল্যায়নের জন্য একটি স্বয়ংক্রিয় মেট্রিক্সের সংকলন। মূল্যায়ন প্রক্রিয়ায় স্বয়ংক্রিয়ভাবে তৈরি সারসংক্ষেপকে মানুষের তৈরি এক বা একাধিক রেফারেন্স সারসংক্ষেপের সাথে তুলনা করা হয়[1]

মূলত এই মেট্রিক্সটি স্বয়ংক্রিয় টেক্সট সারসংক্ষেপের কাজের জন্য তৈরি হয়েছিল, তবে এটি মেশিন ট্রান্সলেশনের মান মূল্যায়নেও ব্যবহৃত হয়। BLEU মেট্রিক্সের বিপরীতে — যা নির্ভুলতা (precision) পরিমাপ করে — ROUGE পূর্ণতার (recall) উপর মনোযোগ দেয়: এটি দেখায় যে রেফারেন্স সারসংক্ষেপের কতটুকু গুরুত্বপূর্ণ অংশ জেনারেটেড টেক্সটে পুনরুৎপাদিত হয়েছে।

ROUGE মেট্রিক্সের সংকলনটি ২০০৪ সালে ইউনিভার্সিটি অব সাদার্ন ক্যালিফোর্নিয়ার ইনফরমেশন সায়েন্সেস ইনস্টিটিউটের গবেষক Chin-Yew Lin (চিন-ইউ লিন) প্রস্তাব করেন[2]। ROUGE মেট্রিক্স সারসংক্ষেপ অ্যালগরিদম মূল্যায়নের ডি-ফ্যাক্টো মান হয়ে উঠেছে, বিশেষত DUC (Document Understanding Conference)-এর মতো বড় প্রতিযোগিতায় ব্যবহারের পর থেকে।

ROUGE মেট্রিক্সের মূল রূপভেদ

ROUGE পরিবারে বেশ কয়েকটি সম্পর্কিত মেট্রিক্স রয়েছে, যার প্রতিটি বিভিন্ন মানদণ্ডে কন্টেন্টের ছেদ পরিমাপ করে[3]:

  • ROUGE-N: n-গ্রাম (n শব্দের ক্রম) দ্বারা ছেদ পরিমাপ করে।
    • ROUGE-1 ইউনিগ্রাম (একক শব্দ) ছেদ গণনা করে।
    • ROUGE-2 বাইগ্রাম (পরপর শব্দের জুটি) ছেদ গণনা করে।
  • ROUGE-L: জেনারেটেড ও রেফারেন্স সারসংক্ষেপের মধ্যে দীর্ঘতম সাধারণ উপক্রম (Longest Common Subsequence, LCS)-এর উপর ভিত্তি করে তৈরি। এই মেট্রিক্স বাক্যের কাঠামোর স্তরে মিল বিবেচনা করে, কারণ এটি একই ক্রমে থাকা কিন্তু অবশ্যই পরপর নয় এমন শব্দের দীর্ঘতম ক্রম পরিমাপ করে।
  • ROUGE-W: ROUGE-L-এর একটি পরিবর্তন (Weighted LCS), যা পরপর শব্দ দিয়ে গঠিত সাধারণ উপক্রমগুলিকে বেশি গুরুত্ব দেয়, অবিচ্ছিন্ন বাক্যাংশ মিলকে উৎসাহিত করে।
  • ROUGE-S এবং ROUGE-SU: বাদ-দেওয়া বাইগ্রাম (skip-bigrams) মিলের উপর ভিত্তি করে মেট্রিক্স। বাদ-দেওয়া বাইগ্রাম হলো এমন যেকোনো শব্দের জুটি যা উভয় টেক্সটে একই ক্রমে পাওয়া যায়, কিন্তু অবশ্যই পরপর নয়। এটি শব্দের মাঝে বিরতি সহ মিল বিবেচনা করতে দেয়।
    • ROUGE-SU হলো ROUGE-S-এর একটি সম্প্রসারণ, যা ইউনিগ্রাম মিলও বিবেচনা করে, যাতে মিলে যাওয়া শব্দের জুটি না থাকলে শূন্য স্কোর এড়ানো যায়।

প্রতিটি মেট্রিক্স পূর্ণতা (recall), নির্ভুলতা (precision) বা এদের হারমোনিক গড় (F-মাপ) হিসেবে গণনা করা যায়। ঐতিহ্যগতভাবে সারসংক্ষেপের কাজে পূর্ণতার (ROUGE-N recall) উপর জোর দেওয়া হয়, কারণ মডেল যাতে মূল টেক্সট থেকে যতটা সম্ভব বেশি মূল তথ্য বের করে আনে সেটাই গুরুত্বপূর্ণ।

প্রয়োগ ও গুরুত্ব

ROUGE মেট্রিক্স সারসংক্ষেপ অ্যালগরিদমের বস্তুনিষ্ঠ মূল্যায়নের জন্য একটি আদর্শ হাতিয়ার হয়ে উঠেছে। ২০০০-এর দশকের মাঝামাঝি থেকে প্রায় সমস্ত স্বয়ংক্রিয় সারসংক্ষেপ প্রতিযোগিতা (যেমন DUC ও TAC) সিস্টেম র‌্যাংকিংয়ের জন্য ROUGE ব্যবহার করেছে। মেট্রিক্সটির জনপ্রিয়তার কারণ হলো এর সরলতা ও প্রমাণিত কার্যকারিতা: n-গ্রামের ছেদ সারসংক্ষেপের বিষয়বস্তু প্রতিফলনের জন্য যথেষ্ট নির্ভরযোগ্য সূচক হিসেবে প্রমাণিত হয়েছে।

নিউরাল নেটওয়ার্ক মডেল ও LLM-এর আবির্ভাবের সাথে ROUGE-এর ভূমিকা বজায় থাকলেও ব্যাখ্যা আরও জটিল হয়ে উঠেছে। আধুনিক মডেলগুলি এত উন্নত মানের সারসংক্ষেপ তৈরি করে যে ঐতিহ্যবাহী মেট্রিক্সগুলি «সিলিং»-এ পৌঁছে যেতে পারে এবং গুণমানের সূক্ষ্ম পার্থক্য ভালোভাবে বুঝতে পারে না, যা নতুন মূল্যায়ন পদ্ধতির উদ্ভাবনকে উৎসাহিত করেছে[4]

সীমাবদ্ধতা ও সমালোচনা

জনপ্রিয়তা সত্ত্বেও ROUGE-এর পরিচিত সীমাবদ্ধতা রয়েছে:

  • উপরিতলীয় প্রকৃতি: মেট্রিক্সটি শুধুমাত্র শাব্দিক মিলের উপর নির্ভর করে এবং শব্দার্থিক সমতুল্যতা মূল্যায়ন করতে সক্ষম নয়। এটি একটি ভালো সারসংক্ষেপের স্কোর কমিয়ে দিতে পারে যদি তাতে প্রতিশব্দ বা পুনরায় প্রকাশিত বাক্য ব্যবহার করা হয়।
  • টেক্সটের মান উপেক্ষা: ROUGE ব্যাকরণগত শুদ্ধতা, সংযুক্ততা বা পাঠযোগ্যতা মূল্যায়ন করে না। একটি মডেল রেফারেন্স থেকে গুরুত্বপূর্ণ অংশ হুবহু নকল করে উচ্চ স্কোর পেতে পারে, এমনকি যদি চূড়ান্ত টেক্সটটি অসংলগ্ন হয়।
  • রেফারেন্স সারসংক্ষেপের উপর নির্ভরতা: মূল্যায়নের গুণমান সরাসরি রেফারেন্স সারসংক্ষেপের গুণমান ও পূর্ণতার উপর নির্ভর করে। রেফারেন্স খারাপভাবে লেখা হলে মূল্যায়ন অবিশ্বস্ত হবে।
  • তথ্যের মূল্যায়নের অভাব: মেট্রিক্সটি তথ্যগত নির্ভুলতা যাচাই করতে অক্ষম। একটি সারসংক্ষেপ উচ্চ ROUGE স্কোর পেতে পারে কিন্তু ভুল তথ্য ধারণ করতে পারে, যদি সেই তথ্য রেফারেন্সের বদলে মূল উৎস থেকে নকল করা হয়।

বিকল্প ও আধুনিক পদ্ধতি

ROUGE-এর সীমাবদ্ধতাগুলি বিকল্প মূল্যায়ন পদ্ধতির উদ্ভাবনকে উৎসাহিত করেছে:

  • শব্দার্থ-কেন্দ্রিক মেট্রিক্স: শব্দের সঠিক মিলের পরিবর্তে অর্থের স্তরে সাদৃশ্য পরিমাপের চেষ্টা করে। উদাহরণের মধ্যে BERTScore অন্তর্ভুক্ত, যা জেনারেটেড ও রেফারেন্স টেক্সটের ভেক্টর উপস্থাপনা (embedding) তুলনা করে।
  • সমন্বিত মেট্রিক্স: শাব্দিক ও শব্দার্থিক মানদণ্ড একত্রিত করে। উদাহরণস্বরূপ, ROUGE-SEM পদ্ধতি ক্লাসিক ROUGE-কে embedding-ভিত্তিক শব্দার্থিক সাদৃশ্য মডিউল দিয়ে সম্পূরক করে, যাতে পুনরায় প্রকাশিত টেক্সট আরও ভালোভাবে মূল্যায়ন করা যায়[5]
  • LLM-ভিত্তিক মেট্রিক্স: আধুনিক পদ্ধতি যেখানে শক্তিশালী মডেল (যেমন GPT) একটি «বিচারক» হিসেবে একাধিক মানদণ্ডে সারসংক্ষেপের গুণমান মূল্যায়ন করে, মানুষের বিশেষজ্ঞ মূল্যায়ন অনুকরণ করে।

সবশেষে, ROUGE স্বয়ংক্রিয় সারসংক্ষেপের মূল্যায়নের জন্য একটি সরল ও কার্যকর হাতিয়ার হিসেবে নিজেকে প্রমাণ করেছে। আরও জটিল মেট্রিক্সের আবির্ভাব সত্ত্বেও, তার সমস্ত দুর্বলতা সহ ROUGE, NLP গবেষকদের অস্ত্রাগারে একটি অপরিহার্য মৌলিক হাতিয়ার হিসেবে রয়ে গেছে।

তথ্যসূত্র

  • ROUGE সম্পর্কে Chin-Yew Lin-এর মূল প্রবন্ধ (২০০৪)

টীকা

  1. «ROUGE (metric)». Wikipedia. [১]
  2. Lin, Chin-Yew. «ROUGE: A Package for Automatic Evaluation of Summaries». Proceedings of the ACL-04 Workshop on Text Summarization Branches Out, 2004. [২]
  3. «ROUGE (Recall-Oriented Understudy for Gisting Evaluation) Performance Metric». GM-RKB. [৩]
  4. Deutsch, Daniel, and Rotem Dror. «A Statistical Analysis of Summarization Evaluation Metrics». Transactions of the Association for Computational Linguistics, vol. 9, 2021, pp. 495-508. [৪]
  5. Zhang, M., et al. «ROUGE-SEM: Better evaluation of summarization using ROUGE combined with semantics». Expert Systems with Applications, vol. 237, 2024, p. 121364. [৫]