ROUGE (metric) (UR)
ROUGE (مخفف انگریزی Recall-Oriented Understudy for Gisting Evaluation — «خلاصہ سازی کی جانچ کے لیے مکمل پن پر مبنی نعم البدل جائزہ کار») — یہ خودکار طریقے سے تیار کردہ متنی خلاصوں (تلخیصوں) کے معیار کی جانچ کے لیے خودکار میٹرکس کا ایک مجموعہ ہے۔ جانچ اس طریقے سے کی جاتی ہے کہ خودکار طریقے سے تیار کردہ خلاصے کا موازنہ ایک یا ایک سے زیادہ انسانوں کے بنائے ہوئے معیاری (حوالہ جاتی) خلاصوں سے کیا جاتا ہے[1]۔
ابتداء میں یہ میٹرک متنی خودکار خلاصہ سازی کے کاموں کے لیے تیار کی گئی تھی، تاہم اسے مشینی ترجمے کے معیار کی جانچ میں بھی استعمال کیا جاتا ہے۔ میٹرک BLEU کے برعکس، جو درستگی (precision) کی جانچ کرتی ہے، ROUGE مکمل پن (recall) پر توجہ مرکوز کرتی ہے — یہ ظاہر کرتی ہے کہ معیاری خلاصے کے اہم حصوں میں سے کتنا حصہ تیار کردہ متن میں دوبارہ پیش کیا گیا۔
ROUGE میٹرکس کا مجموعہ 2004 میں یونیورسٹی آف سدرن کیلیفورنیا کے انسٹی ٹیوٹ آف انفارمیشن سائنسز کے محقق چن-یو لن (Chin-Yew Lin) نے پیش کیا[2]۔ ROUGE میٹرکس خلاصہ سازی کے الگورتھمز کی جانچ کا عملی معیار بن گئی ہیں، خاص طور پر ان کے DUC (Document Understanding Conference) جیسے بڑے مقابلوں میں استعمال کے بعد۔
ROUGE میٹرکس کے بنیادی انواع
ROUGE کا خاندان کئی متعلقہ میٹرکس پر مشتمل ہے، جن میں سے ہر ایک مختلف معیار کے مطابق مواد کا تقاطع ناپتی ہے[3]:
- ROUGE-N: n-گرامز (n الفاظ کی ترتیب) کے تقاطع کو ناپتی ہے۔
- ROUGE-1 یونی گرامز (انفرادی الفاظ) کا تقاطع حساب کرتی ہے۔
- ROUGE-2 بائی گرامز (متواتر الفاظ کے جوڑوں) کا تقاطع حساب کرتی ہے۔
- ROUGE-L: یہ تیار کردہ اور معیاری خلاصے کے درمیان طویل ترین مشترک ذیلی تسلسل (Longest Common Subsequence، LCS) پر مبنی ہے۔ یہ میٹرک جملے کی ساخت کی سطح پر مطابقت کو مدنظر رکھتی ہے، کیونکہ یہ ایک ہی ترتیب میں آنے والے الفاظ کا طویل ترین تسلسل ناپتی ہے، چاہے وہ یکے بعد دیگرے نہ ہوں۔
- ROUGE-W: ROUGE-L کی ترمیم شدہ شکل (Weighted LCS)، جو ان مشترک ذیلی تسلسلوں کو زیادہ وزن دیتی ہے جو یکے بعد دیگرے آنے والے الفاظ پر مشتمل ہوتے ہیں، تاکہ پیوستہ جملوں کی مطابقت کی حوصلہ افزائی کی جائے۔
- ROUGE-S اور ROUGE-SU: چھوڑی گئی بائی گرامز (skip-bigrams) کی مطابقت پر مبنی میٹرکس۔ چھوڑی گئی بائی گرام الفاظ کا وہ جوڑا ہے جو دونوں متون میں ایک ہی ترتیب میں ملتا ہے، لیکن ضروری نہیں کہ یکے بعد دیگرے ہو۔ اس سے الفاظ کے درمیان وقفوں کے ساتھ مطابقت کو مدنظر رکھا جا سکتا ہے۔
- ROUGE-SU دراصل ROUGE-S کی توسیع ہے، جو یونی گرامز کی مطابقت کو بھی شامل کرتی ہے تاکہ ایسے خلاصوں کے لیے صفر سکور سے بچا جا سکے جن میں الفاظ کے مطابق جوڑے نہ ہوں۔
ہر میٹرک کو مکمل پن (recall)، درستگی (precision) یا ان کے ہارمونک اوسط (F-میژر) کے لحاظ سے حساب کیا جا سکتا ہے۔ روایتی طور پر خلاصہ سازی کے کاموں میں مکمل پن (ROUGE-N recall) پر زور دیا جاتا ہے، کیونکہ یہ اہم ہے کہ ماڈل اصل متن سے زیادہ سے زیادہ کلیدی معلومات کو سامنے لائے۔
اطلاق اور اہمیت
ROUGE میٹرکس خلاصہ سازی کے الگورتھمز کی معروضی جانچ کا ایک معیاری ذریعہ بن گئی ہیں۔ 2000 کی دہائی کے وسط سے، خودکار خلاصہ سازی کے تقریباً تمام مقابلوں (مثلاً DUC اور TAC) نے نظاموں کی درجہ بندی کے لیے ROUGE کا استعمال کیا۔ اس میٹرک کی مقبولیت کا سبب اس کی سادگی اور ثابت شدہ افادیت ہے: n-گرامز کا تقاطع خلاصے کے مواد کو ظاہر کرنے کا کافی قابل اعتماد پیمانہ ثابت ہوا۔
نیورل نیٹ ورک ماڈلز اور LLM کے ظہور کے ساتھ ROUGE کا کردار برقرار رہا، لیکن تشریح زیادہ پیچیدہ ہو گئی۔ جدید ماڈلز اتنے اعلیٰ معیار کے خلاصے تیار کرتے ہیں کہ روایتی میٹرکس «سطحِ حد» تک پہنچ سکتی ہیں اور معیار کی باریکیوں میں فرق ظاہر کرنے میں ناکام رہتی ہیں، جس نے جانچ کے نئے طریقوں کی ترقی کی راہ ہموار کی[4]۔
حدود اور تنقید
مقبولیت کے باوجود، ROUGE کی کچھ معلوم حدود ہیں:
- سطحی نوعیت: یہ میٹرک صرف لفظی مطابقت پر انحصار کرتی ہے اور معنوی مساوات کا جائزہ لینے سے قاصر ہے۔ یہ ایک اچھے خلاصے کی جانچ میں کمی کر سکتی ہے اگر اس میں مترادفات یا نئے الفاظ میں بیان شدہ عبارات استعمال کی گئی ہوں۔
- متن کے معیار کو نظرانداز کرنا: ROUGE نہ تو گرامر کی درستگی، نہ ربط اور نہ ہی پیشکش کی قابلِ مطالعہ ہونے کا جائزہ لیتی ہے۔ ایک ماڈل معیار سے اہم حصوں کو محض نقل کر کے اعلیٰ سکور حاصل کر سکتا ہے، چاہے حتمی متن غیر مربوط ہو۔
- حوالہ جاتی خلاصے پر انحصار: جانچ کا معیار براہ راست معیاری خلاصے کی کیفیت اور مکمل پن پر منحصر ہے۔ اگر معیاری خلاصہ ناقص لکھا گیا ہو تو جانچ ناقابلِ اعتماد ہوگی۔
- حقائق کی جانچ کا فقدان: یہ میٹرک حقیقی درستگی کی جانچ کرنے سے قاصر ہے۔ ایک خلاصہ اعلیٰ ROUGE سکور حاصل کر سکتا ہے لیکن غلط حقائق پر مشتمل ہو سکتا ہے، اگر وہ معیار کی بجائے ماخذ سے نقل کیے گئے ہوں۔
متبادل اور جدید طریقے
ROUGE کی حدود نے متبادل جانچ کے طریقوں کی ترقی کو تحریک دی:
- معنوی طور پر مبنی میٹرکس: یہ الفاظ کی عین مطابقت کی بجائے معنی کی سطح پر مماثلت ناپنے کی کوشش کرتی ہیں۔ مثالوں میں BERTScore شامل ہے، جو تیار کردہ اور معیاری متون کے ویکٹر نمائندگیوں (embedding) کا موازنہ کرتی ہے۔
- مشترکہ میٹرکس: یہ لفظی اور معنوی دونوں معیاروں کو یکجا کرتی ہیں۔ مثال کے طور پر، ROUGE-SEM کا طریقہ کار کلاسک ROUGE کو embedding پر مبنی معنوی مماثلت کے ماڈیول سے تقویت دیتا ہے تاکہ نئے الفاظ میں لکھی گئی عبارات کا بہتر جائزہ لیا جا سکے[5]۔
- LLM پر مبنی میٹرکس: جدید طریقے، جہاں طاقتور ماڈلز (مثلاً GPT) کئی معیاروں کے مطابق خلاصے کے معیار کا جائزہ لینے کے لیے «منصف» کے طور پر استعمال کیے جاتے ہیں، انسانی ماہرانہ جانچ کی نقل کرتے ہوئے۔
خلاصہ یہ کہ ROUGE نے اپنے آپ کو خودکار تلخیص کی جانچ کے لیے ایک سادہ اور مؤثر ذریعے کے طور پر ثابت کیا ہے۔ زیادہ پیچیدہ میٹرکس کے ظہور کے باوجود، اپنی تمام خامیوں کے ساتھ ROUGE، NLP محققین کے ہتھیار خانے میں ایک ناگزیر بنیادی ذریعہ بنا ہوا ہے۔
روابط
- چن-یو لن کا ROUGE پر اصل مقالہ (2004)
حواشی
- ↑ «ROUGE (metric)». Wikipedia. [1]
- ↑ Lin, Chin-Yew. «ROUGE: A Package for Automatic Evaluation of Summaries». Proceedings of the ACL-04 Workshop on Text Summarization Branches Out, 2004. [2]
- ↑ «ROUGE (Recall-Oriented Understudy for Gisting Evaluation) Performance Metric». GM-RKB. [3]
- ↑ Deutsch, Daniel, and Rotem Dror. «A Statistical Analysis of Summarization Evaluation Metrics». Transactions of the Association for Computational Linguistics, vol. 9, 2021, pp. 495-508. [4]
- ↑ Zhang, M., et al. «ROUGE-SEM: Better evaluation of summarization using ROUGE combined with semantics». Expert Systems with Applications, vol. 237, 2024, p. 121364. [5]