METEOR (metric) (FA)
METEOR — این نام در حوزه پردازش زبان طبیعی (NLP) برای چند مفهوم مرتبط اما متمایز به کار میرود. پیش از هر چیز، این یک معیار خودکار شناختهشده برای ارزیابی کیفیت ترجمه ماشینی است. علاوه بر این، در سال ۲۰۲۴ تحت همین نام دو پروژه پژوهشی مستقل مرتبط با مدلهای زبانی بزرگ (LLM) معرفی شدند: روش یادگیری تکاملی و یک مدل زبانی چندوجهی.
METEOR به عنوان معیار ارزیابی کیفیت ترجمه
METEOR (مخفف Metric for Evaluation of Translation with Explicit ORdering) یک معیار خودکار برای ارزیابی کیفیت ترجمه ماشینی است که در سال ۲۰۰۵ توسط پژوهشگران دانشگاه کارنگی ملون، ساتانجیو بانرجی و الون لاوی پیشنهاد شد[1]. هدف آن افزایش همبستگی ارزیابیهای خودکار با قضاوت انسانی، بهویژه در سطح جملات منفرد، از طریق رفع برخی نقصهای معیار پیشین BLEU بود.
ویژگیهای کلیدی معیار METEOR:
- در نظر گرفتن دقت و فراخوانی: برخلاف BLEU که تنها بر دقت (precision) تمرکز دارد، METEOR میانگین هارمونیک دقت و فراخوانی (recall) را محاسبه میکند، که این امر امکان جریمه کردن ترجمههایی را که کلمات مهم را حذف کردهاند فراهم میسازد.
- تطبیق انعطافپذیر کلمات: METEOR از ویژگیهای زبانشناختی برای تطبیق ترجمه با مرجع استفاده میکند. این معیار نهتنها تطابق دقیق، بلکه اشکال مختلف کلمات (از طریق stemming) و مترادفها (از طریق WordNet) را نیز در نظر میگیرد.
- جریمه نقض ترتیب کلمات: در این معیار جریمهای گنجانده شده که ترتیب نادرست کلمات در ترجمه کاندیدا را حتی در صورت تطابق تمام کلمات با مرجع، مجازات میکند.
این بهبودها به معیار METEOR اجازه میدهد همبستگی بسیار بهتری با ارزیابیهای انسانی در مقایسه با BLEU داشته باشد[2]. این معیار بهطور گسترده در پژوهشهای ترجمه ماشینی، خلاصهسازی خودکار و ارزیابی توضیحات تصاویر به کار میرود[3].
METEOR به عنوان روش یادگیری تکاملی LLM
در سال ۲۰۲۴ گروهی از پژوهشگران چینی روشی تحت عنوان METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth معرفی کردند[4]. این روش برای آموزش کارآمد LLMهایی طراحی شده که در حوزههای موضوعی محدود (مانند امور مالی، پزشکی) تخصص دارند، بدون نیاز به آموزش مدل از صفر.
نویسندگان یک طرح سهمرحلهای از «تکامل» LLM را توصیف میکنند:
- تقطیر دانش از مدل قوی به مدل ضعیف (weak-to-strong data distillation): برای تولید پیکره آموزشی از مدل «معلم» قویتر (مانند GPT-4) استفاده میشود. در این فرایند، مدل حوزهای ابتدا یک طرح راهحل تولید میکند و مدل قوی پاسخ را بر اساس این طرح میسازد. این رویکرد توزیع دانش را همراستا کرده و به مدل هدف امکان میدهد آن را مؤثرتر جذب کند.
- آموزش تکراری با بازخورد خارجی (guided iterative training): مدل آموزشدیده در مرحله اول بهطور مستقل مسائل را حل میکند، در حالی که مدل قوی نقش «داور» را ایفا کرده، پاسخها را ارزیابی و اشتباهات را نشان میدهد. این چرخه بازتابی توانایی خودبررسی را در مدل حوزهای پرورش میدهد.
- خودتکاملی (self-evolution): مدل بدون نظارت خارجی به بهبود ادامه میدهد و از مهارتهای انباشتهشده برای تولید و اصلاح دادههای جدید بهره میبرد.
این روش رویکردی عملی برای ایجاد LLM-متخصصان فشرده و اقتصادی برای صنایع خاص ارائه میدهد[5].
METEOR به عنوان مدل LLM چندوجهی
همچنین در سال ۲۰۲۴ تیمی از پژوهشگران KAIST یک مدل زبانی چندوجهی بزرگ تحت عنوان METEOR: Mamba-based Traversal of Rationales معرفی کرد[6]. این مدل برای درک جامع اطلاعات بصری و تولید پاسخ به سؤالات بصری طراحی شده است.
ویژگی کلیدی METEOR استفاده از استدلالهای (rationales) گسترده است. مدل نهتنها پاسخ نهایی را ارائه میدهد، بلکه یک «زنجیره استدلال» پنهان تولید کرده و به آن متکی است — توضیح گامبهگامی از چگونگی رسیدن به پاسخ، مشابه نحوه استدلال انسان.
در معماری METEOR یک ماژول تخصصی بر پایه مدل Mamba — معماری کارآمد برای پردازش دنبالههای بسیار طولانی — به کار گرفته شده است. این ماژول زنجیرههای طولانی استدلال را که میتوانند شامل توصیف اشیاء در تصویر، روابط فضایی آنها و گامهای حل مسئله باشند، کدگذاری میکند[7].
این مدل با موفقیت بر روی benchmarkهای چندوجهی پیچیدهای مانند MME، AI2D (درک نمودارها) و MathVista (حل مسائل ریاضی در بستر بصری) آزمایش شد. نتایج بالایی به دست آورد، بدون اینکه به ماژولهای خارجی اضافی بینایی ماشین نیاز داشته باشد، که نشاندهنده استفاده کارآمد از پارامترهای داخلی خود است[7].
یادداشتها
- ↑ Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [۱]
- ↑ Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [۲]
- ↑ «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [۳]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [۴]
- ↑ Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [۵]
- ↑ Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [۶]
- ↑ 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [۷]