METEOR (metric) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

METEOR — این نام در حوزه پردازش زبان طبیعی (NLP) برای چند مفهوم مرتبط اما متمایز به کار می‌رود. پیش از هر چیز، این یک معیار خودکار شناخته‌شده برای ارزیابی کیفیت ترجمه ماشینی است. علاوه بر این، در سال ۲۰۲۴ تحت همین نام دو پروژه پژوهشی مستقل مرتبط با مدل‌های زبانی بزرگ (LLM) معرفی شدند: روش یادگیری تکاملی و یک مدل زبانی چندوجهی.

METEOR به عنوان معیار ارزیابی کیفیت ترجمه

METEOR (مخفف Metric for Evaluation of Translation with Explicit ORdering) یک معیار خودکار برای ارزیابی کیفیت ترجمه ماشینی است که در سال ۲۰۰۵ توسط پژوهشگران دانشگاه کارنگی ملون، ساتانجیو بانرجی و الون لاوی پیشنهاد شد[1]. هدف آن افزایش همبستگی ارزیابی‌های خودکار با قضاوت انسانی، به‌ویژه در سطح جملات منفرد، از طریق رفع برخی نقص‌های معیار پیشین BLEU بود.

ویژگی‌های کلیدی معیار METEOR:

  • در نظر گرفتن دقت و فراخوانی: برخلاف BLEU که تنها بر دقت (precision) تمرکز دارد، METEOR میانگین هارمونیک دقت و فراخوانی (recall) را محاسبه می‌کند، که این امر امکان جریمه کردن ترجمه‌هایی را که کلمات مهم را حذف کرده‌اند فراهم می‌سازد.
  • تطبیق انعطاف‌پذیر کلمات: METEOR از ویژگی‌های زبان‌شناختی برای تطبیق ترجمه با مرجع استفاده می‌کند. این معیار نه‌تنها تطابق دقیق، بلکه اشکال مختلف کلمات (از طریق stemming) و مترادف‌ها (از طریق WordNet) را نیز در نظر می‌گیرد.
  • جریمه نقض ترتیب کلمات: در این معیار جریمه‌ای گنجانده شده که ترتیب نادرست کلمات در ترجمه کاندیدا را حتی در صورت تطابق تمام کلمات با مرجع، مجازات می‌کند.

این بهبودها به معیار METEOR اجازه می‌دهد همبستگی بسیار بهتری با ارزیابی‌های انسانی در مقایسه با BLEU داشته باشد[2]. این معیار به‌طور گسترده در پژوهش‌های ترجمه ماشینی، خلاصه‌سازی خودکار و ارزیابی توضیحات تصاویر به کار می‌رود[3].

METEOR به عنوان روش یادگیری تکاملی LLM

در سال ۲۰۲۴ گروهی از پژوهشگران چینی روشی تحت عنوان METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth معرفی کردند[4]. این روش برای آموزش کارآمد LLMهایی طراحی شده که در حوزه‌های موضوعی محدود (مانند امور مالی، پزشکی) تخصص دارند، بدون نیاز به آموزش مدل از صفر.

نویسندگان یک طرح سه‌مرحله‌ای از «تکامل» LLM را توصیف می‌کنند:

  1. تقطیر دانش از مدل قوی به مدل ضعیف (weak-to-strong data distillation): برای تولید پیکره آموزشی از مدل «معلم» قوی‌تر (مانند GPT-4) استفاده می‌شود. در این فرایند، مدل حوزه‌ای ابتدا یک طرح راه‌حل تولید می‌کند و مدل قوی پاسخ را بر اساس این طرح می‌سازد. این رویکرد توزیع دانش را هم‌راستا کرده و به مدل هدف امکان می‌دهد آن را مؤثرتر جذب کند.
  2. آموزش تکراری با بازخورد خارجی (guided iterative training): مدل آموزش‌دیده در مرحله اول به‌طور مستقل مسائل را حل می‌کند، در حالی که مدل قوی نقش «داور» را ایفا کرده، پاسخ‌ها را ارزیابی و اشتباهات را نشان می‌دهد. این چرخه بازتابی توانایی خودبررسی را در مدل حوزه‌ای پرورش می‌دهد.
  3. خودتکاملی (self-evolution): مدل بدون نظارت خارجی به بهبود ادامه می‌دهد و از مهارت‌های انباشته‌شده برای تولید و اصلاح داده‌های جدید بهره می‌برد.

این روش رویکردی عملی برای ایجاد LLM-متخصصان فشرده و اقتصادی برای صنایع خاص ارائه می‌دهد[5].

METEOR به عنوان مدل LLM چندوجهی

همچنین در سال ۲۰۲۴ تیمی از پژوهشگران KAIST یک مدل زبانی چندوجهی بزرگ تحت عنوان METEOR: Mamba-based Traversal of Rationales معرفی کرد[6]. این مدل برای درک جامع اطلاعات بصری و تولید پاسخ به سؤالات بصری طراحی شده است.

ویژگی کلیدی METEOR استفاده از استدلال‌های (rationales) گسترده است. مدل نه‌تنها پاسخ نهایی را ارائه می‌دهد، بلکه یک «زنجیره استدلال» پنهان تولید کرده و به آن متکی است — توضیح گام‌به‌گامی از چگونگی رسیدن به پاسخ، مشابه نحوه استدلال انسان.

در معماری METEOR یک ماژول تخصصی بر پایه مدل Mamba — معماری کارآمد برای پردازش دنباله‌های بسیار طولانی — به کار گرفته شده است. این ماژول زنجیره‌های طولانی استدلال را که می‌توانند شامل توصیف اشیاء در تصویر، روابط فضایی آن‌ها و گام‌های حل مسئله باشند، کدگذاری می‌کند[7].

این مدل با موفقیت بر روی benchmark‌های چندوجهی پیچیده‌ای مانند MME، AI2D (درک نمودارها) و MathVista (حل مسائل ریاضی در بستر بصری) آزمایش شد. نتایج بالایی به دست آورد، بدون اینکه به ماژول‌های خارجی اضافی بینایی ماشین نیاز داشته باشد، که نشان‌دهنده استفاده کارآمد از پارامترهای داخلی خود است[7].

یادداشت‌ها

  1. Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [۱]
  2. Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [۲]
  3. «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [۳]
  4. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [۴]
  5. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [۵]
  6. Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [۶]
  7. 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [۷]