METEOR (metric) (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

METEOR — bu ad, doğal dil işleme (NLP) alanında birbiriyle ilişkili ancak birbirinden farklı birkaç kavram için kullanılmaktadır. Her şeyden önce, makine çevirisi kalitesini değerlendirmek için kullanılan tanınmış bir otomatik metriktir. Bunun yanı sıra, 2024 yılında aynı adla büyük dil modelleriyle (LLM) ilgili iki bağımsız araştırma projesi tanıtılmıştır: bir evrimsel öğrenme yöntemi ve çok modlu bir dil modeli.

METEOR - Çeviri Kalitesi Değerlendirme Metriği

METEOR (Metric for Evaluation of Translation with Explicit ORdering kısaltması) — 2005 yılında Carnegie Mellon Üniversitesi araştırmacıları Satanjeev Banerjee ve Alon Lavie tarafından önerilen, makine çevirisi kalitesini değerlendirmeye yönelik otomatik bir metriktir[1]. Bu metriğin amacı, özellikle cümle düzeyinde, otomatik değerlendirmelerin insan yargılarıyla uyumunu artırmak ve daha önceki BLEU metriğinin bazı eksikliklerini gidermektir.

METEOR metriğinin temel özellikleri:

  • Hassasiyet ve kapsamın dikkate alınması: Yalnızca hassasiyete (precision) odaklanan BLEU'nun aksine, METEOR hassasiyet ile kapsam (recall) arasındaki harmonik ortalamayı hesaplar; bu sayede önemli kelimelerin atlanması durumunda çeviriler cezalandırılır.
  • Esnek sözcük eşleştirmesi: METEOR, çeviriyi referansla eşleştirmek için dilbilimsel özelliklerden yararlanır. Yalnızca tam eşleşmeleri değil, farklı sözcük biçimlerini (kök bulma - stemming aracılığıyla) ve eş anlamlıları da (WordNet aracılığıyla) dikkate alır.
  • Sözcük sırası ihlali cezası: Metriğe, tüm sözcükler referansla eşleşse bile aday çevirideki yanlış sözcük sırası için bir ceza mekanizması eklenmiştir.

Bu geliştirmeler, METEOR metriğinin BLEU'ya kıyasla insan değerlendirmeleriyle çok daha iyi korelasyon kurmasını sağlar[2]. Metrik, makine çevirisi araştırmalarında, otomatik özetlemede ve görüntü açıklamalarının değerlendirilmesinde yaygın biçimde kullanılmaktadır[3].

METEOR - LLM Evrimsel Öğrenme Yöntemi

2024 yılında bir grup Çinli araştırmacı, METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth adıyla bir yöntem tanıttı[4]. Bu yöntem, sıfırdan eğitim gerektirmeksizin dar konu alanlarında (örneğin finans, tıp) uzmanlaşmış LLM'lerin verimli biçimde eğitilmesini amaçlamaktadır.

Yazarlar, LLM'nin üç aşamalı "evrim" şemasını şu şekilde açıklamaktadır:

  1. Güçlü modelden zayıf modele bilgi damıtması (weak-to-strong data distillation): Eğitim verisi üretmek için daha güçlü bir "öğretmen" model (örneğin GPT-4) kullanılır. Bu süreçte alan modeli önce bir çözüm planı oluşturur, ardından güçlü model bu plana dayanarak yanıt üretir. Bu yaklaşım bilgi dağılımını dengeler ve hedef modelin bilgileri daha etkin özümsemesini sağlar.
  2. Dışsal geri bildirimle yinelemeli eğitim (guided iterative training): İlk aşamada eğitilen model görevleri bağımsız olarak çözer; güçlü model ise bir "hakem" rolü üstlenerek yanıtları değerlendirir ve hataları gösterir. Bu yansıtıcı döngü, alan modelinin öz-denetim becerisini geliştirir.
  3. Öz-evrim (self-evolution): Model, dışsal bir rehber olmaksızın gelişmeye devam eder; biriktirdiği becerileri yeni veri üretmek ve düzeltmek için kullanır.

Bu yöntem, belirli sektörler için kompakt ve ekonomik LLM uzmanları oluşturmaya yönelik pratik bir yaklaşım sunmaktadır[5].

METEOR - Çok Modlu LLM Modeli

Yine 2024 yılında, KAIST'ten bir araştırmacı ekibi METEOR: Mamba-based Traversal of Rationales adlı büyük çok modlu bir dil modeli tanıttı[6]. Model, görsel bilgilerin kapsamlı biçimde anlaşılması ve görsel sorulara yanıt üretilmesi amacıyla tasarlanmıştır.

METEOR'un temel özelliği, ayrıntılı akıl yürütme zincirlerinin (rationales) kullanılmasıdır. Model yalnızca nihai yanıtı vermekle kalmayıp, tıpkı bir insanın düşünme sürecine benzer şekilde, bu yanıta nasıl ulaşıldığını adım adım açıklayan gizli bir "akıl yürütme zinciri" oluşturur ve buna dayanır.

METEOR mimarisinde, son derece uzun dizilerin işlenmesi için etkili bir mimari olan Mamba modeline dayalı özel bir modül yer almaktadır. Bu modül, görüntüdeki nesnelerin tanımlarını, uzamsal ilişkilerini ve görevin çözümüne yönelik adımları içerebilen uzun akıl yürütme zincirlerini kodlar[7].

Model, MME, AI2D (diyagram anlama) ve MathVista (görsel bağlamda matematik problemleri çözme) gibi zorlu çok modlu benchmark'larda başarıyla test edilmiştir. Ek harici bilgisayarlı görü modülleri gerektirmeksizin yüksek sonuçlar elde etmiş olması, kendi parametrelerini etkin biçimde kullandığına işaret etmektedir[7].

Notlar

  1. Banerjee, S., and A. Lavie. «METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments». ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for MT, 2005. [1]
  2. Lavie, A., and A. Agarwal. «METEOR: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments». ACL Workshop on Statistical Machine Translation, 2007. [2]
  3. «Evaluating Large Language Models: Powerful Insights Ahead». DataScienceDojo. [3]
  4. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». arXiv preprint arXiv:2411.11933, 2024. [4]
  5. Li, J., X. Xu, and Y. Gao. «METEOR: Evolutionary Journey of Large Language Models from Guidance to Self-Growth». ar5iv.org. [5]
  6. Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». NeurIPS 2024 (poster). [6]
  7. 7.0 7.1 Lee, B.-K., et al. «Meteor: Mamba-based Traversal of Rationales for Large Language and Vision Models». arXiv preprint arXiv:2405.15574, 2024. [7]