---
title: "SuperGLUE (benchmark) (TR)"
source: "https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)"
wiki: "systems-analysis.info/int"
article: "SuperGLUE_(benchmark)_(TR)"
language: "tr"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Turkish"
revision_id: 7018
wiki_created_at: 2026-09-07T00:14:39Z
wiki_modified_at: 2026-09-07T00:14:39Z
downloaded_at: 2026-09-07T23:16:58Z
---

# SuperGLUE (benchmark) (TR)

**SuperGLUE** — doğal dil işleme sistemlerini, özellikle **büyük dil modellerini** (BDM) değerlendirmeye yönelik kapsamlı bir **benchmark** (test görevleri kümesi)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. 2019 yılında New York Üniversitesi'nden Alex Wang liderliğinde, Facebook AI Research ve diğer kuruluşların katılımıyla bir araştırmacı grubu tarafından tanıtılmıştır<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>.

SuperGLUE'nun oluşturulmasının nedeni, 2019 yılı ortasına gelindiğinde önceki benchmark olan GLUE'nun güncel modeller için "kolay bir görev" hâline gelmiş olmasıdır: GLUE'da en iyi modellerin toplam puanı, insanların ortalama düzeyi olan 87,1'i geçerek 88,4'e ulaşmıştır<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Böylece daha fazla ilerleme için alan daralmıştır<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Buna yanıt olarak yazarlar, modellerin dil anlama yetkinliğini daha sıkı biçimde sınayan daha zorlu bir alternatif olarak SuperGLUE'yu geliştirmiştir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. SuperGLUE'nun amacı, İngilizce genel dil anlama alanındaki ilerleme için tarafsız ve "eğitime karşı dirençli" bir ölçüt sunmaktır<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. SuperGLUE'da belirgin iyileşmeler sağlamanın; küçük örneklemler üzerinde daha verimli öğrenme, çok görevli öğrenme ve öz denetimli öğrenme gibi Machine Learning yöntemlerinde köklü yenilikler gerektireceği öngörülmüştür<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Başka bir deyişle SuperGLUE, insanlar için kolay ancak makine zekâsı için zor olan görevleri içermekte<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>; bu sayede gerçek anlamda derin dil anlayışına sahip modellerin geliştirilmesi teşvik edilmektedir.

## Özellikler ve GLUE'dan Farkları

SuperGLUE büyük ölçüde GLUE formatını takip etmektedir: görevlerin tümü üzerinden hesaplanan tek bir **bütünleşik kalite puanı**, kamuya açık bir **liderboard** ve modellerin analizine yönelik bir **araç seti** sunar<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Ancak SuperGLUE, selefiyle kıyaslandığında bir dizi iyileştirme ve yenilik getirmektedir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>:

- **Daha zorlu görevler**: SuperGLUE'da **en zorlu sekiz görev** seçilmiştir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Bunların ikisi GLUE'dan (oradaki en zor görevler arasından) devralınmış, geri kalanları ise güncel NLP modellerine olan zorluklarına göre yeni adaylar arasından seçilmiştir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Böylece benchmark, modellerin daha önce en düşük performans sergilediği anlama boyutlarına odaklanmaktadır.
- **Format çeşitliliği**: GLUE'da tüm görevler cümle ya da cümle çifti sınıflandırmasına indirgenirken, SuperGLUE çok daha **geniş bir format yelpazesi** içermektedir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Sınıflandırmanın yanı sıra, modelin bağlamlı bir metni anlamasını ve **mantıksal çıkarım** yapmasını gerektiren **eşgönderim çözümleme** ve **soru yanıtlama** görevleri de eklenmiştir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>.
- **Tüm görevlerde insan değerlendirmesi**: Her görev için uzman olmayan bireylerin oluşturduğu **insan performansı temel çizgisi** hesaplanmıştır<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>; bu sayede BERT gibi güçlü modellerin bile benchmark'ın yayımlandığı dönemde insanın önemli ölçüde gerisinde kaldığı doğrulanmıştır<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Toplamda yaklaşık %90 olan **insan referansının** varlığı, model gelişimine alan tanımakta ve hedef bir ölçüt işlevi görmektedir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>.
- **Şeffaf kurallar ve araçlar**: Liderboard'a sonuç yükleme kuralları gözden geçirilmiştir (adil karşılaştırma sağlamak ve veri kümesi yazarlarının katkılarını belirtmek amacıyla)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Ayrıca SuperGLUE verileri üzerinde modellerin fine-tuning ve çok görevli öğrenme süreçlerini kolaylaştırmak için yeni bir açık kaynak araç seti yayımlanmıştır<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>.

Tüm bu önlemler birlikte değerlendirildiğinde, SuperGLUE modellerin **genelleştirilmiş dil yetkinliklerini** ölçmek için daha güvenilir bir test hâline gelmekte; önceki GLUE'ya özgü formatlara dar biçimde uyum sağlanarak ya da kopya çekilerek yüksek puanlara ulaşılmasının önüne geçmektedir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>.

## SuperGLUE Görev Kümesi

SuperGLUE, metin anlayışının farklı boyutlarını kapsayan **sekiz görevden** oluşmaktadır.

- **BoolQ** (Boolean Questions): Her örneğe kısa bir metin (Vikipedi'den alıntı) ve "evet" ya da "hayır" şeklinde yanıtlanması gereken bir soru verilen bir **soru yanıtlama (QA)** görevidir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Sorular kullanıcılar tarafından (Google arama sorgularından) oluşturulmuştur ve metinden açık ya da örtük bir bilginin çıkarılmasını gerektirir; kalite ölçütü doğru yanıt oranıdır (accuracy)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>.
- **CB** (CommitmentBank): Üç sınıflı **mantıksal çıkarım** (textual entailment) görevidir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Veri kümesi, bağlaçlı karmaşık cümleler içeren kısa metinlerden oluşmaktadır; metnin yazarının iç içe geçmiş ifadenin doğruluğuna ne ölçüde **bağlı olduğunu** belirlenmesi gerekmektedir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Özünde bu, bir önermenin verilen bağlamdan türetilip türetilemeyeceğinin sınanmasıdır. Görev, küçük örneklem boyutu (yaklaşık 250 örnek) ve sınıf dengesizliği nedeniyle zorludur; kalite, doğruluk ve sınıflar üzerinden ortalama F1 skoru ile ölçülmektedir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>.
- **COPA** (Choice of Plausible Alternatives): **Neden-sonuç akıl yürütme** görevidir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Modele bir öncül (tek cümle) verilir ve iki seçenek arasından doğru neden ya da sonucu seçmesi beklenir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Tüm COPA örnekleri elle oluşturulmuş olup neden-sonuç ilişkisi kurmak için **sağduyu** gerektirmektedir. Örnekler blog ve özel ansiklopedi ortamlarından alınmıştır; ölçüt doğruluktur (doğru seçim oranı)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Örnek: "Çocuk hastalığa karşı bağışıklık kazandı" cümlesi verildiğinde ve "bunun nedeni nedir?" sorusu sorulduğunda insan, doğru yanıtın "aşı yaptırdı" olduğunu hemen anlar; oysa modelin neden-sonuç ilişkisini tahmin etmesi gerekmektedir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>.
- **MultiRC** (Multi-Sentence Reading Comprehension): Çoktan seçmeli öğeler içeren **çok cümleli metin anlama** görevidir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Model bir metin paragrafı, paragrafla ilgili bir soru ve olası yanıtların listesini alır; hangi yanıtların doğru olduğunu belirlemelidir (her soruda birden fazla doğru yanıt olabilir)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Önemli bir özellik: soruyu yanıtlamak için genellikle metnin birden fazla cümlesindeki bilgilerin birleştirilmesi gerekir; bu da modelin **bilgileri ilişkilendirme** yeteneğini sınar<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Kalite iki ölçütle ölçülmektedir: yanıtlar üzerinden F1 (kısmen doğru kümeleri de hesaba katar) ve Exact Match — tüm yanıt kümesi eksiksiz biçimde doğru olan soru oranı<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>.
- **ReCoRD** (Reading Comprehension with Commonsense Reasoning Dataset): **Okuduğunu anlama ve bilgi kullanma** görevidir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Değiştirilmiş bir Cloze testi niteliğindedir: bir haber metni (CNN/Daily Mail makalesi) ve içinde bir varlık adının boş bırakıldığı bir cümle verilir; model, metinden hangi varlığın boşluğa uyduğunu seçmelidir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Yanıt seçenekleri makalede geçen tüm varlıklar olarak belirlenir ve bunlar özünde örtüşebilir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Başarılı bir çözüm için bağlam anlayışı ve sağduyu gerekmektedir. Ölçütler; tahmin edilen yanıtlar üzerinden maksimum token düzeyinde F1 ve Exact Match'tir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>.
- **RTE** (Recognizing Textual Entailment): **Metinsel çıkarım** (entailment - not entailment) için ikili sınıflandırma görevidir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Veri kümesi, metinsel çıkarım tanıma üzerine düzenlenen çeşitli yarışmalardan (RTE 1–5 serisi) alınan örnekleri bir araya getirmektedir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Her görev, bir premise-hypothesis metin çifti içermektedir; model hipotezin metinden çıkartılıp çıkartılamayacağını belirlemelidir. Pek çok büyük veri kümesinin aksine RTE oldukça küçüktür (yaklaşık 2.500 eğitim örneği), ancak transfer öğrenmeden kayda değer kazanım elde edildiği görülmüştür: doğruluk, rastgele tahmin düzeyi olan ~%56'dan BERT türü modellerin ortaya çıkmasıyla ~%86'ya yükselmiştir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Bununla birlikte SuperGLUE'nun yayımlandığı dönemde modellerin doğruluğu insanınkinin yaklaşık 8 yüzde puan gerisinde kalmaktaydı<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>; bu nedenle RTE, insan düzeyine ulaşılamamış görevler arasında yer alarak benchmark'a dahil edilmiştir.
- **WiC** (Word-in-Context): **Bağlam içinde kelime anlamı belirsizliğini giderme** (WSD) görevidir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Birbirinden bağımsız iki cümle verilir; her ikisinde de aynı çok anlamlı kelime geçmektedir. Kelimenin her iki cümlede de **aynı anlamda** kullanılıp kullanılmadığının belirlenmesi gerekmektedir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Veriler sözlük kaynaklarından (WordNet, VerbNet, Wiktionary) alındığından geniş bir kelime ve anlam yelpazesini kapsamaktadır<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Görev ikili sınıflandırma olarak kurgulanmış ve doğru yanıt oranıyla değerlendirilmektedir. WiC, modelden ince anlamsal ayrımları kavramasını beklemekte; özünde **sözcüksel anlambilimi** sınamaktadır.
- **WSC** (Winograd Schema Challenge): **Sağduyuyla eşgönderim çözümleme** görevidir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Her görev, bir zamir içeren tek bir cümleden ve o cümledeki iki varlık (isim) listesinden oluşmaktadır<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. **Söz konusu zamirin hangi isme** atıfta bulunduğunun belirlenmesi gerekmektedir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Klasik bir winograd cümlesi örneği: "Kupa bavula sığmadı çünkü o çok küçüktü" — insan, "o"nun bavula atıfta bulunduğunu (bavulun çok küçük olduğunu) hemen anlar. Bu tür örnekler **gündelik bilgi ve bağlam** olmadan çözülememektedir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. GLUE'da bu görevin basitleştirilmiş bir versiyonu (WNLI) zaten yer alıyordu; ancak modeller uzun süre boyunca orada rastgele tahmin düzeyini bile aşamadı<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Yalnızca benzer örnekler içeren harici veri eklenmesi gibi özel teknikler, WSC'de model kalitesini 2019 yılına kadar ~%90'a taşıyabildi<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Bununla birlikte insan, WSC görevlerini neredeyse hatasız çözmektedir (~%96-100 doğruluk)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. SuperGLUE'ya ikili sınıflandırma formatında WSC'nin özgün versiyonu dahil edilmiştir (her "zamir-varlık" çifti için model, bunların aynı göndergeye atıfta bulunup bulunmadığını yanıtlar)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Bu görev, sağduyu akıl yürütmesi gerektiren en zorlu testlerden biri olmayı sürdürmektedir.

Tüm SuperGLUE testleri, geliştiricilerin yanıtlarını bilmediği **kapalı test kümelerine** sahiptir<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Modeller tahminlerini bir sunucuya gönderir; sunucu, görevler üzerinden ortalama alınan toplam puanı hesaplar (birden fazla ölçütü olan görevlerde önce iç ölçüt ortalaması alınır)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Bu tek bir **SuperGLUE skoru**, modellerin genel dil zekâsı düzeyine göre karşılaştırılmasını kolaylaştırmaktadır.

## Model Sonuçları ve İlerleme

SuperGLUE'nun yayımlanmasında yazarlar, güçlü bir temel model (geliştirilmiş BERT) için referans sonuçlar sundu — bunlar tüm görevlerde insan sonuçlarının **belirgin biçimde altında** kaldı<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. O dönemin en iyi modeli bütünleşik ölçütte insandan yaklaşık **20 puan daha az** aldı<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Bazı görevlerde uçurum özellikle büyüktü: örneğin WSC görevinde model zor bela ~%65 doğruluğa ulaşabilirken insanın doğruluğu %100'dür (yaklaşık 35 puanlık fark)<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. "Görece kolay" görünen görevlerde bile (BoolQ, CB, RTE, WiC) otomatik sistemler insan düzeyinin ~10 puan gerisinde kaldı<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. Bu farklar, SuperGLUE'nun gerçekten ciddi bir meydan okuma sunduğunu ve kolayca çözülemeyeceğini doğruladı.

Bununla birlikte SuperGLUE'nun ortaya çıkmasından yalnızca birkaç ay sonra **hızlı bir ilerleme** başladı<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup>. 2019 sonunda Google araştırmacıları, 11 milyar parametreli **T5** (Text-To-Text Transfer Transformer) modelini tanıttı; model 88,9 toplam puana ulaşarak insanın ~89,8 düzeyine yakından yaklaştı<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-reddit-t5-2)</sup>. T5, SuperGLUE'daki önceki rekoru 4,3 puan birden iyileştirdi ve hata oranını neredeyse üçte bir oranında azaltarak insan puanına yalnızca **0,9 puanlık** bir fark bıraktı<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-reddit-t5-2)[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-reddit-t5-2)</sup>. Geliştiriciler, SuperGLUE'nun bilinçli olarak insanlar için kolay görevlerden oluşturulduğunu vurguladı; bu nedenle modelin ~%89 düzeyine ulaşması önemli bir kilometre taşı olarak değerlendirildi<sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-reddit-t5-2)</sup>.

**İnsanın ortalama kalitesini ilk aşan** model ise Microsoft'un **DeBERTa** (Decoding-enhanced BERT with disentangled attention) modeli oldu<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-microsoft-deberta-3)</sup>. Ocak 2021'de araştırmacılar, 1,5 milyar parametreli DeBERTa sürümünün insan referansı olan 89,8'in hemen üstünde **89,9 puan** aldığını duyurdu<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-microsoft-deberta-3)</sup>. Bu, tek bir modelin SuperGLUE ölçütünde insanı geride bıraktığı **ilk durumdu**<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-microsoft-deberta-3)</sup>. Üstelik birkaç DeBERTa modelinden oluşan bir topluluk, rekoru ~90,3 puana taşıdı<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-microsoft-deberta-3)</sup>. DeBERTa, önceki lider Google T5'i yaklaşık %0,6 oranında geride bırakarak Transformer mimarisindeki yeni fikirlerin (içerik ile sözcük konumunun ayrık temsili, iyileştirilmiş maske kod çözücüsü vb.) etkinliğini ortaya koydu<sup>[\[4\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-syncedreview-deberta-4)</sup>.

İlerleme burada durmadı: dil modellerinin boyutu ve karmaşıklığı arttıkça SuperGLUE sonuçları iyileşmeye devam etti<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-microsoft-scaling-5)</sup>. 2021 sonunda liderboard'un zirvesinde Microsoft'un **T-NLRv5** modeli (Microsoft Turing NLR ailesi) yer aldı; model insan düzeyinin üzerindeki farkı daha da genişletti<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-microsoft-scaling-5)</sup>. GLUE'da makineler için hâlâ çözülmemiş olan son görevler (örneğin NLI incelikleri) bu model tarafından "kapatıldı" ve en zorlu alt görevlerde bile **insanla tam parite** sınırına yaklaşıldı<sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-microsoft-scaling-5)</sup>.

2022–2023 yılları itibarıyla SuperGLUE'da insan düzeyi eşiği birbirinden bağımsız birçok büyük model tarafından güvenle aşıldı<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-ainavigator-benchmarks-6)</sup>. Örneğin Google'ın **PaLM** modeli (540 milyar parametre), SuperGLUE görevleri üzerinde ince ayar yapıldığında yaklaşık 90,4 puana ulaştı; OpenAI'ın geliştirdiği **GPT-4** modeli ise biraz daha yüksek bir sonuç elde etti<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-ainavigator-benchmarks-6)</sup>. 2023 ortasında SuperGLUE lider tablosunda 90'ın üzerinde puan alan (yani ortalama insan düzeyini aşan) birkaç model bulunmaktaydı<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-ainavigator-benchmarks-6)</sup>. Benchmark'ın günümüz sistemleri tarafından **neredeyse tamamen çözüldüğünü** söylemek mümkündür<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-ainavigator-benchmarks-6)</sup>: en iyi modellerin puanları, uzman olmayan bireylerin büyük çoğunluğunun kapasitesini aşacak kadar yüksektir<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-ainavigator-benchmarks-6)</sup>. Bu başarı, NLP alanında kısa sürede gerçekleşen devasa ilerlemenin göstergesidir; ancak aynı zamanda en yeni modeller için daha zorlu yeni testlerin gerekliliğine de işaret etmektedir<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-ainavigator-benchmarks-6)</sup>. Modelleri SuperGLUE kapsamının ötesinde daha geniş bir anlama ve bilgi derinliği açısından sınamayı amaçlayan sonraki benchmark'lar (örneğin MMLU, BIG-Bench ve diğerleri) hâlihazırda ortaya çıkmaktadır<sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-ainavigator-benchmarks-6)</sup>.

## Etki ve Sonraki Araştırmalar

SuperGLUE, dil işleme alanında **değerlendirme metodolojisinin gelişiminde önemli bir aşama** olarak yerini almıştır<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-microsoft-deberta-3)</sup>. Akademik ve tutkulu araştırmacı çevrelerinde sonuçları, yeni BDM mimarileri için bir tür "turnusol testi" işlevi görmektedir: SuperGLUE'da insan düzeyine ulaşmak ya da onu aşmak, derin dil anlayışına sahip ileri düzey bir modelin göstergesi olarak algılanmaktadır<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-microsoft-deberta-3)</sup>. Bu durum pratiğe de yansımıştır — SuperGLUE'da yüksek sonuçlar elde eden pek çok modern dil modeli, soru yanıtlama, diyalog ajanları, metin özetleme ve benzeri uygulama sistemlerinin temelini oluşturmaktadır<sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-microsoft-deberta-3)</sup>. SuperGLUE, algoritmaların fine-tuning ve karşılaştırılması amacıyla araştırmacılar tarafından kullanılmaya devam etmektedir; ancak öncü konum artık yavaş yavaş yapay zekâ değerlendirmesinin yeni sınırlarına doğru kaymaktadır.

## Literatür

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Kaynakça

- SuperGLUE resmi sitesi
- Özgün SuperGLUE makalesi (NeurIPS)
- DeBERTa ile insan düzeyine ulaşıldığına dair Microsoft makalesi
- Papers With Code'da SuperGLUE veri kümesi sayfası

## Notlar

<sup>[\[1\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-neurips-main-1)</sup> <sup>[\[2\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-reddit-t5-2)</sup> <sup>[\[3\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-microsoft-deberta-3)</sup> <sup>[\[4\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-syncedreview-deberta-4)</sup> <sup>[\[5\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-microsoft-scaling-5)</sup> <sup>[\[6\]](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_note-ainavigator-benchmarks-6)</sup> \</references\>

1.  <span id="cite_note-neurips-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-neurips-main_1-59)</sup> Wang, Alex et al. (2019). «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS*. <a href="http://papers.neurips.cc/paper/8589-superglue-a-stickier-benchmark-for-general-purpose-language-understanding-systems.pdf" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-reddit-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-reddit-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-reddit-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-reddit-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-reddit-t5_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-reddit-t5_2-4)</sup> «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit /r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-microsoft-deberta-3">↑ <sup>[3.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-microsoft-deberta_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-microsoft-deberta_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-microsoft-deberta_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-microsoft-deberta_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-microsoft-deberta_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-microsoft-deberta_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-microsoft-deberta_3-6)</sup> <sup>[3.7](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-microsoft-deberta_3-7)</sup> «Microsoft DeBERTa surpasses human performance on the SuperGLUE benchmark». *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/microsoft-deberta-surpasses-human-performance-on-the-superglue-benchmark/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-syncedreview-deberta-4">↑ <sup>[4.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-syncedreview-deberta_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-syncedreview-deberta_4-1)</sup> «Microsoft DeBERTa Tops Human Performance on SuperGLUE NLU Benchmark». *Synced Review*. <a href="https://syncedreview.com/2021/01/06/microsoft-deberta-tops-human-performance-on-superglue-nlu-benchmark/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-microsoft-scaling-5">↑ <sup>[5.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-microsoft-scaling_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-microsoft-scaling_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-microsoft-scaling_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-microsoft-scaling_5-3)</sup> «Efficiently and effectively scaling up language model pretraining for best language representation model on GLUE and SuperGLUE». *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/efficiently-and-effectively-scaling-up-language-model-pretraining-for-best-language-representation-model-on-glue-and-superglue/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-ainavigator-benchmarks-6">↑ <sup>[6.0](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-ainavigator-benchmarks_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-ainavigator-benchmarks_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-ainavigator-benchmarks_6-2)</sup> <sup>[6.3](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-ainavigator-benchmarks_6-3)</sup> <sup>[6.4](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-ainavigator-benchmarks_6-4)</sup> <sup>[6.5](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-ainavigator-benchmarks_6-5)</sup> <sup>[6.6](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-ainavigator-benchmarks_6-6)</sup> <sup>[6.7](https://systems-analysis.info/int/SuperGLUE_(benchmark)_(TR)#cite_ref-ainavigator-benchmarks_6-7)</sup> «The Ultimate Guide to AI Benchmarks». *The AI Navigator*. <a href="https://www.theainavigator.com/blog/the-ultimate-guide-to-ai-benchmarks/" class="external autonumber" rel="nofollow">[6]</a></span>
