---
title: "MT-Bench (benchmark) (HE)"
source: "https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)"
wiki: "systems-analysis.info/int"
article: "MT-Bench_(benchmark)_(HE)"
language: "he"
categories:
  - "Category:Hebrew"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 4102
wiki_created_at: 2026-09-06T23:30:36Z
wiki_modified_at: 2026-09-06T23:30:36Z
downloaded_at: 2026-09-07T23:00:53Z
---

# MT-Bench (benchmark) (HE)

**MT-Bench** (ראשי תיבות של *Multi-Turn Benchmark*, «בנצ'מרק רב-תורות») — הוא אוסף עיוני של משימות בדיקה (benchmark) להערכת מודלים לשוניים גדולים (LLM) בתנאי דיאלוג רב-תורות. הבנצ'מרק הוצע בשנת 2023 על ידי צוות חוקרים מ-**LMSYS** (בראשות **ליאנמין ג'נג**, *Lianmin Zheng*) כחלק מהשיטה **LLM-as-a-Judge** («LLM בתפקיד השופט») להשוואה אובייקטיבית של איכות צ'אט-בוטים<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_note-mt_bench_paper-1)</sup>.

בשונה מבדיקות חד-תוריות מסורתיות (כגון MMLU), MT-Bench בוחן את יכולת המודלים לנהל דיאלוג רב-שלבי, לקלוט נתונים חדשים ברצף ולמלא אחר הוראות המשתמש במדויק. המטרה היא הערכה ריאליסטית יותר של ביצועי צ'אט-בוטים בתרחישים מורכבים, המכוונת להתאמה להעדפות אנושיות ולדרישות מעשיות של מערכות שיחה<sup>[\[2\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_note-klu_glossary-2)</sup>.

## רקע ליצירת הבנצ'מרק

התפתחות מודלי LLM לשיחה, כגון ChatGPT, GPT-4 ו-Vicuna, חשפה פער בין מדדי האיכות המסורתיים לבין תפיסת המשתמש האמיתית של התשובות. התברר כי שיפור המודל מבחינת ההתאמה להוראות אנושיות (באמצעות RLHF) אינו תמיד מעלה את התוצאות בבנצ'מרקים ישנים וחד-תוריים. בדיקות כמו MMLU או HELM לעיתים קרובות אינן מבחינות בין צ'אט-בוטים משופרים («מיושרים») לבין מודלי הבסיס שלהם. הדבר מצביע על מגבלות השיטות הקודמות, שאינן משקפות את איכות האינטראקציה הרב-תורות ואת מילוי ההוראות בצורה פתוחה.

MT-Bench הופיע כמענה לבעיה זו, ומציע אוסף שאלות מסוג פתוח בפורמט דיאלוג, הממוקד בשני היבטים: 1. יכולת המודל לקיים שיחה עקבית על פני מספר שלבים (*turns*). 2. מילוי מדויק של הוראות מורכבות של המשתמש<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_note-mt_bench_paper-1)</sup>.

## מבנה הבנצ'מרק ותכניו

MT-Bench מורכב מ-**80** תרחישי דיאלוג רב-תורות שנבחרו בקפידה, המכסים סוגים שונים של משימות. כל תרחיש כולל סדרה של מספר חילופים בין המשתמש למודל, ובוחן את יכולת המודל לשמור על הקשר ולהתאים עצמו לנתונים חדשים. הדיאלוגים מקובצים לפי **8 קטגוריות** של משימות:

- **Writing** (כתיבת טקסט) — בדיקת מיומנויות יצירתיות (למשל, כתיבת בלוג).
- **Roleplay** (שיחת תפקידים) — מידול דיאלוגים בתפקידים מוגדרים.
- **Extraction** (חילוץ מידע) — יכולת לחלץ עובדות מהקשר נתון.
- **Reasoning** (חשיבה לוגית) — פתרון משימות של חשיבה לוגית.
- **Math** (מתמטיקה) — פתרון בעיות מתמטיות.
- **Coding** (תכנות) — כתיבה או ניפוי שגיאות בקוד.
- **STEM** (מדע וטכנולוגיה) — שאלות מתחומי מדעי הטבע.
- **Humanities** (מדעי הרוח) — שאלות בהיסטוריה, ספרות ומדעי החברה.

בכל קטגוריה מוצגות 10 משימות דיאלוג. המשימות כוללות בכוונה המשכים מפתיעים (למשל, שאלות הבהרה פתאומיות), כדי לבחון את המודל בשיחה «ריאלית» למראית עין<sup>[\[3\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_note-gabor_melli_rkb-3)</sup>.

## שיטת ההערכה: LLM-as-a-Judge

מאפיין מרכזי של MT-Bench הוא שימוש במודל לשוני חזק בתפקיד **שופט** להערכה אוטומטית של תשובות (**LLM-as-a-Judge**). בעבודה המקורית, מילא תפקיד זה המודל GPT-4<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_note-mt_bench_paper-1)</sup>.

נוהל ההערכה בנוי כדלקמן: 1. עבור כל תרחיש דיאלוג, מספר מודלים-משתתפים מייצרים תשובות. 2. המודל-שופט (GPT-4) משווה תשובות אלו (בפורמט של השוואה זוגית או הערכה בסולם ניקוד) ומכריע על הנבחר.

שיפוט אוטומטי זה מחליף סימון ידני מייגע. החוקרים הראו כי הערכות GPT-4 כשופט מציגות **התאמה של למעלה מ-80%** עם תוצאות מומחים אנושיים, הדומה לרמת ההסכמה בין בני אדם עצמם. הדבר מעיד על אמינות השיטה ועל האפשרות להרחיב את ההערכות ללא מעורבות ישירה של אדם. לשם הגברת האובייקטיביות, זוהו והופחתו הטיות פוטנציאליות של המודל-שופט, כגון אפקט **הטיית המיקום** (העדפת התשובה הראשונה), **הרהיטות** (העדפת תשובה ארוכה יותר) ו**הפאמנות העצמית** (נדיבות כלפי תשובות בסגנון שלו עצמו)<sup>[\[1\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_note-mt_bench_paper-1)</sup>.

## תוצאות ויישום

MT-Bench אפשר לזהות הבדלים ניכרים באיכות המודלים העכשוויים. בקטגוריות של חשיבה לוגית, מתמטיקה ותכנות, GPT-4 עלה בהרבה על גרסאות קודמות (כגון GPT-3.5). הדבר אישר כי מודלים גדולים יותר שומרים טוב יותר על ההקשר לאורך מספר שלבי דיאלוג.

לשימוש מעשי בתוצאות, השיק צוות LMSYS **לידרבורד ציבורי**, שבו מודלים מדורגים לפי ניקוד MT-Bench הממוצע ולפי דירוג Elo מ-Chatbot Arena. דירוג זה מתעדכן באופן קבוע ומשקף את ההתקדמות בתעשייה. ה-dataset עצמו והקוד להרצתו פורסמו לגישה חופשית, מה שמאפשר למפתחים עצמאיים לבדוק את המודלים שלהם<sup>[\[2\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_note-klu_glossary-2)</sup>.

## מגבלות וביקורת

למרות היישום המוצלח, ל-MT-Bench ולגישת LLM-as-a-Judge יש מספר מגבלות:

- **אי-שלמות השופט**. המודל-שופט (למשל, GPT-4) אינו כל-יכול: הוא אינו מזהה תמיד שגיאות עובדתיות או הזיות בתשובות המודלים הנבחנים.
- **קשיים בהערכת לוגיקה ומתמטיקה**. שופט LLM עשוי שלא לעקוב במלואו אחר חשיבה מורכבת או לאמת הוכחה, דבר העלול לגרום לטעויות בהערכה.
- **הטיות (Biases)**. למרות האמצעים להפחתתן, המודל-שופט עשוי לשמר נטייה לסגנון או פורמט תשובה מסוים.

היבטים אלו פירושם שביישומים קריטיים עדיין רצוי פיקוח אנושי או שיטות הערכה משולבות.

## פיתוח והרחבות

הצלחת MT-Bench עוררה את הופעתן של גרסאות מורחבות. בשנת 2024 הוצעה המתודולוגיה **MT-Bench-101**, שמטרתה ניתוח מפורט עוד יותר של יכולות המודלים בדיאלוג. המחברים יצרו טקסונומיה תלת-רמתית של מיומנויות ואספו dataset גדול בהרבה, מה שאפשר לזהות הבדלים עדינים בהתנהגות המודלים בשלבים שונים של הדיאלוג<sup>[\[4\]](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_note-mt_bench_101_paper-4)</sup>.

## קישורים

- מאגר רשמי עם נתוני MT-Bench ב-GitHub

## ספרות

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

  

## הערות

1.  <span id="cite_note-mt_bench_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_ref-mt_bench_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_ref-mt_bench_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_ref-mt_bench_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_ref-mt_bench_paper_1-3)</sup> Zheng, L. et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». *arXiv:2306.05685*, 2023. <a href="https://arxiv.org/html/2306.05685v4" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-klu_glossary-2">↑ <sup>[2.0](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_ref-klu_glossary_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_ref-klu_glossary_2-1)</sup> «MT-Bench (Multi-turn Benchmark)». *Klu.ai Glossary*. <a href="https://klu.ai/glossary/mt-bench-eval" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gabor_melli_rkb-3">[↑](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_ref-gabor_melli_rkb_3-0) «MT-Bench - GM-RKB». *GaborMelli.com*. <a href="https://www.gabormelli.com/RKB/MT-Bench" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-mt_bench_101_paper-4">[↑](https://systems-analysis.info/int/MT-Bench_(benchmark)_(HE)#cite_ref-mt_bench_101_paper_4-0) Bai, G. et al. «MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues». *arXiv:2402.14762*, 2024. <a href="https://arxiv.org/abs/2402.14762" class="external autonumber" rel="nofollow">[4]</a></span>
