HumanEval Benchmark (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

HumanEval — यह एक मानक डेटा सेट (benchmark) है, जो कृत्रिम बुद्धिमत्ता मॉडलों द्वारा पाठ्य विवरण के आधार पर उत्पन्न कोड की गुणवत्ता के वस्तुनिष्ठ मूल्यांकन के लिए बनाया गया है[1]। इसे जुलाई 2021 में मार्क चेन (Mark Chen) के नेतृत्व में OpenAI के शोधकर्ताओं द्वारा प्रस्तुत किया गया था और यह उत्पन्न प्रोग्रामों की कार्यात्मक शुद्धता मापने के प्रमुख मानकों में से एक बन गया।

HumanEval का विकास कोड जनरेशन के मूल्यांकन की एक विश्वसनीय पद्धति की आवश्यकता से प्रेरित था। पहले भाषा मॉडलों द्वारा उत्पन्न कोड की गुणवत्ता को अक्सर अप्रत्यक्ष मेट्रिक्स (जैसे BLEU) से या मैन्युअल रूप से आँका जाता था, जो प्रोग्रामों की वास्तविक कार्यक्षमता से मेल की गारंटी नहीं देता था। HumanEval इस समस्या को कार्यात्मक शुद्धता पर ध्यान केंद्रित करके हल करता है: उत्पन्न कोड का मूल्यांकन उसकी वाक्य-रचनात्मक समानता से नहीं, बल्कि स्वचालित unit tests के एक समूह को सफलतापूर्वक पास करने की उसकी क्षमता के आधार पर किया जाता है[1]

कार्य-समूह की संरचना

इस benchmark में 164 प्रोग्रामिंग कार्य हैं, जो विशेष रूप से इस dataset के लिए हस्तलिखित रूप से तैयार किए गए हैं, ताकि यह सुनिश्चित किया जा सके कि वे मॉडलों के प्रशिक्षण डेटा में मौजूद न हों। सभी कार्य Python भाषा में तैयार किए गए हैं और विवरण सहित कोड के अंशों के रूप में प्रस्तुत किए गए हैं[2]

प्रत्येक कार्य में शामिल हैं:

  • फ़ंक्शन शीर्षक: फ़ंक्शन के नाम और मापदंडों सहित उसका signature।
  • पाठ्य विवरण: अंग्रेज़ी में Docstring, जो आवश्यक कार्यक्षमता का वर्णन करता है।
  • फ़ंक्शन का मुख्य भाग: खाली स्थान, जिसे मॉडल को उत्पन्न कोड से भरना होता है।

प्रत्येक कार्य के लिए मॉडल से छिपाए गए तत्व भी होते हैं:

  • कैनोनिकल समाधान: फ़ंक्शन का सही (संदर्भ) कार्यान्वयन।
  • मॉड्यूलर परीक्षणों का समूह (unit tests): उत्पन्न कोड की शुद्धता की स्वचालित जाँच के लिए उपयोग किया जाता है। परीक्षण सामान्य और सीमांत दोनों मामलों को कवर करते हैं।

कार्य विषयों की एक विस्तृत श्रृंखला को कवर करते हैं: बुनियादी भाषा संरचनाओं और एल्गोरिदम से लेकर सरल गणित तक, जो इस समूह को मॉडलों के लिए विविध और चुनौतीपूर्ण बनाता है।

मॉडलों के मूल्यांकन की पद्धति

HumanEval पर सफलता की मुख्य मेट्रिक pass@k है, जो उन कार्यों का अनुपात मापती है जिन्हें मॉडल ने कार्यात्मक रूप से सही ढंग से हल किया[1]। किसी समाधान को सफल तब माना जाता है जब उत्पन्न कोड उस कार्य के सभी स्वचालित परीक्षण पास कर लेता है।

  • pass@1: मुख्य और सबसे अधिक उपयोग किया जाने वाला संकेतक। इसका अर्थ है उन कार्यों का प्रतिशत जिन्हें मॉडल पहले प्रयास में हल कर लेता है (अर्थात प्रति कार्य एक समाधान विकल्प उत्पन्न करने पर)।
  • pass@k: सामान्य स्थिति में, यह मेट्रिक उन कार्यों का अनुपात दर्शाती है जिनके लिए मॉडल द्वारा उत्पन्न k में से कम से कम एक समाधान विकल्प सभी परीक्षण पास कर लेता है। उदाहरण के लिए, pass@10 दर्शाता है कि यदि मॉडल को प्रत्येक कार्य पर 10 प्रयास दिए जाएँ, तो वह कितने अनुपात कार्य हल कर सकता है।

चूँकि pass@k की प्रत्यक्ष गणना के लिए बड़ी संख्या में नमूनों की आवश्यकता होती है, इसलिए लेखकों ने इस मेट्रिक की गणना के लिए एक सांख्यिकीय रूप से सटीक विधि प्रस्तावित की, जो निष्पक्ष मूल्यांकन प्राप्त करने की अनुमति देती है[1]

व्यावहारिक परीक्षण एक विशेष «sandbox» में होता है: उत्पन्न कोड को संकलित किया जाता है और परीक्षण-समूह पर चलाया जाता है। यह दृष्टिकोण मॉडल की निष्पादन योग्य और सही कोड उत्पन्न करने की क्षमता को मापने की अनुमति देता है, न कि केवल वाक्य-रचनात्मक रूप से संदर्भ के समान कोड की।

परिणाम और उद्योग पर प्रभाव

HumanEval पर प्रारंभिक प्रयोगों ने सामान्य-उद्देश्य मॉडलों और कोड पर विशेष रूप से प्रशिक्षित मॉडलों के बीच महत्वपूर्ण अंतर दिखाया।

  • 2021 में OpenAI का Codex मॉडल (12 अरब पैरामीटर, GitHub के कोड पर प्रशिक्षित) पहले प्रयास में ~28.8% कार्य हल करने में सफल रहा (pass@1)।
  • उसी समय, बड़ा भाषा मॉडल GPT-3 (175 अरब पैरामीटर), जो कोड पर प्रशिक्षित नहीं था, एक भी कार्य सही ढंग से हल नहीं कर सका[1]

इन परिणामों ने सफल कोड जनरेशन के लिए प्रोग्रामिंग डेटा पर विशेष प्रशिक्षण की आवश्यकता को रेखांकित किया। HumanEval के प्रकट होने के बाद, यह benchmark नए मॉडलों की प्रगति की तुलना के लिए शीघ्र ही एक मानक परीक्षण बन गया।

  • GPT-3.5 श्रृंखला के मॉडलों (2023 की शुरुआत) ने ~72% pass@1 प्राप्त किया।
  • GPT-4 मॉडल (2023) ने और भी उच्च परिणाम प्रदर्शित किए, मूल संस्करण में ~67% प्राप्त किया और अतिरिक्त fine-tuning के बाद 85% से अधिक हासिल किया[3]
  • Code Llama (Meta, 2023) और WizardCoder (2023) जैसे खुले मॉडलों ने भी उच्च परिणाम दिखाए (क्रमशः ~53% और ~57% pass@1), प्रारंभिक proprietary मॉडलों को पीछे छोड़ते हुए[4]

Benchmark के विस्तार और प्रकार

HumanEval की सफलता ने कई व्युत्पन्न संस्करणों के निर्माण को प्रेरित किया, जो मॉडलों का व्यापक परिस्थितियों में मूल्यांकन करने के लिए बनाए गए।

  • CL-HumanEval (Cross-Lingual HumanEval): एक क्रॉस-भाषाई प्रकार (2024), जहाँ मूल HumanEval के कार्यों को विभिन्न भाषाओं (अंग्रेज़ी के अलावा) में विवरण समझने की मॉडलों की क्षमता की जाँच के लिए अनुकूलित किया गया है, जबकि कोड Python में उत्पन्न किया जाता है[5]
  • Multilingual HumanEval: एक विस्तार (2023), जो अंग्रेज़ी विवरण के आधार पर 12 विभिन्न प्रोग्रामिंग भाषाओं (Java, C#, JavaScript और अन्य सहित) में कोड जनरेशन के मूल्यांकन पर केंद्रित है[6]
  • HumanEval-XL: एक बड़े पैमाने का benchmark (2024), जो दोनों दृष्टिकोणों को जोड़ता है। इसमें 12 प्रोग्रामिंग भाषाओं में कार्य और रूसी, चीनी, अरबी आदि सहित विश्व की 23 भाषाओं में पाठ्य विवरण के अनुवाद हैं। कुल मिलाकर HumanEval-XL में 22,000 से अधिक «विवरण-कोड» युग्म हैं[7]

संदर्भ

  • HumanEval पर Hugging Face
  • Papers with Code पर HumanEval का पृष्ठ

साहित्य

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

टिप्पणियाँ

  1. 1.0 1.1 1.2 1.3 1.4 Chen, M. et al. «Evaluating Large Language Models Trained on Code». arXiv:2107.03374, 2021. [१]
  2. «openai/openai_humaneval». Hugging Face Datasets. [२]
  3. Niu, C. et al. «On Evaluating the Efficiency of Source Code Generated by LLMs». Proceedings of the 2nd International Conference on AI-generated Content, 2024. [३]
  4. Lutfullaev, J. «HumanEval on LLMs Revisited in Late 2023». arXiv:2402.14852, 2023. [४]
  5. Sato, M. et al. «CL-HumanEval: A Benchmark for Evaluating Cross-Lingual Transfer through Code Generation». Proceedings of the 38th Pacific Asia Conference on Language, Information and Computation, 2024. [५]
  6. Athiwaratkun, B. et al. «Multilingual HumanEval: A Multilingual Code Generation Benchmark». arXiv:2307.11892, 2023. [६]
  7. Liu, J. et al. «HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization». LREC-COLING 2024. [७]