---
title: "SWE-bench (benchmark) (UR)"
source: "https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)"
wiki: "systems-analysis.info/int"
article: "SWE-bench_(benchmark)_(UR)"
language: "ur"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Urdu"
revision_id: 6537
wiki_created_at: 2026-09-07T00:06:12Z
wiki_modified_at: 2026-09-07T00:06:12Z
downloaded_at: 2026-09-07T23:14:25Z
---

# SWE-bench (benchmark) (UR)

**SWE-bench** — یہ ایک وسیع **benchmark** (آزمائشی مسائل کا مجموعہ) ہے جو **بڑے لسانی ماڈلز** (**LLM**) کی **خودکار سافٹ ویئر ترقی** اور **ڈیبگنگ** کے شعبے میں صلاحیتوں کو جانچنے کے لیے بنایا گیا ہے<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-original-1)</sup>۔ اسے Princeton یونیورسٹی اور دیگر اداروں کے محققین کی ایک ٹیم نے تیار کیا اور ICLR 2024 کانفرنس میں پیش کیا<sup>[\[2\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-github-swe-2)</sup>۔ SWE-bench روایتی کوڈ benchmarks سے اس لحاظ سے مختلف ہے کہ یہ ترقیاتی عمل کے **حقیقی مسائل** استعمال کرتا ہے: آزمائشی مجموعے میں **2294 مسائل** شامل ہیں جو GitHub پر 12 مقبول اوپن سورس Python ریپوزٹریز سے بند شدہ issues اور ان سے متعلق pull requests پر مبنی ہیں<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-original-1)[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-empirical-3)</sup>۔ ہر مسئلے میں مشکل کی تفصیل (issue) موجود ہوتی ہے اور ماڈل کو متعلقہ پروجیکٹ کے سورس کوڈ تک رسائی دی جاتی ہے؛ ماڈل کا مقصد کوڈ بیس میں کم سے کم تبدیلیاں (**patch**) پیدا کرنا ہے جو مذکورہ مسئلے کو حل کرے<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-original-1)[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-empirical-3)</sup>۔

## جانچ کا طریقہ کار اور خصوصیات

SWE-bench سافٹ ویئر ترقی کے حقیقی عمل کی نقل کرتا ہے۔ ہر مسئلے کے لیے ماڈل کو اصل GitHub issue کا متن (مشکل کی تفصیل) اور اصلاح سے پہلے کی ریپوزٹری کوڈ کا snapshot پیش کیا جاتا ہے<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-anthropic-claude-4)</sup>۔ ماڈل (یا ماڈل پر مبنی agent) سے مطلوب ہوتا ہے کہ وہ سورس کوڈ کا تجزیہ کرے، خرابی یا مطلوبہ تبدیلی کی نوعیت کو سمجھے اور متعلقہ کوڈ فائلوں میں ترمیم کر کے مسئلے کو دور کرے<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-anthropic-claude-4)[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-medium-sulbhajain-5)</sup>۔ **حل کی توثیق** خودکار ہے: ہر مسئلے سے اس pull request کے حقیقی unit tests منسلک ہیں جس نے وہ مسئلہ بند کیا تھا۔ ان میں **«fail-to-pass»** tests بھی ہیں (جو اصل کوڈ پر ناکام ہوتے ہیں لیکن درست اصلاح کے بعد کامیاب ہونے چاہییں) اور **regression tests** بھی (pass-to-pass، جو ابتداً کامیاب ہوتے ہیں اور تبدیلیوں کے بعد بھی کامیاب رہنے چاہییں)<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-empirical-3)</sup>۔ ماڈل کی تجویز کردہ patch کوڈ پر لاگو کی جاتی ہے، پھر متعلقہ tests چلائے جاتے ہیں: اگر تمام fail-to-pass tests کامیاب ہو جائیں اور pass-to-pass tests متاثر نہ ہوں تو مسئلہ درست حل شدہ تصور کیا جاتا ہے<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-empirical-3)</sup>۔ جانچ کا یہ طریقہ نہ صرف ماڈل کی نحوی طور پر درست کوڈ بنانے کی صلاحیت بلکہ موجودہ فعالیت کو نقصان پہنچائے بغیر واقعی مسئلہ حل کرنے کی اہلیت کو بھی پرکھتا ہے۔ اس کے ساتھ ماڈل کو بڑے context (پورے کوڈ ریپوزٹری) میں کام کرنا، اجزاء کے درمیان تعلقات سمجھنا اور بیک وقت کئی فائلوں میں تبدیلیاں ہم آہنگ کرنا پڑتی ہیں<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-original-1)</sup> — یہ سب کچھ کسی تفصیل کی بنیاد پر function لکھنے کی عام آزمائشوں سے کہیں زیادہ پیچیدہ ہے۔

SWE-bench کی جانچ میں عموماً محض LLM نہیں بلکہ **agentی نظام** حصہ لیتے ہیں جو ماڈل کو معاون اوزاروں (مثلاً فائلوں میں نیویگیشن، کوڈ چلانے، debugger کے استعمال وغیرہ) کے ساتھ ملا کر استعمال کرتے ہیں<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-anthropic-claude-4)[\[6\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-techcrunch-ms-debug-6)</sup>۔ یہ نظام حقیقی ترقیاتی چکر کی نقل کرتا ہے: ماڈل یکے بعد دیگرے فائلیں دیکھ سکتا ہے، tests یا scripts چلا سکتا ہے اور کامیاب نتیجے تک پہنچنے تک حل کو بتدریج بہتر بنا سکتا ہے<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-anthropic-claude-4)</sup>۔ قابلِ ذکر بات یہ ہے کہ SWE-bench کے مسائل حل کرنے کی کارکردگی اس **«scaffolding»** (agent کا ڈھانچہ) کے معیار پر بڑی حد تک منحصر ہے: یکساں بنیادی ماڈلز ریپوزٹری اور اوزاروں کے ساتھ تعامل کی ترتیب کے مطابق مختلف نتائج دکھا سکتے ہیں<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-anthropic-claude-4)[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ اس طرح SWE-bench ماڈل اور اس کی مسئلہ حل کرنے کی حکمتِ عملی کے مجموعی امکانات کا پیمانہ بنتا ہے، اور **خودمختار AI ڈویلپر** کے حقیقی حالاتِ کار کے قریب تر جانچ فراہم کرتا ہے<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-anthropic-claude-4)[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔

## مسائل کے مجموعوں کی اقسام

SWE-bench کے مصنفین اور کمیونٹی نے بعد میں مختلف جانچی مقاصد کے لیے کئی ذیلی مجموعے پیش کیے:

- **SWE-bench Lite** — benchmark کا ہلکا ورژن جس میں **~300 مسائل**<sup>[\[8\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-swebench-leaderboard-8)</sup> شامل ہیں، جو ماڈلز کی جانچ کی پیچیدگی اور حسابی اخراجات کم کرنے کے لیے منتخب کیے گئے ہیں۔ یہ ذیلی مجموعہ ماڈلز کے ساتھ تیز تجربات کے لیے بنایا گیا تھا اور سب سے زیادہ وقت طلب توثیقیں خارج کر کے بھی بنیادی مسائل کی نمائندگی برقرار رکھتا ہے<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ بنیادی طور پر Lite میں غلطیاں ٹھیک کرنے کے آسان اور مختصر مسائل ہیں، اور Lite پر ماڈلز کے نتائج عموماً مکمل مجموعے کے مقابلے میں زیادہ ہوتے ہیں کیونکہ سب سے مشکل معاملات خارج کر دیے گئے ہیں<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔
- **SWE-bench Verified** — **دستی جانچ** سے فلٹر شدہ ذیلی مجموعہ جو اگست 2024 میں OpenAI کے اشتراک سے پیش کیا گیا<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ محققین نے اصل benchmark کے ہر مسئلے کا تجزیہ کرنے کے لیے **93 پیشہ ور ڈویلپرز** کو شامل کیا اور ایسے معاملات خارج کیے جہاں مسئلے کی اصل تفصیل بہت مبہم ہو یا tests میں مطلوبہ رویہ شرائط سے واضح طور پر مستنبط نہ ہو<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ ماحول کی خرابیوں یا غلط tests کی وجہ سے عملاً ناقابلِ حل مسائل بھی ہٹا دیے گئے<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ آخرکار **500 مسائل** کا ایک مجموعہ بنایا گیا جو یقینی طور پر قابلِ حل اور درست طریقے سے وضع کردہ ہیں<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ SWE-bench Verified کا مقصد ایسے معاملات ختم کر کے ماڈلز کی صلاحیتوں کی زیادہ قابلِ اعتماد جانچ فراہم کرنا ہے جہاں tests یا سوال کی ناکافی ہونے کی وجہ سے درست حل بھی رد ہو جاتا ہے<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ اس مجموعے نے ماڈلز کے موازنے کے لیے بنیادی معیار کے طور پر SWE-bench کے اصل آزمائشی انتخاب (مکمل اور Lite) کی جگہ لے لی<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ اس کے علاوہ Verified کے ساتھ مسائل کی مشکل کی درجہ بندی بھی شائع کی گئی (مثلاً «آسان» مسائل جنہیں انسان \<15 منٹ میں حل کر سکتا ہے اور «مشکل» جن میں \>1 گھنٹہ لگتا ہے)<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>، نیز tests کو زیادہ مستحکم اور قابلِ تکرار طریقے سے چلانے کے لیے Docker پر مبنی نیا ٹولنگ فریم ورک بھی جاری کیا گیا<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔
- **SWE-bench Multimodal** — benchmark کی توسیع جو جنوری 2025 میں پیش کی گئی، جس میں ایسے مسائل شامل ہیں جہاں مشکل کی تفصیل میں نہ صرف متن بلکہ **بصری عناصر** بھی ہیں (مثلاً انٹرفیس کی تصاویر، خرابیوں کے screenshots وغیرہ)<sup>[\[8\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-swebench-leaderboard-8)</sup>۔ یہ مجموعہ (**517 مسائل**<sup>[\[8\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-swebench-leaderboard-8)</sup>) پروگرامنگ کے مسائل حل کرتے وقت ماڈلز اور agents کی بصری معلومات سمجھنے اور استعمال کرنے کی صلاحیت جانچتا ہے۔ **multimodal مجموعے** پر جانچ اسی طرح منظم ہے لیکن ماڈل سے multi-modal صلاحیتیں (مثلاً تصاویر میں متن کی شناخت) مطلوب ہیں۔ SWE-bench Multimodal کا آزمائشی حصہ معلوم جوابات کے مطابق حل ڈھالنے سے بچانے کے لیے پوشیدہ رکھا گیا ہے؛ ڈویلپرز ان مسائل پر اپنے ماڈلز کی جانچ کے لیے دور دراز **leaderboard** پر حل جمع کر سکتے ہیں<sup>[\[2\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-github-swe-2)</sup>۔

ان بنیادی اقسام کے علاوہ SWE-bench کے گرد اوزاروں کا ایک ecosystem بھی وجود میں آیا ہے: **SWE-agent** — ایک اوپن سورس سافٹ ویئر «agent» حل کنندہ جو benchmark کے مسائل پر اعلیٰ نتائج ظاہر کرتا ہے<sup>[\[2\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-github-swe-2)</sup>؛ **SWE-smith** — اپنے ڈویلپر ماڈلز کی تربیت کے لیے framework؛ **SWE-REX** — ریپوزٹریز سے معلومات کے وسیع تر استخراج اور پروسیسنگ کا اوزار وغیرہ۔ یہ منصوبے نتائج کی تکرار کو آسان بنانے اور خودمختار پروگرامنگ نظاموں کے شعبے میں تحقیق کو آگے بڑھانے کا ہدف رکھتے ہیں۔

## ماڈلز کے نتائج اور ترقی

SWE-bench کے ابتدائی ظہور پر اس نے جدید LLM اور تجربہ کار پروگرامرز کی مہارتوں کے درمیان بڑا فرق ظاہر کیا۔ مصنفین نے بتایا کہ 2023 کے اوائل کے طاقتور ترین ماڈلز بھی مسائل کے صرف **چند فیصد** ہی حل کر پاتے تھے: مثلاً Anthropic کا Claude 2 ماڈل مکمل مجموعے کے **2%** سے بھی کم مسائل کامیابی سے حل کر سکتا تھا<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-original-1)</sup>۔ benchmark کے مصنفین کا تربیت یافتہ ماڈل (LLaMA پر مبنی، جسے **SWE-Llama** کہا گیا) اور GPT-4 جیسے ملکیتی ماڈلز بنیادی طور پر صرف آسان ترین غلطیاں ہی حل کر سکتے تھے<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-original-1)</sup>۔ ان ابتدائی کم نتائج نے SWE-bench کی پیچیدگی کو اجاگر کیا اور نئے طریقوں کی ترقی کی محرک بنے۔

2024 کے دوران، زیادہ بہتر ماڈلز اور agentی اسکیموں کے ظہور کے ساتھ، نتائج میں نمایاں بہتری آئی۔ Princeton کے محققین نے SWE-agent سسٹم پیش کیا جو GPT-4 کو کوڈ تلاش، منصوبہ بندی اور دیگر اوزاروں کے ساتھ ملاتا ہے؛ اس نے مکمل مجموعے پر تقریباً **12.5%** مسائل حل کیے اور علمی ماڈلز کے لیے نیا معیار قائم کیا<sup>[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-medium-sulbhajain-5)</sup>۔ 2024 کے وسط تک سرکاری SWE-bench leaderboard پر بہترین حل (ملکیتی سمیت) مکمل benchmark پر تقریباً **20%** اور آسان Lite مجموعے پر **43%** تک کامیاب حل تک پہنچ گئے<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ یہ اضافہ ماڈلز کی بہتری (مثلاً GPT-4، Claude 2 اور 3 کا ظہور) اور خاص طور پر «scaffolding» کی ترقی سے جڑا ہے — بیرونی حکمتِ عملیاں جو ماڈل کو مسئلے کو مرحلہ وار تقسیم کرنے، دستاویزات پڑھنے، ڈیبگنگ سیشن چلانے وغیرہ میں مؤثر طریقے سے مدد دیتی ہیں<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔

2024 کے آخر میں Verified مجموعہ (غلط مسائل سے پاک) متعارف کرانے کے بعد قابلِ پیمائش کارکردگی مزید بڑھ گئی۔ ماڈل GPT-4 (GPT-4o ورژن) نے Verified پر فوراً تقریباً **33%** کامیاب حل ظاہر کیے جبکہ اصل مجموعے پر پہلے **~16%** تھے<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ بہترین اوپن سورس agent فریم ورکس (مثلاً Agentless) نے Verified پر اپنے نتائج **~16%** سے دوگنا کر کے **32%** تک پہنچائے<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ اس سے یہ اندازہ درست ثابت ہوا کہ اصل benchmark ناقابلِ حل معاملات کی وجہ سے نتائج کو کسی حد تک **کم ظاہر کر رہا تھا**<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ ساتھ ہی Lite کے مقابلے میں Verified پر نتائج کی بہتری اتنی劇matic نہیں (بہترین ماڈلز Lite پر ~43% تک پہنچ چکے تھے)، جو منطقی ہے: Lite نے ابتداً آسان مثالیں منتخب کی تھیں جبکہ Verified نے ناممکن مسائل ہٹائے لیکن مشکل مسائل رہنے دیے<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ قابلِ ذکر بات یہ ہے کہ Verified پر منتقلی میں نتائج کا اضافہ **مسائل کی تمام مشکل کے درجات میں** ہوا، نہ کہ صرف سب سے مشکل کو ہٹانے سے — یعنی فلٹریشن نے نسبتاً آسان مسائل میں بھی پوشیدہ ناقابلِ عمل معاملات کو دور کیا<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔

2025 کے آغاز میں سرکردہ AI نظام جانچے گئے مجموعے پر انسانی سطح کے قریب کارکردگی دکھا رہے ہیں، اگرچہ 100% کی حد ابھی بھی دور ہے۔ جنوری 2025 میں Anthropic نے اعلان کیا کہ اس کے نئے ماڈل Claude 3.5 Sonnet نے بہتر agent کے ساتھ مل کر SWE-bench Verified کے **49%** مسائل حل کیے<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-anthropic-claude-4)</sup>، اور عارضی طور پر پہلے مقام پر آ گئی۔ بڑی ٹیکنالوجی کمپنیاں اور آزاد ٹیمیں بھی اس benchmark پر غیر رسمی مقابلوں میں سرگرمی سے حصہ لیتی ہیں۔ مثلاً CodeStory کی ٹیم نے متعدد ماڈلز والا متبادل جانچنے کا طریقہ («Midwit Agent») تیار کیا جس نے Verified پر ریکارڈ **62.2%** مسائل حل کیے (2025 کے آغاز کا ڈیٹا)<sup>[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-medium-sulbhajain-5)[\[9\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-ycombinator-sota-9)</sup>۔ یہ نوٹ کیا گیا کہ اس کے لیے ماڈل کے inference کے مرحلے پر حسابی وسائل (inference time scaling) میں خاطر خواہ اضافہ کرنا پڑا، متعدد حل آزمائے گئے اور بہترین نتیجہ منتخب کیا گیا<sup>[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-medium-sulbhajain-5)</sup>۔ OpenAI کے مواد میں ایک تجرباتی نظام GPT-03 کا بھی ذکر تھا جس نے کافی scaling کے ساتھ Verified پر **70%** کی حد عبور کی (غیر سرکاری ڈیٹا)<sup>[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-medium-sulbhajain-5)</sup>۔ تاہم ان نتائج کی آزادانہ تصدیق موجود نہیں، اور اتنا بلند نتیجہ حاصل شدہ سطح کے بجائے آئندہ تحقیق کے لیے ایک ہدف ہی ہے۔

Microsoft Research (2025) کی تحقیق کے مطابق، نئے ترین ماڈلز بھی ڈیبگنگ اوزاروں سے لیس ہونے کے باوجود SWE-bench Lite سے بگ فکسنگ میں **50%** کی حد عبور نہیں کر پاتے<sup>[\[6\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-techcrunch-ms-debug-6)</sup>۔ اس آزمائش میں سب سے بہتر Claude 3.7 Sonnet رہی جس نے **~48.4%** مسائل حل کیے، جبکہ GPT-4 (OpenAI 01) پر مبنی نظام نے تقریباً **30%** اور ہلکے ماڈل 03-mini نے صرف **22%** حل کیے<sup>[\[6\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-techcrunch-ms-debug-6)</sup>۔ یہ نتائج اس بات کی نشاندہی کرتے ہیں کہ تیز ترقی کے باوجود جدید AI ابھی تجربہ کار پروگرامرز سے پیچھے ہے: انسان کے لیے ایسے مسائل حل کرنا (کوڈ سمجھنے کی صورت میں) مشکل نہیں، جبکہ ماڈل اکثر ڈیبگنگ اوزاروں کو مؤثر طریقے سے استعمال نہیں کر پاتا یا تربیتی ڈیٹا کی کمی کا شکار ہوتا ہے جو خرابی ٹھیک کرنے کے کثیر مرحلاتی عمل کو ظاہر کرتا ہو<sup>[\[6\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-techcrunch-ms-debug-6)</sup>۔

## حدود اور امکانات

SWE-bench ذہین کوڈ agents کی جانچ کے لیے ایک معیاری پلیٹ فارم بن گیا ہے، تاہم تحقیق نے اس کی کچھ حدود بھی ظاہر کی ہیں۔ بنیادی مسئلہ **ٹیسٹنگ کی ناقصیت** ہے: ہر مسئلے کے آزمائشی tests کا مجموعہ مخصوص pull request سے لیا جاتا ہے اور عموماً صرف وہی unit tests شامل ہوتے ہیں جو بگ فکس کے وقت تبدیل کیے گئے تھے<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-empirical-3)</sup>۔ جیسا کہ Zhejiang یونیورسٹی اور Stuttgart یونیورسٹی کے سائنسدانوں کے ایک گروپ کے تجزیے (Wang et al. 2025) نے ظاہر کیا، پروجیکٹ کے باقی tests کو نظرانداز کرنا کچھ حلوں کی غلطی چھپا سکتا ہے<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-empirical-3)</sup>۔ ریپوزٹری کے مکمل tests پر حلوں کی دوبارہ جانچ سے معلوم ہوا کہ اوسطاً SWE-bench میں کامیاب قرار دیے گئے **7.8%** patches درحقیقت پروجیکٹ کے **دیگر tests میں ناکام ہو جاتے ہیں**<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-empirical-3)</sup>۔ اس سے «حل شدہ مسائل» کا نتیجہ تقریباً **4-6 فیصدی پوائنٹس** بڑھ کر ظاہر ہوتا ہے<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-empirical-3)</sup>۔ اس سے بھی باریک معاملہ یہ ہے کہ پیدا کردہ patch تمام اصل tests پاس کر لے لیکن ڈویلپر کے حل کے **مساوی نہ ہو** اور پروگرام کا رویہ متوقع طریقے سے نہ بدلے۔ اضافی test cases بنانے (PatchDiff طریقہ کار) کی مدد سے محققین نے پایا کہ AI کی تجویز کردہ تقریباً **30%** اصلاحات حوالہ جاتی patches سے مختلف رویہ ظاہر کرتی ہیں، اور تقریباً **11%** غلط ہیں اگرچہ موجودہ tests انہیں نہیں پکڑ پاتے<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-empirical-3)</sup>۔ اس طرح اگر محدود tests کے پاس ہونے پر ہی انحصار کیا جائے تو ماڈلز کی حقیقی صلاحیتیں بڑھ چڑھ کر پیش ہو سکتی ہیں۔ SWE-bench کے تخلیق کار اس کمزوری کو تسلیم کرتے ہیں اور زور دیتے ہیں کہ benchmark کو وقت کے ساتھ تبدیل ہوتے رہنا چاہیے: tests کی coverage بہتر ہو، ناپسندیدہ ضمنی اثرات کی جانچ شامل کی جائے، مسائل کی اقسام کا دائرہ وسیع ہو<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ ایسے جانچ کے ذرائع کی ترقی تیزی سے خودمختار اور طاقتور AI ڈویلپرز کی آمد کی تیاری کا اہم حصہ ہے، اور SWE-bench کا تجربہ benchmarks کے معیار پر توجہ دینے کی ضرورت ظاہر کرتا ہے<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔

SWE-bench محض ایک جامد مسائل کا مجموعہ ہونے کے باوجود پروگرامنگ کے تمام پہلوؤں کو نہیں ڈھانپتا، لیکن یہ کوڈ ماڈلز کے موازنے کے لیے **de facto معیار** بن چکا ہے<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-empirical-3)</sup>۔ اسے علمی مقالوں میں نئے طریقوں اور الگورتھمز کی نمائش کے لیے، اور صنعتی تحقیقی گروپوں کی جانب سے پروگرامنگ کو خودکار بنانے کے لیے تیار نظاموں کے امکانات جانچنے کے لیے استعمال کیا جاتا ہے<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-arxiv-empirical-3)</sup>۔ 2023-2025 کے دوران SWE-bench پر مسلسل بڑھتے نتائج LLM کی عملی ترقیاتی مسائل حل کرنے کی صلاحیتوں میں تیز بہتری کی واضح مثال ہیں۔ ساتھ ہی یہ پیچیدگی کا پیمانہ بھی ہے: 50-60% حل شدہ مسائل کے قریب پہنچ کر بھی ماڈلز ابھی **انسان کا مکمل متبادل بننے سے دور ہیں**، خاص طور پر محدود معلومات کی صورت میں اور جب تقاضوں کی باریک سمجھ کی ضرورت ہو<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-anthropic-claude-4)[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔ بہر حال ترقی رکتی نہیں — SWE-bench جیسے اقدامات کی بدولت کمیونٹی اپنے اہداف اور حدود واضح طور پر دیکھتی ہے اور ایک مکمل AI ڈویلپر بنانے کی طرف بڑھتی رہتی ہے جو انسانی ماہر کی سطح پر خودمختاری سے پروگرامنگ کوڈ سمجھنے اور ٹھیک کرنے کی صلاحیت رکھتا ہو<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-anthropic-claude-4)[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_note-openai-verified-7)</sup>۔

## حوالہ جات

- SWE-bench از GitHub
- SWE-bench کا سرکاری leaderboard

## کتابیات

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## حواشی

1.  <span id="cite_note-arxiv-original-1">↑ <sup>[1.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-original_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-original_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-original_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-original_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-original_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-original_1-5)</sup> Jimenez, Carlos E. et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». *arXiv*. <a href="https://arxiv.org/abs/2310.06770" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-github-swe-2">↑ <sup>[2.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-github-swe_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-github-swe_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-github-swe_2-2)</sup> «SWE-bench/SWE-bench». *GitHub*. <a href="https://github.com/SWE-bench/SWE-bench" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-empirical-3">↑ <sup>[3.00](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-empirical_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-empirical_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-empirical_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-empirical_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-empirical_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-empirical_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-empirical_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-empirical_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-empirical_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-empirical_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-arxiv-empirical_3-10)</sup> Wang, Shuyang et al. «Are "Solved Issues" in SWE-bench Really Solved Correctly? An Empirical Study». *arXiv*. <a href="https://arxiv.org/html/2503.15223v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-anthropic-claude-4">↑ <sup>[4.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-anthropic-claude_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-anthropic-claude_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-anthropic-claude_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-anthropic-claude_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-anthropic-claude_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-anthropic-claude_4-5)</sup> <sup>[4.6](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-anthropic-claude_4-6)</sup> <sup>[4.7](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-anthropic-claude_4-7)</sup> <sup>[4.8](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-anthropic-claude_4-8)</sup> «Claude SWE-Bench Performance». *Anthropic*. <a href="https://www.anthropic.com/engineering/swe-bench-sonnet" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-medium-sulbhajain-5">↑ <sup>[5.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-medium-sulbhajain_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-medium-sulbhajain_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-medium-sulbhajain_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-medium-sulbhajain_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-medium-sulbhajain_5-4)</sup> Jain, Sulbha. «SWE Benchmark: LLM evaluation in Software Engineering Setting». *Medium*. <a href="https://medium.com/@sulbha.jindal/swe-benchmark-llm-evaluation-in-software-engineering-setting-52f315b2de5a" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-techcrunch-ms-debug-6">↑ <sup>[6.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-techcrunch-ms-debug_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-techcrunch-ms-debug_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-techcrunch-ms-debug_6-2)</sup> <sup>[6.3](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-techcrunch-ms-debug_6-3)</sup> Hatmaker, Taylor. «AI models still struggle to debug software, Microsoft study shows». *TechCrunch*. <a href="https://techcrunch.com/2025/04/10/ai-models-still-struggle-to-debug-software-microsoft-study-shows/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai-verified-7">↑ <sup>[7.00](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-0)</sup> <sup>[7.01](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-1)</sup> <sup>[7.02](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-2)</sup> <sup>[7.03](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-3)</sup> <sup>[7.04](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-4)</sup> <sup>[7.05](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-5)</sup> <sup>[7.06](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-6)</sup> <sup>[7.07](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-7)</sup> <sup>[7.08](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-8)</sup> <sup>[7.09](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-9)</sup> <sup>[7.10](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-10)</sup> <sup>[7.11](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-11)</sup> <sup>[7.12](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-12)</sup> <sup>[7.13](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-13)</sup> <sup>[7.14](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-14)</sup> <sup>[7.15](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-15)</sup> <sup>[7.16](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-16)</sup> <sup>[7.17](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-17)</sup> <sup>[7.18](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-18)</sup> <sup>[7.19](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-19)</sup> <sup>[7.20](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-20)</sup> <sup>[7.21](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-21)</sup> <sup>[7.22](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-openai-verified_7-22)</sup> «Introducing SWE-bench Verified». *OpenAI*. <a href="https://openai.com/index/introducing-swe-bench-verified/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-swebench-leaderboard-8">↑ <sup>[8.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-swebench-leaderboard_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-swebench-leaderboard_8-1)</sup> <sup>[8.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-swebench-leaderboard_8-2)</sup> «SWE-bench Leaderboard». <a href="https://www.swebench.com/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-ycombinator-sota-9">[↑](https://systems-analysis.info/int/SWE-bench_(benchmark)_(UR)#cite_ref-ycombinator-sota_9-0) «SOTA on swebench-verified: relearning the bitter lesson». *Hacker News (Y Combinator)*. <a href="https://news.ycombinator.com/item?id=42638605" class="external autonumber" rel="nofollow">[9]</a></span>
