---
title: "SWE-bench (benchmark) (ID)"
source: "https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)"
wiki: "systems-analysis.info/int"
article: "SWE-bench_(benchmark)_(ID)"
language: "id"
categories:
  - "Category:Indonesian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 6526
wiki_created_at: 2026-09-07T00:05:58Z
wiki_modified_at: 2026-09-07T00:05:58Z
downloaded_at: 2026-09-07T23:14:20Z
---

# SWE-bench (benchmark) (ID)

**SWE-bench** — adalah sebuah **benchmark** skala besar (kumpulan tugas uji) untuk mengevaluasi kemampuan **large language model** (**LLM**) dalam bidang **otomatisasi pengembangan** dan **debugging perangkat lunak**<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-original-1)</sup>. Benchmark ini dikembangkan oleh sekelompok peneliti dari Universitas Princeton dan organisasi lainnya, serta dipresentasikan pada konferensi ICLR 2024<sup>[\[2\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-github-swe-2)</sup>. SWE-bench berbeda dari benchmark kode tradisional karena menggunakan **tugas-tugas nyata** dari praktik pengembangan: kumpulan uji mencakup **2294 tugas** yang didasarkan pada isu-isu (issues) yang telah ditutup beserta perbaikannya (pull request) dari 12 repositori Python sumber terbuka populer di GitHub<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-original-1)[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-empirical-3)</sup>. Setiap tugas berisi deskripsi masalah (issue) dan memberikan model akses ke kode sumber proyek yang bersangkutan; tujuan model adalah menghasilkan perubahan minimal pada basis kode (**patch**) yang akan memperbaiki masalah yang ditentukan<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-original-1)[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-empirical-3)</sup>.

## Metodologi dan Karakteristik Evaluasi

SWE-bench mensimulasikan proses pengembangan perangkat lunak yang nyata. Untuk setiap tugas, model diberikan teks GitHub issue asli (deskripsi masalah) dan snapshot kode repositori pada versi sebelum perbaikan diterapkan<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-anthropic-claude-4)</sup>. Model (atau agen berbasis model) diharuskan menganalisis kode sumber, memahami sifat kesalahan atau perubahan yang diperlukan, dan membuat modifikasi pada file kode yang relevan untuk menyelesaikan masalah<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-anthropic-claude-4)[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-medium-sulbhajain-5)</sup>. **Validasi solusi** dilakukan secara otomatis: setiap tugas dikaitkan dengan pengujian unit nyata dari pull request yang menutup masalah tersebut. Di antaranya terdapat pengujian **"gagal-ke-lulus"** (fail-to-pass, yang tidak lulus pada kode asli tetapi harus lulus setelah penerapan perbaikan yang benar) maupun **pengujian regresi** (pass-to-pass, yang awalnya lulus dan harus terus lulus setelah perubahan diterapkan)<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-empirical-3)</sup>. Patch yang diusulkan oleh model diterapkan ke kode, kemudian pengujian yang relevan dijalankan: jika semua pengujian fail-to-pass mulai lulus dan pengujian pass-to-pass tidak terganggu, maka tugas dianggap berhasil diselesaikan dengan benar<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-empirical-3)</sup>. Pendekatan evaluasi ini memungkinkan verifikasi tidak hanya kemampuan model dalam menghasilkan kode yang benar secara sintaksis, tetapi juga kemampuan untuk benar-benar menyelesaikan tugas yang diberikan tanpa merusak fungsionalitas yang sudah ada. Selain itu, model harus beroperasi dengan konteks yang besar (seluruh repositori kode), memahami hubungan antar komponen, dan mengoordinasikan perubahan pada beberapa file sekaligus<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-original-1)</sup> — semua ini jauh lebih kompleks dibandingkan tugas menulis fungsi berdasarkan deskripsi yang khas.

Dalam evaluasi SWE-bench, yang biasanya berpartisipasi bukan sekadar LLM itu sendiri, melainkan **sistem agentik** yang membungkus model dengan alat-alat bantu (misalnya, untuk navigasi file, eksekusi kode, penggunaan debugger, dan sebagainya)<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-anthropic-claude-4)[\[6\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-techcrunch-ms-debug-6)</sup>. Sistem semacam ini meniru siklus pengembangan nyata: model dapat secara berurutan melihat file, menjalankan pengujian atau skrip, dan secara bertahap menyempurnakan solusi hingga mencapai hasil yang sukses<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-anthropic-claude-4)</sup>. Yang menarik, efektivitas penyelesaian tugas SWE-bench sangat bergantung pada kualitas **"scaffolding"** ini (infrastruktur agen): model-model dasar yang sama dapat menunjukkan hasil yang berbeda tergantung pada bagaimana interaksi dengan repositori dan alat-alat diorganisasikan<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-anthropic-claude-4)[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Dengan demikian, SWE-bench berfungsi sebagai tolok ukur kemampuan gabungan antara model dan strategi penyelesaian tugasnya, mendekatkan evaluasi pada kondisi kerja nyata seorang **pengembang AI otonom**<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-anthropic-claude-4)[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>.

## Varian Kumpulan Tugas

Para penulis SWE-bench dan komunitas kemudian memperkenalkan beberapa kumpulan tugas turunan untuk berbagai tujuan evaluasi:

- **SWE-bench Lite** — versi ringan dari benchmark yang mencakup **~300 tugas**<sup>[\[8\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-swebench-leaderboard-8)</sup>, dipilih untuk mengurangi kompleksitas dan biaya komputasi dalam pengujian model. Sub-kumpulan ini dibuat untuk eksperimen cepat dengan model dan mengecualikan validasi yang paling memakan waktu, namun tetap mempertahankan representativitas masalah-masalah utama<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Pada dasarnya, Lite berisi tugas perbaikan bug yang lebih sederhana dan lebih singkat, dan hasil model pada Lite biasanya lebih tinggi dibandingkan pada kumpulan penuh, berkat dikecualikannya kasus-kasus paling kompleks<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>.
- **SWE-bench Verified** — sub-kumpulan yang disaring melalui **verifikasi manual**, diperkenalkan pada Agustus 2024 bersama OpenAI<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Para peneliti melibatkan **93 pengembang profesional** untuk menganalisis setiap tugas dalam benchmark asli dan mengecualikan kasus-kasus di mana deskripsi masalah asli terlalu tidak jelas atau perilaku yang diperlukan oleh pengujian tidak muncul secara eksplisit dari kondisi tugas<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Tugas-tugas yang dalam praktiknya tidak mungkin diselesaikan karena masalah lingkungan atau pengujian yang tidak tepat juga dihapus<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Hasilnya, terbentuk kumpulan **500 tugas** yang dijamin dapat diselesaikan dan dirumuskan dengan benar<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. SWE-bench Verified bertujuan untuk memastikan evaluasi kemampuan model yang lebih andal, dengan menghilangkan kasus-kasus di mana bahkan solusi yang benar pun ditolak karena ketidakmemadaian pengujian atau tugas<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Kumpulan ini menggantikan sampel uji SWE-bench asli (penuh maupun Lite) sebagai referensi utama untuk perbandingan model<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Selain itu, bersama Verified diterbitkan pula penilaian tingkat kesulitan tugas (misalnya, diidentifikasi tugas "mudah" yang dapat diselesaikan manusia dalam \<15 menit, dan tugas "sulit" yang membutuhkan \>1 jam)<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>, serta dirilisnya kerangka kerja instrumen baru berbasis Docker untuk pelaksanaan pengujian yang lebih stabil dan dapat direproduksi<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>.
- **SWE-bench Multimodal** — perluasan benchmark yang diperkenalkan pada Januari 2025, mencakup tugas-tugas di mana deskripsi masalah mengandung bukan hanya teks, tetapi juga **elemen visual** (misalnya, gambar antarmuka, screenshot kesalahan, dan sebagainya)<sup>[\[8\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-swebench-leaderboard-8)</sup>. Kumpulan ini (**517 tugas**<sup>[\[8\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-swebench-leaderboard-8)</sup>) menguji kemampuan model dan agen untuk memahami dan menggunakan informasi visual dalam menyelesaikan tugas pemrograman. Evaluasi pada **kumpulan multimodal** diorganisasikan dengan cara yang serupa, tetapi memerlukan kemampuan multimodal dari model (misalnya, pengenalan teks pada gambar). Bagian pengujian SWE-bench Multimodal dibiarkan tertutup (tersembunyi) untuk mencegah penyesuaian solusi terhadap jawaban yang sudah diketahui; para pengembang dapat mengirimkan solusi ke **leaderboard** jarak jauh untuk mengevaluasi model mereka pada tugas-tugas ini<sup>[\[2\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-github-swe-2)</sup>.

Selain variasi utama ini, ekosistem alat telah terbentuk di sekitar SWE-bench: **SWE-agent** — "agen" perangkat lunak sumber terbuka yang menunjukkan hasil terdepan pada tugas-tugas benchmark<sup>[\[2\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-github-swe-2)</sup>; **SWE-smith** — framework untuk melatih model pengembang sendiri; **SWE-REX** — alat untuk ekstraksi dan pemrosesan informasi dari repositori yang lebih canggih, dan lain-lain. Proyek-proyek ini bertujuan untuk menyederhanakan reproduksi hasil dan memajukan penelitian di bidang sistem pemrograman otonom.

## Hasil dan Kemajuan Model

Ketika pertama kali muncul, SWE-bench mengungkapkan kesenjangan signifikan antara LLM modern dan keterampilan programmer berpengalaman. Para penulis melaporkan bahwa bahkan model-model paling canggih pada awal 2023 hanya mampu menyelesaikan **beberapa persen** tugas saja: misalnya, model Claude 2 dari Anthropic berhasil menyelesaikan kurang dari **2%** tugas dalam kumpulan penuh<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-original-1)</sup>. Model yang dilatih khusus oleh penulis benchmark (berbasis LLaMA, yang disebut **SWE-Llama**) dan model proprietari seperti GPT-4 sebagian besar hanya dapat menyelesaikan bug-bug yang paling sederhana<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-original-1)</sup>. Metrik awal yang rendah ini menekankan kompleksitas SWE-bench dan menjadi dorongan untuk mengembangkan pendekatan-pendekatan baru.

Sepanjang tahun 2024, seiring munculnya model-model yang lebih canggih dan skema agentik, hasilnya meningkat secara signifikan. Para peneliti dari Princeton memperkenalkan sistem SWE-agent yang menggabungkan GPT-4 dengan pencarian kode, perencanaan, dan alat-alat lainnya; sistem ini mencapai sekitar **12,5%** tugas yang berhasil diselesaikan pada kumpulan penuh, menetapkan tolok ukur baru untuk model akademik<sup>[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-medium-sulbhajain-5)</sup>. Pada pertengahan 2024, solusi terbaik pada leaderboard resmi SWE-bench (termasuk yang proprietari) mencapai sekitar **20%** keberhasilan pada benchmark penuh dan hingga **43%** pada kumpulan Lite yang disederhanakan<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Peningkatan ini terkait dengan penyempurnaan model (misalnya, kemunculan GPT-4, Claude 2 dan 3) dan khususnya dengan pengembangan "scaffolding" — strategi eksternal yang memungkinkan model memecah tugas secara efektif menjadi langkah-langkah, membaca dokumentasi, menjalankan sesi debugging, dan sebagainya<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>.

Setelah diperkenalkannya kumpulan Verified pada akhir 2024 (yang dibersihkan dari tugas-tugas yang tidak tepat), kinerja yang terukur meningkat lebih signifikan lagi. Model GPT-4 (varian GPT-4o) langsung menunjukkan sekitar **33%** keberhasilan pada Verified dibandingkan **~16%** sebelumnya pada kumpulan asli<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Framework agen sumber terbuka terbaik (misalnya, Agentless) menggandakan hasilnya dari **~16%** menjadi **32%** pada Verified<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Hal ini mengonfirmasi dugaan bahwa benchmark asli sedikit **meremehkan indikator** karena adanya kasus-kasus yang tidak dapat diselesaikan<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Pada saat yang sama, peningkatan hasil pada Verified dibandingkan Lite tidak terlalu dramatis (model-model terbaik sudah mencapai ~43% pada Lite), yang masuk akal: Lite pada awalnya memilih contoh yang lebih mudah, sementara Verified menghapus yang tidak dapat diselesaikan tetapi tetap mempertahankan tugas-tugas yang kompleks<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Penting untuk dicatat bahwa peningkatan indikator saat beralih ke Verified terjadi **di semua kategori tingkat kesulitan tugas**, bukan hanya karena penghapusan yang paling sulit — artinya, penyaringan juga membebaskan kumpulan dari kasus-kasus yang secara tersembunyi tidak dapat diselesaikan di antara tugas-tugas yang relatif sederhana<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>.

Pada awal 2025, sistem-sistem AI terdepan sudah menunjukkan efisiensi yang mendekati manusia pada kumpulan tugas yang telah diverifikasi, meskipun batas 100% masih jauh. Pada Januari 2025, Anthropic mengumumkan bahwa model barunya Claude 3.5 Sonnet yang dikombinasikan dengan agen yang ditingkatkan berhasil menyelesaikan **49%** tugas SWE-bench Verified<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-anthropic-claude-4)</sup>, untuk sementara menempati posisi pertama. Perusahaan teknologi besar dan tim independen juga aktif berpartisipasi dalam kompetisi tidak resmi pada benchmark ini. Misalnya, tim CodeStory mengembangkan pendekatan multi-model dengan pencarian berbagai varian ("Midwit Agent"), yang mencapai rekor **62,2%** tugas yang berhasil diselesaikan pada Verified (data per awal 2025)<sup>[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-medium-sulbhajain-5)[\[9\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-ycombinator-sota-9)</sup>. Dicatat bahwa untuk itu diperlukan peningkatan signifikan dalam pengeluaran sumber daya komputasi pada tahap inferensi model (yang disebut inference time scaling), dengan menjalankan banyak upaya penyelesaian dan memilih hasil terbaik<sup>[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-medium-sulbhajain-5)</sup>. Sementara itu, dalam materi OpenAI disebutkan sistem eksperimental GPT-o3 yang dengan penskalaan komputasi yang cukup diklaim berhasil melampaui ambang batas **70%** pada Verified (data tidak resmi)<sup>[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-medium-sulbhajain-5)</sup>. Namun, verifikasi independen atas hasil-hasil ini tidak ada, dan indikator yang begitu tinggi tetap merupakan panduan untuk penelitian masa depan daripada patokan yang telah dicapai.

Menurut penelitian Microsoft Research (2025), bahkan model-model terbaru yang dilengkapi alat debugging masih belum melampaui **ambang batas 50%** keberhasilan perbaikan bug dari SWE-bench Lite<sup>[\[6\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-techcrunch-ms-debug-6)</sup>. Dalam pengujian ini, yang terbaik adalah Claude 3.7 Sonnet dengan **~48,4%** tugas yang diselesaikan, sementara sistem berbasis GPT-4 (OpenAI o1) menyelesaikan sekitar **30%**, dan model yang lebih ringan o3-mini hanya **22%**<sup>[\[6\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-techcrunch-ms-debug-6)</sup>. Hasil-hasil ini menekankan bahwa meskipun ada kemajuan pesat, AI modern masih kalah dari programmer berpengalaman: bagi manusia, menyelesaikan tugas-tugas semacam itu (dengan pemahaman kode yang memadai) tidaklah sulit, sementara model sering tidak mampu menggunakan alat debugging secara efektif atau mengalami kekurangan data pelatihan yang mencerminkan proses perbaikan bug multi-langkah<sup>[\[6\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-techcrunch-ms-debug-6)</sup>.

## Keterbatasan dan Prospek

SWE-bench telah menjadi platform terstandarisasi untuk mengevaluasi agen kode yang cerdas, namun penelitian juga mengungkapkan sejumlah keterbatasannya. Masalah utama adalah **ketidaklengkapan pengujian**: kumpulan pengujian verifikasi untuk setiap tugas diambil dari pull request tertentu dan biasanya hanya mencakup pengujian unit yang diubah saat memperbaiki bug<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-empirical-3)</sup>. Sebagaimana ditunjukkan oleh analisis kelompok ilmuwan dari Universitas Zhejiang dan Universitas Stuttgart (Wang et al. 2025), mengabaikan pengujian proyek lainnya dapat menyembunyikan ketidakbenaran beberapa solusi<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-empirical-3)</sup>. Pemeriksaan ulang solusi pada kumpulan pengujian penuh repositori mengungkapkan bahwa rata-rata **7,8%** patch yang ditandai berhasil dalam SWE-bench, sebenarnya **tidak lulus pengujian lain** dalam proyek<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-empirical-3)</sup>. Hal ini menyebabkan inflasi metrik "tugas diselesaikan" sekitar **4-6 poin persentase**<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-empirical-3)</sup>. Kasus yang lebih halus adalah ketika patch yang dihasilkan lulus semua pengujian asli, tetapi **tidak setara** dengan solusi pengembang dan mengubah perilaku program tidak seperti yang diharapkan. Dengan menggunakan generasi kasus uji tambahan (metodologi PatchDiff), para peneliti menemukan bahwa hampir **30%** perbaikan yang diusulkan AI berperilaku berbeda dari patch referensi, dan sekitar **11%** jelas-jelas salah, meskipun tidak terdeteksi oleh pengujian yang ada<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-empirical-3)</sup>. Dengan demikian, kemampuan model yang sebenarnya mungkin dilebih-lebihkan jika hanya mengandalkan kelulusan kumpulan pengujian terbatas. Para pembuat SWE-bench mengakui kerentanan ini dan menekankan bahwa benchmark harus berkembang seiring waktu: meningkatkan cakupan pengujian, menambahkan pemeriksaan ketiadaan efek samping yang tidak diinginkan, memperluas kumpulan jenis tugas<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Pengembangan sarana evaluasi semacam itu merupakan bagian penting dari persiapan menuju munculnya pengembang AI yang semakin otonom dan powerful, dan pengalaman dengan SWE-bench menunjukkan perlunya perhatian cermat terhadap kualitas benchmark<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>.

SWE-bench, meski hanya merupakan kumpulan tugas statis, tidak mencakup semua aspek pemrograman secara mutlak, namun sudah menjadi **standar de facto** untuk analisis komparatif model kode<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-empirical-3)</sup>. Benchmark ini digunakan dalam karya ilmiah untuk mendemonstrasikan metode dan algoritma baru, serta oleh kelompok penelitian industri untuk mengevaluasi potensi sistem yang dimaksudkan untuk mengotomatisasi pemrograman<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-arxiv-empirical-3)</sup>. Peningkatan hasil yang terus-menerus pada SWE-bench selama 2023-2025 secara jelas menunjukkan peningkatan pesat kemampuan LLM dalam menyelesaikan tugas-tugas pengembangan praktis. Sekaligus, benchmark ini berfungsi sebagai barometer kompleksitas: bahkan mendekati 50-60% tugas yang diselesaikan, model-model masih **jauh dari penggantian penuh manusia**, terutama dalam kondisi informasi terbatas dan kebutuhan pemahaman mendalam atas persyaratan<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-anthropic-claude-4)[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>. Meskipun demikian, kemajuan tidak berhenti — berkat inisiatif-inisiatif seperti SWE-bench, komunitas dengan jelas melihat tujuan dan keterbatasannya, dan terus bergerak menuju penciptaan pengembang AI seutuhnya yang mampu secara otonom memahami dan memperbaiki kode perangkat lunak pada tingkat ahli manusia<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-anthropic-claude-4)[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_note-openai-verified-7)</sup>.

## Referensi

- SWE-bench di GitHub
- Leaderboard resmi SWE-bench

## Daftar Pustaka

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Catatan

1.  <span id="cite_note-arxiv-original-1">↑ <sup>[1.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-original_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-original_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-original_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-original_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-original_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-original_1-5)</sup> Jimenez, Carlos E. et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». *arXiv*. <a href="https://arxiv.org/abs/2310.06770" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-github-swe-2">↑ <sup>[2.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-github-swe_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-github-swe_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-github-swe_2-2)</sup> «SWE-bench/SWE-bench». *GitHub*. <a href="https://github.com/SWE-bench/SWE-bench" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-empirical-3">↑ <sup>[3.00](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-empirical_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-empirical_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-empirical_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-empirical_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-empirical_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-empirical_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-empirical_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-empirical_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-empirical_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-empirical_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-arxiv-empirical_3-10)</sup> Wang, Shuyang et al. «Are "Solved Issues" in SWE-bench Really Solved Correctly? An Empirical Study». *arXiv*. <a href="https://arxiv.org/html/2503.15223v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-anthropic-claude-4">↑ <sup>[4.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-anthropic-claude_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-anthropic-claude_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-anthropic-claude_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-anthropic-claude_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-anthropic-claude_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-anthropic-claude_4-5)</sup> <sup>[4.6](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-anthropic-claude_4-6)</sup> <sup>[4.7](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-anthropic-claude_4-7)</sup> <sup>[4.8](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-anthropic-claude_4-8)</sup> «Claude SWE-Bench Performance». *Anthropic*. <a href="https://www.anthropic.com/engineering/swe-bench-sonnet" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-medium-sulbhajain-5">↑ <sup>[5.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-medium-sulbhajain_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-medium-sulbhajain_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-medium-sulbhajain_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-medium-sulbhajain_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-medium-sulbhajain_5-4)</sup> Jain, Sulbha. «SWE Benchmark: LLM evaluation in Software Engineering Setting». *Medium*. <a href="https://medium.com/@sulbha.jindal/swe-benchmark-llm-evaluation-in-software-engineering-setting-52f315b2de5a" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-techcrunch-ms-debug-6">↑ <sup>[6.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-techcrunch-ms-debug_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-techcrunch-ms-debug_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-techcrunch-ms-debug_6-2)</sup> <sup>[6.3](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-techcrunch-ms-debug_6-3)</sup> Hatmaker, Taylor. «AI models still struggle to debug software, Microsoft study shows». *TechCrunch*. <a href="https://techcrunch.com/2025/04/10/ai-models-still-struggle-to-debug-software-microsoft-study-shows/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai-verified-7">↑ <sup>[7.00](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-0)</sup> <sup>[7.01](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-1)</sup> <sup>[7.02](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-2)</sup> <sup>[7.03](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-3)</sup> <sup>[7.04](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-4)</sup> <sup>[7.05](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-5)</sup> <sup>[7.06](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-6)</sup> <sup>[7.07](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-7)</sup> <sup>[7.08](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-8)</sup> <sup>[7.09](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-9)</sup> <sup>[7.10](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-10)</sup> <sup>[7.11](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-11)</sup> <sup>[7.12](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-12)</sup> <sup>[7.13](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-13)</sup> <sup>[7.14](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-14)</sup> <sup>[7.15](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-15)</sup> <sup>[7.16](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-16)</sup> <sup>[7.17](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-17)</sup> <sup>[7.18](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-18)</sup> <sup>[7.19](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-19)</sup> <sup>[7.20](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-20)</sup> <sup>[7.21](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-21)</sup> <sup>[7.22](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-openai-verified_7-22)</sup> «Introducing SWE-bench Verified». *OpenAI*. <a href="https://openai.com/index/introducing-swe-bench-verified/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-swebench-leaderboard-8">↑ <sup>[8.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-swebench-leaderboard_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-swebench-leaderboard_8-1)</sup> <sup>[8.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-swebench-leaderboard_8-2)</sup> «SWE-bench Leaderboard». <a href="https://www.swebench.com/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-ycombinator-sota-9">[↑](https://systems-analysis.info/int/SWE-bench_(benchmark)_(ID)#cite_ref-ycombinator-sota_9-0) «SOTA on swebench-verified: relearning the bitter lesson». *Hacker News (Y Combinator)*. <a href="https://news.ycombinator.com/item?id=42638605" class="external autonumber" rel="nofollow">[9]</a></span>
