---
title: "SWE-bench (benchmark) — SWEベンチ"
source: "https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81"
wiki: "systems-analysis.info/int"
article: "SWE-bench_(benchmark)_—_SWEベンチ"
language: "ja"
categories:
  - "Category:Japanese"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 6539
wiki_created_at: 2026-09-07T00:06:15Z
wiki_modified_at: 2026-09-07T00:06:15Z
downloaded_at: 2026-09-07T23:14:26Z
---

# SWE-bench (benchmark) — SWEベンチ

**SWE-bench**は、**自動ソフトウェア開発**および**デバッグ**の分野における**大規模言語モデル**（**LLM**）の能力を評価するための、大規模な**ベンチマーク**（テストタスクのセット）です<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-original-1)</sup>。プリンストン大学などの研究者グループによって開発され、ICLR 2024カンファレンスで発表されました<sup>[\[2\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-github-swe-2)</sup>。SWE-benchは、従来のコードベンチマークとは異なり、開発現場の**実際のタスク**を使用している点が特徴です。テストセットには、GitHub上の12の著名なオープンソースPythonリポジトリから、クローズされたissue（課題）とそれに対応するpull request（修正）に基づいた**2294件のタスク**が含まれています<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-original-1)[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-empirical-3)</sup>。各タスクには問題（issue）の記述が含まれ、モデルは関連プロジェクトのソースコードにアクセスできます。モデルの目標は、指定された問題を修正するために、コードベースに最小限の変更（**パッチ**）を生成することです<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-original-1)[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-empirical-3)</sup>。

## 評価の方法と特徴

SWE-benchは、実際のソフトウェア開発プロセスをモデル化しています。各タスクにおいて、モデルには元のGitHub issueのテキスト（問題の記述）と、修正が適用される前のバージョンのリポジトリコードのスナップショットが提示されます<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-anthropic-claude-4)</sup>。モデル（またはモデルベースのエージェント）は、ソースコードを分析し、エラーの性質や要求される変更を理解し、問題を解消するために適切なファイルに修正を加える必要があります<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-anthropic-claude-4)[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-medium-sulbhajain-5)</sup>。**解決策の検証**は自動化されており、各タスクには、その問題をクローズしたpull requestからの実際の単体テストが関連付けられています。これらには、**「fail-to-pass」テスト**（元のコードでは失敗するが、正しい修正を適用すると成功するべきテスト）と、**回帰テスト**（「pass-to-pass」テスト、元々成功しており、変更後も成功し続けるべきテスト）の両方が含まれます<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-empirical-3)</sup>。モデルが提案したパッチをコードに適用した後、関連するテストが実行されます。すべてのfail-to-passテストが成功し、かつpass-to-passテストが失敗しなければ、タスクは正しく解決されたと見なされます<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-empirical-3)</sup>。この評価アプローチにより、モデルが構文的に正しいコードを生成する能力だけでなく、既存の機能を損なうことなく、提示されたタスクを実際に解決する能力も検証できます。その際、モデルは大規模なコンテキスト（リポジトリ全体）を扱い、コンポーネント間の相互関係を理解し、複数のファイルにまたがる変更を調整する必要があります<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-original-1)</sup>。これらはすべて、説明に基づいて関数を作成するような典型的なタスクよりもはるかに複雑です。

SWE-benchの評価には、LLM単体ではなく、モデルを補助的なツール（ファイルナビゲーション、コード実行、デバッガの使用など）でラップした**エージェントシステム**が参加するのが一般的です<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-anthropic-claude-4)[\[6\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-techcrunch-ms-debug-6)</sup>。このようなシステムは、実際の開発サイクルを模倣します。モデルはファイルを順番に確認し、テストやスクリプトを実行し、成功するまで段階的に解決策を改善できます<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-anthropic-claude-4)</sup>。SWE-benchのタスク解決の効率は、この**「スキャフォールディング」**（エージェントのインフラ）の質に大きく依存することが示されています。同じ基本モデルでも、リポジトリやツールとの連携方法によって異なる結果を示すことがあります<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-anthropic-claude-4)[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。したがって、SWE-benchは、モデルとそのタスク解決戦略を組み合わせた能力の指標として機能し、**自律型AI開発者**の実際の作業条件に近い評価を実現します<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-anthropic-claude-4)[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。

## タスクセットのバリエーション

SWE-benchの作成者とコミュニティは、その後、さまざまな評価目的のためにいくつかの派生セットを導入しました。

- **SWE-bench Lite** — ベンチマークの軽量版で、モデルのテストにかかる複雑さと計算コストを削減するために選ばれた**約300件のタスク**が含まれます<sup>[\[8\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-swebench-leaderboard-8)</sup>。このサブセットは、モデルの迅速な実験のために作成され、最も手間のかかる検証を排除しつつ、主要な問題の代表性を維持しています<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。基本的に、Liteにはより単純で短いバグ修正タスクが含まれており、最も困難なケースが除外されているため、Liteでのモデルの成績は通常、完全なセットよりも高くなります<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。
- **SWE-bench Verified** — 2024年8月にOpenAIと共同で発表された、**手動検証**によってフィルタリングされたサブセットです<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。研究者たちは**93人のプロの開発者**を動員して、元のベンチマークの各タスクを分析し、問題の記述が曖昧すぎる場合や、テストで要求される挙動がタスクの条件から明確に導き出せないケースを除外しました<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。また、環境の問題や不正確なテストのために実際には解決不可能なタスクも削除されました<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。その結果、解決可能で正しく定式化されていることが保証された**500件のタスク**からなるセットが形成されました<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。SWE-bench Verifiedは、不適切なテストやタスクのせいで正しい解決策が拒否されるケースを排除することで、モデルの能力をより信頼性の高い形で評価することを目的としています<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。このセットは、モデル比較の主要な基準として、元のSWE-benchテストセット（完全版とLite版）に取って代わりました<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。さらに、Verifiedと同時に、タスクの難易度評価（例：人間が15分未満で解決できる「簡単な」タスクと、1時間以上かかる「難しい」タスクの区別）<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>や、より安定した再現可能なテスト実行のための新しいDockerベースのツールフレームワークも公開されました<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。
- **SWE-bench Multimodal** — 2025年1月に導入されたベンチマークの拡張版で、問題の記述にテキストだけでなく、**視覚的要素**（インターフェースの画像、エラーのスクリーンショットなど）を含むタスクが含まれています<sup>[\[8\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-swebench-leaderboard-8)</sup>。このセット（**517件のタスク**<sup>[\[8\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-swebench-leaderboard-8)</sup>）は、プログラミングタスクを解決する際に、視覚情報を理解し利用するモデルやエージェントの能力を検証します。**マルチモーダルなセット**での評価も同様に行われますが、モデルにはマルチモーダル能力（例：画像からのテキスト認識）が要求されます。SWE-bench Multimodalのテスト部分は、既知の解答への過剰適合を防ぐために非公開（隠蔽）にされており、開発者は自分のモデルを評価するために、リモートの**リーダーボード**に解決策を提出することができます<sup>[\[2\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-github-swe-2)</sup>。

これらの主要なバリエーションに加えて、SWE-benchの周りにはツールのエコシステムが形成されています。**SWE-agent**は、ベンチマークのタスクで最先端の結果を示すオープンソースのソフトウェア「エージェント」ソルバーです<sup>[\[2\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-github-swe-2)</sup>。**SWE-smith**は、独自の開発者モデルをトレーニングするためのフレームワークです。**SWE-REX**は、リポジトリから情報を拡張的に抽出し処理するためのツールです。これらのプロジェクトは、結果の再現を容易にし、自律的なプログラミングシステムの分野における研究を推進することを目的としています。

## モデルの成績と進歩

SWE-benchが最初に登場したとき、現代のLLMと熟練プログラマーのスキルとの間に大きな隔たりがあることが明らかになりました。作成者らによると、2023年初頭の最も強力なモデルでさえ、タスクの**数パーセント**しか解決できませんでした。例えば、Anthropic社のClaude 2モデルは、完全なセットの**2%未満**しか正しく解決できませんでした<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-original-1)</sup>。ベンチマーク作成者によって特別に訓練されたモデル（LLaMAベースで**SWE-Llama**と名付けられた）や、GPT-4のようなプロプライエタリなモデルは、主に最も単純なエラーしか解決できませんでした<sup>[\[1\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-original-1)</sup>。これらの低い初期のメトリクスは、SWE-benchの難しさを示し、新しいアプローチの開発を促すきっかけとなりました。

2024年を通じて、より高度なモデルやエージェントの仕組みが登場するにつれて、結果は大幅に改善されました。プリンストン大学の研究者たちは、GPT-4をコード検索、計画立案などのツールと組み合わせたSWE-agentシステムを発表し、完全なセットで約**12.5%**のタスクを解決し、学術モデルの新たな基準を打ち立てました<sup>[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-medium-sulbhajain-5)</sup>。2024年半ばまでに、SWE-benchの公式リーダーボードでは、最良のソリューション（プロプライエタリなものを含む）が、完全なベンチマークで約**20%**、簡略化されたLiteセットでは最大**43%**の成功率に達しました<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。この成長は、モデルの改善（例：GPT-4、Claude 2、Claude 3の登場）と、特に「スキャフォールディング」の発展に関連しています。これは、モデルがタスクをステップに分解し、ドキュメントを読み、デバッグセッションを実行するなどを効率的に行うための外部戦略です<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。

2024年末にVerifiedセット（不正確なタスクが除去されたもの）が導入された後、測定されるパフォーマンスはさらに向上しました。GPT-4モデル（GPT-4oバリアント）は、Verifiedセットで即座に約**33%**の成功率を示し、これは元のセットでの**約16%**から大幅な向上でした<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。最良のオープンなエージェントフレームワーク（例：Agentless）も、Verifiedセットで結果が**約16%**から**32%**へと倍増しました<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。これは、元のベンチマークが解決不可能なケースを含んでいたために**スコアを過小評価していた**という仮説を裏付けました<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。一方で、Liteと比較したVerifiedでの結果の改善はそれほど劇的ではありませんでした（最良のモデルはすでにLiteで約43%に達していた）。これは、Liteが元々より簡単な例を選び、Verifiedは実行不可能なタスクを除去したものの、難しいタスクは残したため、論理的な結果です<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。Verifiedへの移行によるスコアの向上は、最も困難なタスクを排除したことによるだけでなく、**すべての難易度カテゴリのタスク**で発生した点が重要です。つまり、フィルタリングによって、比較的簡単なタスクの中に隠れていた実行不可能なケースも取り除かれたのです<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。

2025年初頭の時点で、主要なAIシステムは検証済みタスクセットにおいて人間に近い効率を示していますが、100%の達成にはまだほど遠い状況です。2025年1月、Anthropic社は、新しいモデルClaude 3.5 Sonnetが改良されたエージェントと組み合わせて、SWE-bench Verifiedのタスクの**49%**を解決したと報告し、一時的にトップに立ちました<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-anthropic-claude-4)</sup>。大手テクノロジー企業や独立したチームも、このベンチマークでの非公式な競争に積極的に参加しています。例えば、CodeStoryチームは、複数のモデルでバリアントを試すアプローチ（「Midwit Agent」）を開発し、Verifiedで記録的な**62.2%**のタスク解決率を達成しました（2025年初頭のデータ）<sup>[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-medium-sulbhajain-5)[\[9\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-ycombinator-sota-9)</sup>。これを達成するためには、モデルの推論段階での計算リソースを大幅に増やす（いわゆるinference time scaling）必要があり、多数の解決試行を実行して最良の結果を選択したと指摘されています<sup>[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-medium-sulbhajain-5)</sup>。一方、OpenAIの資料では、実験的なシステムGPT-03が十分な計算スケールでVerifiedの**70%**の壁を突破したとされる言及がありました（非公式データ）<sup>[\[5\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-medium-sulbhajain-5)</sup>。しかし、これらの結果の独立した検証はなく、このような高いスコアは達成された基準というよりは、将来の研究の目標となっています。

Microsoft Researchの研究（2025年）によると、最新のモデルでさえ、デバッグツールを備えていても、SWE-bench Liteのバグ修正成功率は**50%の壁**をまだ越えていません<sup>[\[6\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-techcrunch-ms-debug-6)</sup>。このテストでは、Claude 3.7 Sonnetが最も優れており、タスクの**約48.4%**を解決しましたが、GPT-4（OpenAI 01）ベースのシステムは約**30%**、より軽量な03-miniモデルはわずか**22%**でした<sup>[\[6\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-techcrunch-ms-debug-6)</sup>。これらの結果は、急速な進歩にもかかわらず、現代のAIはまだ熟練したプログラマーに劣ることを強調しています。人間にとっては（コードを理解していれば）このようなタスクの解決は難しくありませんが、モデルはデバッグツールを効果的に使用できなかったり、多段階のバグ修正プロセスを反映した訓練データが不足していることに苦しむことが多いのです<sup>[\[6\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-techcrunch-ms-debug-6)</sup>。

## 限界と展望

SWE-benchは、インテリジェントなコードエージェントを評価するための標準化されたプラットフォームとなりましたが、研究によっていくつかの限界も明らかになっています。主な問題は**テストの不完全性**です。各タスクの検証テストセットは特定のpull requestから取得されており、通常はバグ修正時に変更されたユニットテストのみが含まれます<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-empirical-3)</sup>。浙江大学とシュトゥットガルト大学の研究者グループ（Wang et al. 2025）による分析が示すように、プロジェクトの他のテストを無視すると、一部の解決策の不正確さが隠されてしまう可能性があります<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-empirical-3)</sup>。リポジトリの完全なテストスイートで解決策を再検証したところ、SWE-benchで成功とマークされたパッチの平均**7.8%**が、実際にはプロジェクト内の**他のテストに失敗する**ことが明らかになりました<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-empirical-3)</sup>。これにより、「解決済みタスク」のメトリクスが約**4～6パーセントポイント**過大評価されることになります<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-empirical-3)</sup>。さらに微妙なケースとして、生成されたパッチがすべての元のテストに合格するものの、開発者の解決策とは**等価ではなく**、プログラムの挙動を予期しない形で変更してしまう場合があります。追加のテストケースを生成する手法（PatchDiff）を用いて、研究者たちは、AIが提案した修正の約**30%**が参照パッチとは異なる挙動を示し、約**11%**は既存のテストでは検出されないものの、明らかに誤っていることを発見しました<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-empirical-3)</sup>。したがって、限られたテストセットの合格のみに依存すると、モデルの真の能力が過大評価される可能性があります。SWE-benchの作成者もこの脆弱性を認識しており、ベンチマークは時間とともに進化すべきであると強調しています。テストカバレッジを改善し、望ましくない副作用がないかどうかのチェックを追加し、タスクの種類を拡大する必要があります<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。このような評価手段の開発は、ますます自律的で強力なAI開発者の登場に備える上で重要な部分であり、SWE-benchの経験は、ベンチマークの品質に注意を払う必要性を示しています<sup>[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。

SWE-benchは、静的なタスクセットに過ぎず、プログラミングのあらゆる側面を網羅しているわけではありませんが、既にコードモデルの比較分析における**デファクトスタンダード**となっています<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-empirical-3)</sup>。科学論文で新しい手法やアルゴリズムを実証するために使用されるほか、産業界の研究グループがプログラミングを自動化するシステムの可能性を評価するためにも利用されています<sup>[\[3\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-arxiv-empirical-3)</sup>。2023年から2025年にかけてのSWE-benchでの成績の継続的な向上は、実践的な開発タスクを解決するLLMの能力が急速に向上していることを明確に示しています。同時に、それは難易度のバロメーターとしても機能します。解決済みタスクが50～60%に近づいても、モデルはまだ**人間を完全に代替するにはほど遠く**、特に情報が限られ、要件の微妙な理解が必要な状況ではなおさらです<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-anthropic-claude-4)[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。しかし、進歩は止まりません。SWE-benchのような取り組みのおかげで、コミュニティは自らの目標と限界を明確に認識し、人間の専門家レベルでソフトウェアコードを自律的に理解し修正できる本格的なAI開発者の創造に向けて前進し続けています<sup>[\[4\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-anthropic-claude-4)[\[7\]](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_note-openai-verified-7)</sup>。

## 外部リンク

- <a href="https://github.com/SWE-bench/SWE-bench" class="external text" rel="nofollow">GitHub上のSWE-bench</a>
- <a href="https://www.swebench.com/" class="external text" rel="nofollow">SWE-bench公式リーダーボード</a>

## 参考文献

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## 脚注

1.  <span id="cite_note-arxiv-original-1">↑ <sup>[1.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-original_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-original_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-original_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-original_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-original_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-original_1-5)</sup> Jimenez, Carlos E. et al. 「SWE-bench: Can Language Models Resolve Real-World GitHub Issues?」 *arXiv*. <a href="https://arxiv.org/abs/2310.06770" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-github-swe-2">↑ <sup>[2.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-github-swe_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-github-swe_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-github-swe_2-2)</sup> 「SWE-bench/SWE-bench」 *GitHub*. <a href="https://github.com/SWE-bench/SWE-bench" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-empirical-3">↑ <sup>[3.00](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-empirical_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-empirical_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-empirical_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-empirical_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-empirical_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-empirical_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-empirical_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-empirical_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-empirical_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-empirical_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-arxiv-empirical_3-10)</sup> Wang, Shuyang et al. 「Are "Solved Issues" in SWE-bench Really Solved Correctly? An Empirical Study」 *arXiv*. <a href="https://arxiv.org/html/2503.15223v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-anthropic-claude-4">↑ <sup>[4.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-anthropic-claude_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-anthropic-claude_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-anthropic-claude_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-anthropic-claude_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-anthropic-claude_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-anthropic-claude_4-5)</sup> <sup>[4.6](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-anthropic-claude_4-6)</sup> <sup>[4.7](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-anthropic-claude_4-7)</sup> <sup>[4.8](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-anthropic-claude_4-8)</sup> 「Claude SWE-Bench Performance」 *Anthropic*. <a href="https://www.anthropic.com/engineering/swe-bench-sonnet" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-medium-sulbhajain-5">↑ <sup>[5.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-medium-sulbhajain_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-medium-sulbhajain_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-medium-sulbhajain_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-medium-sulbhajain_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-medium-sulbhajain_5-4)</sup> Jain, Sulbha. 「SWE Benchmark: LLM evaluation in Software Engineering Setting」 *Medium*. <a href="https://medium.com/@sulbha.jindal/swe-benchmark-llm-evaluation-in-software-engineering-setting-52f315b2de5a" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-techcrunch-ms-debug-6">↑ <sup>[6.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-techcrunch-ms-debug_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-techcrunch-ms-debug_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-techcrunch-ms-debug_6-2)</sup> <sup>[6.3](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-techcrunch-ms-debug_6-3)</sup> Hatmaker, Taylor. 「AI models still struggle to debug software, Microsoft study shows」 *TechCrunch*. <a href="https://techcrunch.com/2025/04/10/ai-models-still-struggle-to-debug-software-microsoft-study-shows/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai-verified-7">↑ <sup>[7.00](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-0)</sup> <sup>[7.01](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-1)</sup> <sup>[7.02](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-2)</sup> <sup>[7.03](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-3)</sup> <sup>[7.04](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-4)</sup> <sup>[7.05](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-5)</sup> <sup>[7.06](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-6)</sup> <sup>[7.07](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-7)</sup> <sup>[7.08](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-8)</sup> <sup>[7.09](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-9)</sup> <sup>[7.10](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-10)</sup> <sup>[7.11](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-11)</sup> <sup>[7.12](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-12)</sup> <sup>[7.13](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-13)</sup> <sup>[7.14](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-14)</sup> <sup>[7.15](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-15)</sup> <sup>[7.16](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-16)</sup> <sup>[7.17](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-17)</sup> <sup>[7.18](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-18)</sup> <sup>[7.19](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-19)</sup> <sup>[7.20](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-20)</sup> <sup>[7.21](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-21)</sup> <sup>[7.22](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-openai-verified_7-22)</sup> 「Introducing SWE-bench Verified」 *OpenAI*. <a href="https://openai.com/index/introducing-swe-bench-verified/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-swebench-leaderboard-8">↑ <sup>[8.0](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-swebench-leaderboard_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-swebench-leaderboard_8-1)</sup> <sup>[8.2](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-swebench-leaderboard_8-2)</sup> 「SWE-bench Leaderboard」 <a href="https://www.swebench.com/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-ycombinator-sota-9">[↑](https://systems-analysis.info/int/SWE-bench_(benchmark)_%E2%80%94_SWE%E3%83%99%E3%83%B3%E3%83%81#cite_ref-ycombinator-sota_9-0) 「SOTA on swebench-verified: relearning the bitter lesson」 *Hacker News (Y Combinator)*. <a href="https://news.ycombinator.com/item?id=42638605" class="external autonumber" rel="nofollow">[9]</a></span>
