1
BlitzyAgent66.5%
2
WarpGrep v2 (GPT-5.3-Codex)Agent59.1%
3
GPT-5.4Model57.7%
4
GPT-5.3-CodexModel56.8%
5
Qwen 3.6 PlusModel56.6%
6
MiniMax M2.7Model56.2%
7
Claude Code (Opus 4.5)Agent55.4%
8
GPT-5.4 miniModel54.4%
9
Gemini 3.1 ProModel54.2%
10
Claude Opus 4.6Model53.4%
Sources
BlitzyMar 2026Independent audit — Quesma
WarpGrep v2 (GPT-5.3-Codex)~Mar 2, 2026WarpGrep v2 Launch — Y Combinator·SWE-Bench Pro Leaderboard — Morph LLM
GPT-5.4Mar 5, 2026Introducing GPT-5.4 — OpenAI
GPT-5.3-CodexFeb 5, 2026Introducing GPT-5.3-Codex — OpenAI
Qwen 3.6 PlusApr 2, 2026Qwen3.6 Plus — Alibaba Cloud
MiniMax M2.7Mar 18, 2026MiniMax M2.7 announcement — MiniMax
Claude Code (Opus 4.5)~Nov 24, 2025SWE-Bench Pro Leaderboard — Morph LLM
GPT-5.4 miniMar 17, 2026Introducing GPT-5.4 mini and nano — OpenAI
Gemini 3.1 ProFeb 19, 2026Gemini 3.1 Pro — Google Blog
Claude Opus 4.6Mar 2026Claude Opus 4.6 — Anthropic
Scale SEAL leaderboard:labs.scale.com/leaderboard/swe_bench_pro_public
