SREGym Leaderboard

Comparing SRE agents across diagnosis, mitigation, and end-to-end incident resolution on SREGym. Ranked by E2E success rate, requiring both correct root-cause diagnosis and successful mitigation on the same run.

Benchmark
SREGym-Lite-1004 · 17 faultsView cohort
1
Codex
OpenAI
GPT-6 Astra (max)
96.1100.096.1173.1287.6719K
2
Codex
OpenAI
GPT-6 Astra (medium)
100.090.290.292.0138.4377K
3
Codex
OpenAI
GPT-6.1 Sol (max)
98.090.290.2217.4371.6807K
4
Codex
OpenAI
GPT-6.1 Sol (medium)
98.090.290.2103.8156.6462K
5
Codex
OpenAI
GPT-5.6 Sol (max)
94.182.476.5225.1409.71.54M
6
CloudThinker*
Claude
Claude Opus 5
94.180.476.5517.8759.11.56M
7
Claude Code
Claude
Claude Opus 5
90.278.470.6241.8466.21.86M
8
Codex
OpenAI
GPT-5.6 Terra (max)
82.474.562.7233.1444.91.88M
9
Codex
OpenAI
GPT-5.6 Luna (max)
84.374.560.8306.0517.72.97M
10
Codex
OpenAI
GPT-5.6 Sol (medium)
72.564.749.0117.6295.0868K
11
Claude Code
Claude
Claude Sonnet 5
54.962.745.1308.6505.23.37M
12
Claude Code
Claude
Claude Opus 4.8
58.854.941.2360.2553.71.85M

* Third-party submissions. Results verified by the SREGym team.

Diag. Diagnosis success rate · Mit. Mitigation success rate · E2E End-to-end (both diagnosis and mitigation correct) · TTD Time-to-diagnose (seconds) · TTM Time-to-mitigate (seconds) · Tokens Mean token usage per run