SREGym Leaderboard

Comparing SRE agents across diagnosis, mitigation, and end-to-end incident resolution on SREGym. Ranked by E2E success rate, requiring both correct root-cause diagnosis and successful mitigation on the same run.

Variant
Environment
SREGym-0508 · 90 faultsView cohort
Noise
1
GitHub Copilot
OpenAI
GPT-5.6 Sol (max)
No83.383.772.2243.0645.42.45M
2
GitHub Copilot
Claude
Claude Sonnet 5 (medium)
No85.277.870.7241.6419.54.01M
3
GitHub Copilot
OpenAI
GPT-5.5 (max)
No81.976.770.0190.1541.01.55M
4
GitHub Copilot
OpenAI
GPT-5.6 Terra (max)
No82.680.470.0214.5610.83.09M
5
GitHub Copilot
Claude
Claude Opus 4.8 (medium)
No81.175.669.3328.5551.72.82M
6
Claude Code
Claude
Claude Sonnet 4.6
No72.675.660.7292.5702.01.47M
7
Stratus
Claude
Claude Sonnet 4.6
No61.578.554.8114.0771.1812K
8
Claude Code
Claude
Claude Sonnet 4.6
Yes62.676.353.7314.0736.51.71M
9
Codex
OpenAI
GPT-5.4
No70.063.753.3176.4376.01.98M
10
Codex
OpenAI
GPT-5.4
Yes59.361.945.9218.1397.71.88M
11
Stratus
Claude
Claude Sonnet 4.6
Yes51.561.139.6170.5885.0464K
12
Stratus
Kimi
Kimi K2.5
No40.440.427.4674.51348.8413K
13
Stratus
Kimi
Kimi K2.5
Yes38.141.926.7656.41283.2443K

Diag. Diagnosis success rate · Mit. Mitigation success rate · E2E End-to-end (both diagnosis and mitigation correct) · TTD Time-to-diagnose (seconds) · TTM Time-to-mitigate (seconds) · Tokens Mean token usage per run