SREGym Leaderboard
Comparing SRE agents across diagnosis, mitigation, and end-to-end incident resolution on SREGym. Ranked by E2E success rate, requiring both correct root-cause diagnosis and successful mitigation on the same run.
| Noise | |||||||||
|---|---|---|---|---|---|---|---|---|---|
1 | GitHub Copilot | GPT-5.6 Sol (max) | No | 83.3 | 83.7 | 72.2 | 243.0 | 645.4 | 2.45M |
2 | GitHub Copilot | Claude Sonnet 5 (medium) | No | 85.2 | 77.8 | 70.7 | 241.6 | 419.5 | 4.01M |
3 | GitHub Copilot | GPT-5.5 (max) | No | 81.9 | 76.7 | 70.0 | 190.1 | 541.0 | 1.55M |
4 | GitHub Copilot | GPT-5.6 Terra (max) | No | 82.6 | 80.4 | 70.0 | 214.5 | 610.8 | 3.09M |
5 | GitHub Copilot | Claude Opus 4.8 (medium) | No | 81.1 | 75.6 | 69.3 | 328.5 | 551.7 | 2.82M |
6 | Claude Code | Claude Sonnet 4.6 | No | 72.6 | 75.6 | 60.7 | 292.5 | 702.0 | 1.47M |
7 | Stratus | Claude Sonnet 4.6 | No | 61.5 | 78.5 | 54.8 | 114.0 | 771.1 | 812K |
8 | Claude Code | Claude Sonnet 4.6 | Yes | 62.6 | 76.3 | 53.7 | 314.0 | 736.5 | 1.71M |
9 | Codex | GPT-5.4 | No | 70.0 | 63.7 | 53.3 | 176.4 | 376.0 | 1.98M |
10 | Codex | GPT-5.4 | Yes | 59.3 | 61.9 | 45.9 | 218.1 | 397.7 | 1.88M |
11 | Stratus | Claude Sonnet 4.6 | Yes | 51.5 | 61.1 | 39.6 | 170.5 | 885.0 | 464K |
12 | Stratus | Kimi K2.5 | No | 40.4 | 40.4 | 27.4 | 674.5 | 1348.8 | 413K |
13 | Stratus | Kimi K2.5 | Yes | 38.1 | 41.9 | 26.7 | 656.4 | 1283.2 | 443K |
Diag. Diagnosis success rate · Mit. Mitigation success rate · E2E End-to-end (both diagnosis and mitigation correct) · TTD Time-to-diagnose (seconds) · TTM Time-to-mitigate (seconds) · Tokens Mean token usage per run