RuntimeWire Combined Benchmark
9 models · 3 suites · frozen combined leaderboard
| Rank | Model | Combined score (0-100) | Suite coverage |
|---|---|---|---|
| 1 | OpenAI: GPT-6.1 Sol Pro | 97.6 | 3/3 |
| 2 | OpenAI: GPT-6 Astra | 96.8 | 3/3 |
| 3 | Anthropic: Claude Opus 5.5 | 93.5 | 3/3 |
| 4 | Anthropic: Claude Sonnet 5.5 | 93.2 | 3/3 |
| 5 | xAI: Grok Latest | 88.3 | 3/3 |
| 6 | Qwen: Qwen3.8 Max Prime | 82.6 | 3/3 |
| 7 | Z.ai: GLM 5.3 Prime | 81.4 | 3/3 |
| 8 | Google: Gemini 3.8 Flash | 76.0 | 3/3 |
| 9 | StepFun: Step 3.7 Flash | 61.2 | 3/3 |
Benchmark suites
- NEWSAGENT (50-task sample)
- Vectara Grounded Summarization (100-task public v1 sample)
- Mazur Constrained Story Writing (50-task sample)
Combined scores are the equal-weight mean of each model’s suite scores.
See every leaderboard on the Benchmarks index.