courses
| Category | Benchmark | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Sol Ultra | GPT-5.6 Terra | GPT-5.6 Luna | GPT-5.5 | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite | Gemini 3.5 Flash | Gemini 3.1 Pro Preview |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Knowledge Work | GDPval-AA v2 (Elo) | 1861 | 1736 | — | 1593 | 1591.8 | 1493.7 | 1421 | — | 1348.8 | 962.3 |
| Coding | SWE-Bench Pro | 79.2% | 64.6% | — | 63.4% | 62.7% | 59.4% | — | 54.2% | — | 54.2% |
| Coding | DeepSWE v1.1 | 68.8% | 72.7% | — | 69.6% | 67.2% | 67% | 49% | — | 37% (baseline) | 11.8% |
| Coding | Terminal-Bench 2.1 | — | 88.8% | 91.9% | 87.4% | 84.7% | 85.6% | — | 54% (vs 3.1 Flash-Lite baseline 31%) | — | 70.7% |
| Coding | Frontier-Bench v0.1 (terminal coding) | 43.3% | 37.5% | — | — | — | — | — | — | — | — |
| Computer Use | BrowseComp | 90.8% | 90.4% | 92.2% | 87.5% | 83.3% | 84.4% | — | — | — | 85.9% |
| Computer Use | OSWorld 2.0* | 70.6% | 62.6% | — | 50.2% | 45.6% | 47.5% | — | — | — | — |
| Abstract Reasoning | ARC-AGI-3 | 30.2% | 7.78% | — | 0.8% | 0.18% | 0.43% | — | — | — | 0.42% |
| Tool Use | AutomationBench | 26.0% | 18.1% | — | 15.2% | 14.9% | 12.9% | — | — | 14.5% |
— |

