| 1 | GPT-6 AstraOpenAI | 90.1 | 87.5 | 99.4 | 83.3 | 4 cited tests- Terminal-Bench Science 0.1 (4 peers)64.6% · 87.5 pts ↗
- GPQA Diamond (111 peers)96% · 99.5 pts ↗
- FrontierMath Tiers 1-3 v2 (Epoch AI run) (59 peers)93.7% · 99.2 pts ↗
- AutomationBench 1.0.6 (3 peers)41.4% · 83.3 pts ↗
|
| 2 | Claude Opus 4.8Anthropic | 88.6 | 98.4 | 85.2 | 82.1 | 8 cited tests- SWE-bench Verified (48 peers)88.6% · 99 pts ↗
- SWE-bench Pro (22 peers)69.2% · 97.7 pts ↗
- GPQA Diamond (111 peers)93.6% · 90.5 pts ↗
- Humanity's Last Exam (no tools) (29 peers)49.8% · 91.4 pts ↗
- Humanity's Last Exam (with tools) (14 peers)57.9% · 75 pts ↗
- FrontierMath Tiers 1-3 v2 (Epoch AI run) (59 peers)80% · 83.9 pts ↗
- BrowseComp (15 peers)84.3% · 76.7 pts ↗
- OSWorld-Verified (12 peers)83.4% · 87.5 pts ↗
|
| 3 | Kimi K3Moonshot AI | 77.1 | 59.4 | 76.2 | 95.8 | 6 cited tests- DeepSWE v1.1 (16 peers)67.3% · 59.4 pts ↗
- GPQA Diamond (111 peers)93.5% · 89.6 pts ↗
- Humanity's Last Exam (no tools) (29 peers)43.5% · 84.5 pts ↗
- Humanity's Last Exam (with tools) (14 peers)56% · 53.6 pts ↗
- FrontierMath Tiers 1-3 v2 (Epoch AI run) (59 peers)72.2% · 77.1 pts ↗
- OSWorld-Verified (12 peers)84.8% · 95.8 pts ↗
|
| 4 | Claude Opus 4.7Anthropic | 75.5 | 90.5 | 75.5 | 60.4 | 8 cited tests- SWE-bench Verified (48 peers)87.6% · 96.9 pts ↗
- SWE-bench Pro (22 peers)64.3% · 84.1 pts ↗
- GPQA Diamond (111 peers)94.2% · 94.1 pts ↗
- Humanity's Last Exam (no tools) (29 peers)46.9% · 87.9 pts ↗
- Humanity's Last Exam (with tools) (14 peers)54.7% · 46.4 pts ↗
- FrontierMath Tiers 1-3 v2 (Epoch AI run) (59 peers)70.2% · 73.7 pts ↗
- BrowseComp (15 peers)79.8% · 50 pts ↗
- OSWorld-Verified (12 peers)82.8% · 70.8 pts ↗
|
| 5 | Claude Opus 4.6Anthropic | 73.8 | 92.7 | 72 | 56.7 | 6 cited tests- SWE-bench Verified (48 peers)80.8% · 92.7 pts ↗
- GPQA Diamond (111 peers)91.3% · 77.9 pts ↗
- FrontierMath Tiers 1-3 v2 (Epoch AI run) (59 peers)66% · 66.1 pts ↗
- MCP Atlas (9 peers)59.5% · 38.9 pts ↗
- Tau2-bench Telecom (8 peers)99.3% · 93.8 pts ↗
- OSWorld-Verified (12 peers)72.7% · 37.5 pts ↗
|
| 6 | Claude Opus 5.5Anthropic | 73.1 | 72.9 | 96.4 | 50 | 4 cited tests- Terminal-Bench Science 0.1 (4 peers)58.7% · 62.5 pts ↗
- Terminal-Bench 4.0 (3 peers)66.4% · 83.3 pts ↗
- Humanity's Last Exam (with tools) (14 peers)67.7% · 96.4 pts ↗
- AutomationBench 1.0.6 (3 peers)40% · 50 pts ↗
|
| 7 | GPT-5.5OpenAI | 69.2 | 52.3 | 80.8 | 74.4 | 8 cited tests- SWE-bench Pro (22 peers)58.6% · 52.3 pts ↗
- GPQA Diamond (111 peers)90.7% · 72.5 pts ↗
- FrontierMath Tiers 1-3 v2 (Epoch AI run) (59 peers)85.3% · 89 pts ↗
- BrowseComp (15 peers)84.4% · 83.3 pts ↗
- MCP Atlas (9 peers)75.3% · 72.2 pts ↗
- Tau2-bench Telecom (8 peers)98% · 62.5 pts ↗
- Toolathlon (6 peers)55.6% · 91.7 pts ↗
- OSWorld-Verified (12 peers)78.7% · 62.5 pts ↗
|
| 8 | Hy3Tencent Hunyuan | 66.8 | 66.6 | 68.8 | 65 | 7 cited tests- SWE-bench Verified (48 peers)78% · 85.4 pts ↗
- SWE-bench Pro (22 peers)57.9% · 47.7 pts ↗
- GPQA Diamond (111 peers)90.4% · 70.3 pts ↗
- Humanity's Last Exam (no tools) (29 peers)37% · 67.2 pts ↗
- BrowseComp (15 peers)84.2% · 70 pts ↗
- MCP Atlas (9 peers)79.1% · 83.3 pts ↗
- Toolathlon (6 peers)48.5% · 41.7 pts ↗
|
| 9 | Step 3.5 FlashStepFun | 59.8 | 64.9 | 91.3 | 23.3 | 4 cited tests- SWE-bench Verified (48 peers)74.4% · 61.5 pts ↗
- LiveCodeBench v6 (11 peers)86.4% · 68.2 pts ↗
- AIME 2025 (40 peers)97.3% · 91.3 pts ↗
- BrowseComp (15 peers)51.6% · 23.3 pts ↗
|
| 10 | Claude Sonnet 4.6Anthropic | 59.4 | 88.5 | 48.7 | 41 | 7 cited tests- SWE-bench Verified (48 peers)79.6% · 88.5 pts ↗
- GPQA Diamond (111 peers)89.9% · 67.6 pts ↗
- Humanity's Last Exam (no tools) (29 peers)33.2% · 53.4 pts ↗
- Humanity's Last Exam (with tools) (14 peers)49% · 25 pts ↗
- MCP Atlas (9 peers)61.3% · 50 pts ↗
- Tau2-bench Telecom (8 peers)97.9% · 43.8 pts ↗
- OSWorld-Verified (12 peers)72.5% · 29.2 pts ↗
|
| 11 | GPT-5.4OpenAI | 59.3 | 43.2 | 69.5 | 65.3 | 10 cited tests- SWE-bench Pro (22 peers)57.7% · 43.2 pts ↗
- GPQA Diamond (111 peers)92.8% · 85.6 pts ↗
- Humanity's Last Exam (no tools) (29 peers)39.8% · 70.7 pts ↗
- Humanity's Last Exam (with tools) (14 peers)52.1% · 39.3 pts ↗
- FrontierMath Tiers 1-3 v2 (Epoch AI run) (59 peers)78.6% · 82.2 pts ↗
- BrowseComp (15 peers)82.7% · 63.3 pts ↗
- MCP Atlas (9 peers)67.2% · 61.1 pts ↗
- Tau2-bench Telecom (8 peers)98.9% · 81.3 pts ↗
- Toolathlon (6 peers)54.6% · 75 pts ↗
- OSWorld-Verified (12 peers)75% · 45.8 pts ↗
|
| 11 | LongCat 2.0Meituan LongCat | 59.3 | 56.8 | 64.4 | 56.7 | 3 cited tests- SWE-bench Pro (22 peers)59.5% · 56.8 pts ↗
- GPQA Diamond (111 peers)88.9% · 64.4 pts ↗
- BrowseComp (15 peers)79.9% · 56.7 pts ↗
|
| 13 | Gemini 3.6 FlashGoogle | 54.5 | 9.4 | 75 | 79.2 | 4 cited tests- DeepSWE v1.1 (16 peers)49% · 9.4 pts ↗
- GPQA Diamond (111 peers)94.1% · 93.2 pts ↗
- FrontierMath Tiers 1-3 v2 (Epoch AI run) (59 peers)58.9% · 56.8 pts ↗
- OSWorld-Verified (12 peers)83% · 79.2 pts ↗
|
| 14 | Dola Seed 2.0 ProByteDance Seed | 53.9 | 42.2 | 82.8 | 36.7 | 7 cited tests- SWE-bench Verified (48 peers)76.5% · 72.9 pts ↗
- SWE-bench Pro (22 peers)46.9% · 11.4 pts ↗
- GPQA Diamond (111 peers)92.4% · 82 pts ↗
- MMLU-Pro (29 peers)90.1% · 98.3 pts ↗
- AIME 2025 (40 peers)99% · 93.8 pts ↗
- Humanity's Last Exam (no tools) (29 peers)33.3% · 56.9 pts ↗
- BrowseComp (15 peers)77.3% · 36.7 pts ↗
|
| 15 | Solar Open 2 250B-A15BUpstage | 53.5 | 69.1 | 63.5 | 27.8 | 6 cited tests- SWE-bench Verified (48 peers)70.4% · 42.7 pts ↗
- LiveCodeBench v6 (11 peers)92.4% · 95.5 pts ↗
- GPQA Diamond (111 peers)86.3% · 50.9 pts ↗
- MMLU-Pro (29 peers)86.2% · 89.7 pts ↗
- Humanity's Last Exam (no tools) (29 peers)28.8% · 50 pts ↗
- MCP Atlas (9 peers)58.2% · 27.8 pts ↗
|
| 16 | Claude Sonnet 4.5Anthropic | 45.4 | 77.1 | 28.5 | 30.6 | 9 cited tests- SWE-bench Verified (48 peers)77.2% · 77.1 pts ↗
- GPQA Diamond (111 peers)83.4% · 42.8 pts ↗
- AIME 2025 (40 peers)84.2% · 36.3 pts ↗
- Humanity's Last Exam (no tools) (29 peers)17.7% · 25.9 pts ↗
- Humanity's Last Exam (with tools) (14 peers)33.6% · 17.9 pts ↗
- FrontierMath Tiers 1-3 v2 (Epoch AI run) (59 peers)23.9% · 19.5 pts ↗
- MCP Atlas (9 peers)43.8% · 16.7 pts ↗
- Tau2-bench Telecom (8 peers)98% · 62.5 pts ↗
- OSWorld-Verified (12 peers)61.4% · 12.5 pts ↗
|
| 17 | GPT-5.4 miniOpenAI | 34.8 | 29.5 | 52 | 22.9 | 5 cited tests- SWE-bench Pro (22 peers)54.4% · 29.5 pts ↗
- GPQA Diamond (111 peers)88% · 59.9 pts ↗
- FrontierMath Tiers 1-3 v2 (Epoch AI run) (59 peers)51.2% · 44.1 pts ↗
- Toolathlon (6 peers)42.9% · 25 pts ↗
- OSWorld-Verified (12 peers)72.1% · 20.8 pts ↗
|
| 18 | NVIDIA Nemotron 3 Ultra 550B-A55B NVFP4NVIDIA | 33.6 | 38.5 | 52.4 | 10 | 4 cited tests- SWE-bench Verified (48 peers)69.7% · 38.5 pts ↗
- GPQA Diamond (111 peers)87.9% · 58.1 pts ↗
- Humanity's Last Exam (no tools) (29 peers)26.1% · 46.6 pts ↗
- BrowseComp (15 peers)41.4% · 10 pts ↗
|
| 19 | GPT-5.4 nanoOpenAI | 20.1 | 15.9 | 38 | 6.3 | 5 cited tests- SWE-bench Pro (22 peers)52.4% · 15.9 pts ↗
- GPQA Diamond (111 peers)82.8% · 38.7 pts ↗
- FrontierMath Tiers 1-3 v2 (Epoch AI run) (59 peers)44.9% · 37.3 pts ↗
- Toolathlon (6 peers)35.5% · 8.3 pts ↗
- OSWorld-Verified (12 peers)39% · 4.2 pts ↗
|
| 20 | NVIDIA Nemotron 3.5 Lightning 30B-A3B NVFP4NVIDIA | 15.4 | 13.5 | 29.3 | 3.3 | 5 cited tests- SWE-bench Verified (48 peers)52.8% · 13.5 pts ↗
- GPQA Diamond (111 peers)75.57% · 25.7 pts ↗
- MMLU-Pro (29 peers)81.62% · 50 pts ↗
- Humanity's Last Exam (no tools) (29 peers)10.47% · 12.1 pts ↗
- BrowseComp (15 peers)36.81% · 3.3 pts ↗
|