Neura Intelligence Index
| Benchmark | o4-mini | Qwen 2.5 72B |
|---|---|---|
| GPQA Diamond | 81.4 | 49 |
| Humanity's Last Exam | 14.7 | — |
| BigBench-Hard | — | 83.5 |
| ARC-Challenge | — | 95.3 |
| Benchmark | o4-mini | Qwen 2.5 72B |
|---|---|---|
| SWE-bench Verified | 68.1 | — |
| HumanEval | — | 86.6 |
| Benchmark | o4-mini | Qwen 2.5 72B |
|---|---|---|
| MMMU | 81.6 | — |
| CharXiv Reasoning | 72 | — |
| Benchmark | o4-mini | Qwen 2.5 72B |
|---|---|---|
| BrowseComp | 51.5 | — |
| TAU-Bench Retail | 71.8 | — |
| Benchmark | o4-mini | Qwen 2.5 72B |
|---|---|---|
| HellaSwag | — | 94 |
| WinoGrande | — | 84.8 |
| Benchmark | o4-mini | Qwen 2.5 72B |
|---|---|---|
| TruthfulQA | — | 62.5 |
| Benchmark | o4-mini | Qwen 2.5 72B |
|---|---|---|
| IFEval | — | 84.2 |
| Chatbot Arena Elo | — | 1261 |
| MMLU-Pro | — | 71.1 |