All Comparisons

GPT-4o mini vs o4-mini
GPT-4o mini
OpenAI πΊπΈ
41.4
#217β
high$0.15/M in Β· $0.60/M out
128K context
o4-mini
OpenAI πΊπΈ
57.1
#155β
highMost Affordable
GPT-4o mini
$0.15/M input
Largest Context
GPT-4o mini
128K tokens
Best Benchmark Score
o4-mini
57.1/100
Model Specifications
| Spec | GPT-4o mini | o4-mini |
|---|---|---|
| Provider | OpenAI | OpenAI |
| Release Date | Jul 2024 | Apr 2025 |
| Knowledge Cutoff | Oct 2023 | 2024-05-31 |
| Parameters | unknown | Undisclosed |
| Context Window | 128K | β |
| Max Output | β | β |
| Open Source | No | No |
| License | proprietary | proprietary |
| Tokenizer | β | β |
| Modality | β | β |
| Reasoning Model | No | No |
| Moderated | No | No |
Pricing Comparison
| Price (per 1M tokens) | GPT-4o mini | o4-mini |
|---|---|---|
| Input | $0.15 | β |
| Output | $0.60 | β |
API Provider Pricing
Capabilities
| Feature | GPT-4o mini | o4-mini |
|---|---|---|
| Text Input | ||
| Image Input (Vision) | ||
| Audio Input | ||
| Video Input | ||
| File Input | ||
| Image Output | ||
| Audio Output | ||
| Tool Use | ||
| Structured Output (JSON) | ||
| Streaming | ||
| Reasoning Tokens | ||
| Web Search | ||
| Temperature Control | ||
| Top-P Sampling | ||
| Stop Sequences | ||
| Seed (Reproducibility) | ||
| Log Probabilities |
Category Comparison
Benchmark-by-Benchmark
general
| Benchmark | GPT-4o mini | o4-mini |
|---|---|---|
| Chatbot Arena Elo | 1219 | β |
| IFEval | 80.1 | β |
| MMLU-Pro | 63.2 | β |
coding
| Benchmark | GPT-4o mini | o4-mini |
|---|---|---|
| HumanEval | 87.2 | β |
| SWE-bench Verified | β | 68.1 |
reasoning
| Benchmark | GPT-4o mini | o4-mini |
|---|---|---|
| ARC-Challenge | 93.1 | β |
| GPQA Diamond | 40.2 | 81.4 |
| BigBench-Hard | 78.5 | β |
| Humanity's Last Exam | β | 14.7 |
language
| Benchmark | GPT-4o mini | o4-mini |
|---|---|---|
| HellaSwag | 91.2 | β |
| WinoGrande | 82.3 | β |
safety
| Benchmark | GPT-4o mini | o4-mini |
|---|---|---|
| TruthfulQA | 65.8 | β |
multimodal
| Benchmark | GPT-4o mini | o4-mini |
|---|---|---|
| MMMU | β | 81.6 |
| CharXiv Reasoning | β | 72 |
agent
| Benchmark | GPT-4o mini | o4-mini |
|---|---|---|
| BrowseComp | β | 51.5 |
| TAU-Bench Retail | β | 71.8 |
Category Winners
coding
61.6
math
74.3
reasoning
46.0
general
34.6
language
35.0
multimodal
62.5
safety
62.9
agent
43.4