All Comparisons

GPT-4.1 vs GPT-4o mini
GPT-4.1
OpenAI πΊπΈ
32.8
#238β
high$2.00/M in Β· $8.00/M out
1.0M context
GPT-4o mini
OpenAI πΊπΈ
41.5
#200β
high$0.15/M in Β· $0.60/M out
128K context
Most Affordable
GPT-4o mini
$0.15/M input
Largest Context
GPT-4.1
1.0M tokens
Best Benchmark Score
GPT-4o mini
41.5/100
Model Specifications
| Spec | GPT-4.1 | GPT-4o mini |
|---|---|---|
| Provider | OpenAI | OpenAI |
| Release Date | Apr 2025 | Jul 2024 |
| Knowledge Cutoff | 2024-06-01 | Oct 2023 |
| Parameters | Undisclosed | unknown |
| Context Window | 1.0M | 128K |
| Max Output | β | β |
| Open Source | No | No |
| License | proprietary | proprietary |
| Tokenizer | β | β |
| Modality | β | β |
| Reasoning Model | No | No |
| Moderated | No | No |
Pricing Comparison
| Price (per 1M tokens) | GPT-4.1 | GPT-4o mini |
|---|---|---|
| Input | $2.00 | $0.15 |
| Output | $8.00 | $0.60 |
API Provider Pricing
Capabilities
| Feature | GPT-4.1 | GPT-4o mini |
|---|---|---|
| Text Input | ||
| Image Input (Vision) | ||
| Audio Input | ||
| Video Input | ||
| File Input | ||
| Image Output | ||
| Audio Output | ||
| Tool Use | ||
| Structured Output (JSON) | ||
| Streaming | ||
| Reasoning Tokens | ||
| Web Search | ||
| Temperature Control | ||
| Top-P Sampling | ||
| Stop Sequences | ||
| Seed (Reproducibility) | ||
| Log Probabilities |
Category Comparison
Benchmark-by-Benchmark
general
| Benchmark | GPT-4.1 | GPT-4o mini |
|---|---|---|
| MMMLU | 87.3 | β |
| IFEval | β | 80.1 |
| MMLU-Pro | β | 63.2 |
| Chatbot Arena Elo | β | 1219 |
coding
| Benchmark | GPT-4.1 | GPT-4o mini |
|---|---|---|
| SWE-bench Verified | 54.6 | β |
| HumanEval | β | 87.2 |
reasoning
| Benchmark | GPT-4.1 | GPT-4o mini |
|---|---|---|
| GPQA Diamond | 66.3 | 40.2 |
| Humanity's Last Exam | 5.4 | β |
| ARC-Challenge | β | 93.1 |
| BigBench-Hard | β | 78.5 |
multimodal
| Benchmark | GPT-4.1 | GPT-4o mini |
|---|---|---|
| MMMU | 74.8 | β |
| CharXiv Reasoning | 56.7 | β |
agent
| Benchmark | GPT-4.1 | GPT-4o mini |
|---|---|---|
| TAU-Bench Retail | 68 | β |
language
| Benchmark | GPT-4.1 | GPT-4o mini |
|---|---|---|
| WinoGrande | β | 82.3 |
| HellaSwag | β | 91.2 |
safety
| Benchmark | GPT-4.1 | GPT-4o mini |
|---|---|---|
| TruthfulQA | β | 65.8 |
Category Winners
coding
61.6
math
48.4
reasoning
27.5
general
66.0
language
35.0
multimodal
40.2
safety
62.9
agent
50.7