All Comparisons

GPT-4o mini vs o3

GPT-4o mini
OpenAI πŸ‡ΊπŸ‡Έ
41.5
#200β€”
high
$0.15/M in Β· $0.60/M out
128K context
o3
OpenAI πŸ‡ΊπŸ‡Έ
47.9
#174β€”
high
Most Affordable
GPT-4o mini
$0.15/M input
Largest Context
GPT-4o mini
128K tokens
Best Benchmark Score
o3
47.9/100

Model Specifications

SpecGPT-4o minio3
ProviderOpenAIOpenAI
Release DateJul 2024Apr 2025
Knowledge CutoffOct 20232024-05-31
ParametersunknownUndisclosed
Context Window128Kβ€”
Max Outputβ€”β€”
Open SourceNoNo
Licenseproprietaryproprietary
Tokenizerβ€”β€”
Modalityβ€”β€”
Reasoning ModelNoNo
ModeratedNoNo

Pricing Comparison

Price (per 1M tokens)GPT-4o minio3
Input$0.15β€”
Output$0.60β€”

API Provider Pricing

Capabilities

FeatureGPT-4o minio3
Text Input
Image Input (Vision)
Audio Input
Video Input
File Input
Image Output
Audio Output
Tool Use
Structured Output (JSON)
Streaming
Reasoning Tokens
Web Search
Temperature Control
Top-P Sampling
Stop Sequences
Seed (Reproducibility)
Log Probabilities

Category Comparison

Benchmark-by-Benchmark

general

BenchmarkGPT-4o minio3
IFEval
80.1
β€”
MMLU-Pro
63.2
β€”
Chatbot Arena Elo
1219
β€”

coding

BenchmarkGPT-4o minio3
HumanEval
87.2
β€”
SWE-bench Verifiedβ€”
69.1

math

BenchmarkGPT-4o minio3
MATH
70.2
β€”
GSM8K
93.2
β€”
AIME 2025β€”
86.4
FrontierMathβ€”
15.8

reasoning

BenchmarkGPT-4o minio3
GPQA Diamond
40.2
83.3
ARC-Challenge
93.1
β€”
BigBench-Hard
78.5
β€”
Humanity's Last Examβ€”
14.7
ARC-AGI v2β€”
6.5

language

BenchmarkGPT-4o minio3
WinoGrande
82.3
β€”
HellaSwag
91.2
β€”

safety

BenchmarkGPT-4o minio3
TruthfulQA
65.8
β€”

multimodal

BenchmarkGPT-4o minio3
MMMUβ€”
82.9
MMMU-Proβ€”
76.4
CharXiv Reasoningβ€”
78.6

agent

BenchmarkGPT-4o minio3
BrowseCompβ€”
49.7

Category Winners

coding
GPT-4o mini
61.6
math
GPT-4o mini
48.4
reasoning
o3
34.1
general
GPT-4o mini
34.6
language
GPT-4o mini
35.0
multimodal
o3
73.4
safety
GPT-4o mini
62.9
agent
o3
23.4

Compare More Models

Frequently Asked Questions