All Comparisons

Claude Sonnet 4 vs o3

Claude Sonnet 4
Anthropic πŸ‡ΊπŸ‡Έ
68.5
#83β€”
high
$3.00/M in Β· $15.00/M out
200K context
o3
OpenAI πŸ‡ΊπŸ‡Έ
47.9
#174β€”
high
Most Affordable
Claude Sonnet 4
$3.00/M input
Largest Context
Claude Sonnet 4
200K tokens
Best Benchmark Score
Claude Sonnet 4
68.5/100

Model Specifications

SpecClaude Sonnet 4o3
ProviderAnthropicOpenAI
Release DateMay 2025Apr 2025
Knowledge CutoffMar 20252024-05-31
ParametersunknownUndisclosed
Context Window200Kβ€”
Max Outputβ€”β€”
Open SourceNoNo
Licenseproprietaryproprietary
Tokenizerβ€”β€”
Modalityβ€”β€”
Reasoning ModelNoNo
ModeratedNoNo

Pricing Comparison

Price (per 1M tokens)Claude Sonnet 4o3
Input$3.00β€”
Output$15.00β€”

API Provider Pricing

Capabilities

FeatureClaude Sonnet 4o3
Text Input
Image Input (Vision)
Audio Input
Video Input
File Input
Image Output
Audio Output
Tool Use
Structured Output (JSON)
Streaming
Reasoning Tokens
Web Search
Temperature Control
Top-P Sampling
Stop Sequences
Seed (Reproducibility)
Log Probabilities

Category Comparison

Benchmark-by-Benchmark

general

BenchmarkClaude Sonnet 4o3
IFEval
90.1
β€”
MMLU-Pro
80.2
β€”
Chatbot Arena Elo
1310
β€”

coding

BenchmarkClaude Sonnet 4o3
HumanEval
93.8
β€”
SWE-bench Verified
53.2
69.1

math

BenchmarkClaude Sonnet 4o3
MATH
81.4
β€”
GSM8K
97.2
β€”
AIME 2024
24.5
β€”
AIME 2025β€”
86.4
FrontierMathβ€”
15.8

reasoning

BenchmarkClaude Sonnet 4o3
BigBench-Hard
90.8
β€”
GPQA Diamond
70.5
83.3
Humanity's Last Examβ€”
14.7
ARC-AGI v2β€”
6.5

multimodal

BenchmarkClaude Sonnet 4o3
MMMU
72.5
82.9
MMMU-Proβ€”
76.4
CharXiv Reasoningβ€”
78.6

agent

BenchmarkClaude Sonnet 4o3
BrowseCompβ€”
49.7

Category Winners

coding
o3
58.4
math
Claude Sonnet 4
66.8
reasoning
Claude Sonnet 4
70.9
general
Claude Sonnet 4
90.0
multimodal
o3
73.4
agent
o3
23.4

Compare More Models

Frequently Asked Questions