OpenAI

GPT Audio

by OpenAItext+audio->text+audio1 endpoint

Overview

The gpt-audio model is OpenAI's first generally available audio model. The new snapshot features an upgraded decoder for more natural sounding voices and maintains better voice consistency. Audio is priced...

Capabilities

Text generation
Audio processing
Audio generation
Tool use / Function calling
Structured output
Long context
Top-P sampling
Stop sequences
Deterministic seed
Log probabilities

Modalities

Input
TextAudio
Output
TextAudio

Technical Specifications

Context Window
128K tokens
Max Output
16.4K tokens
Tokenizer
GPT
Content Moderation
Enabled
Uptime (24h)
10000.0%

Supported Parameters

frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_logprobstop_p

Pricing

Per 1M tokens
Input$2.50
Output$10.00
Audio$32.00
Added
January 19, 2026
Last synced 9/19/2026