GPT Audio
by OpenAItext+audio->text+audio1 endpoint
Overview
The gpt-audio model is OpenAI's first generally available audio model. The new snapshot features an upgraded decoder for more natural sounding voices and maintains better voice consistency. Audio is priced...
Capabilities
Text generation
Audio processing
Audio generation
Tool use / Function calling
Structured output
Long context
Top-P sampling
Stop sequences
Deterministic seed
Log probabilities
Modalities
Input
TextAudio
Output
TextAudio
Technical Specifications
Context Window
128K tokens
Max Output
16.4K tokens
Tokenizer
GPT
Content Moderation
Enabled
Uptime (24h)
10000.0%
Supported Parameters
frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_logprobstop_p
Pricing
Per 1M tokens
Input$2.50
Output$10.00
Audio$32.00
Added
January 19, 2026
Last synced 9/19/2026