GPT Realtime 2.1 Audio is OpenAI's language model. A real-time multimodal LLM variant optimized for low-latency audio input and output in live conversational applications.
Specifications
Canonical IDopenai-gpt-realtime-2-1-audio
TypeLanguage
StatusActive
CreatorOpenAIOpenAI
Providers
Input ModalitiesText
Output ModalitiesText

Capabilities

Input1/5
Text
Image·
Audio·
Video·
PDF·
Output1/5
Text
Image·
Audio·
Video·
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandard
Cache Read
$ / 1M
Audio In
$ / 1M
Azure AI Foundry logo
Azure AI Foundry
openai:gptrealtime21audio
$0.4$32.00

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
GPT Realtime 2.1 AudioCurrent
GPT Realtime 2.1 ImageAvailable
GPT Realtime 2.1 Mini AudioAvailable
GPT Realtime 2.1 Mini ImageAvailable
GPT Realtime 2.1 Mini TextAvailable
GPT Realtime 2.1 TextAvailable

Model IDs

openai-gpt-realtime-2-1-audio