Grok STT is xAI's speech to text model. A speech-to-text model from xAI's Grok line that transcribes audio in 25 languages with support for both batch and streaming processing modes.
Specifications
Canonical IDxai-grok-stt
TypeSpeech to Text
StatusActive
CreatorxAIxAI
Providers
Input ModalitiesAudio
Output ModalitiesText
Release Date · 6 months ago

Capabilities

Input1/5
Text·
Image·
Audio✓
Video·
PDF·
Output1/5
Text✓
Image·
Audio·
Video·
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandard
Audio In
$ / sec
Vercel AI Gateway logo
Vercel AI Gateway
spacexai/grok-stt
$0.000028

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Grok 4.7500K$1.20$3.60Available
Grok 4.6524K$2.00$6.00Available
Grok 4.5500K$2.00$6.00Available
Grok 4.31.0M$1.25$2.50Available
Grok 4.202.0M$1.25$2.50Available
Grok 4.20 Multi-Agent2.0M$1.25$2.50Available
Grok 4.20 Multi-Agent Beta2.0M$1.25$2.50Available
Grok 4.20 Non-Reasoning2.0M$1.25$2.50Available
Grok 4.20 Reasoning2.0M$1.25$2.50Available
Grok 4.1 Reasoning2.0M$0.200$0.500Deprecated
Grok STT———Current

Model IDs

spacexai/grok-stt
xai-grok-stt
xai/grok-stt