Transcribe is Amazon's speech to text model. An automatic speech recognition service that converts audio to text with support for speaker diarization and custom vocabularies.
Specifications
Canonical IDamazon-transcribe
TypeSpeech to Text
StatusActive
CreatorAmazonAmazon
Providers
Input ModalitiesAudio
Output ModalitiesText

Capabilities

Input1/5
Text·
Image·
Audio✓
Video·
PDF·
Output1/5
Text✓
Image·
Audio·
Video·
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandard
Audio In
$ / sec
Transcribe
transcribe/StartTranscriptionJob
$0.000100

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Fish Audio Transcribe 1———Available
Fish Audio Transcribe 1 Free———Available
Transcribe————Current

Model IDs

amazon-transcribe
transcribe/StartTranscriptionJob