Qwen Audio 3 Flash ASR is Alibaba's language model. A speech recognition model from the Qwen Audio series optimized for fast automatic speech-to-text transcription.
Specifications
Canonical IDalibaba-qwen-audio-3-flash-asr
TypeLanguage
StatusActive
CreatorAlibabaAlibaba
Providers
Input ModalitiesText
Output ModalitiesText

Capabilities

Input1/5
Text
Image·
Audio·
Video·
PDF·
Output1/5
Text
Image·
Audio·
Video·
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandard
Audio In
$ / sec
Alibaba Qwen logo
Alibaba Qwen
qwen-audio-3.0-asr-flash
$0.000035

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Qwen Audio 3 Flash ASRCurrent
Qwen Audio 3 Flash ASR FiletransAvailable
Qwen Audio 3 Flash ASR StreamingAvailable
Qwen Audio 3 Flash Realtime$0.450$4.50Available
Qwen3.8-Flash-Next1.0M$0.120$0.400Available
Qwen3.5 Omni Flash$0.400$3.00Available
Qwen Flash Character$0.050$0.400Available
Qwen TTS Flash$0.230$1.43Available

Other Models

ModelTierReleasedContextInput / 1MOutput / 1M
Qwen3.8 2.4T A95B1.0M$2.00$6.00
Qwen Image 3
Qwen Audio 3 Plus RealtimePlus$0.800$6.40
Qwen Audio 3 Plus TTSPlus
Qwen Image 3.0 ProPro
EAGLE Qwen 2.5 3B Instruct
DeepSeek R1 Qwen3 8B
Qwen3.8 27B1.0M$0.400$2.55
Qwen3.8 MaxMax1.0M$1.65$4.95
Qwen3.7 PlusPlus1.0M$0.320$1.28

Model IDs

alibaba-qwen-audio-3-flash-asr
qwen-audio-3.0-asr-flash