ASR is Alibaba's language model. A general-purpose automatic speech recognition model for converting spoken audio to text.
Specifications
Canonical IDalibaba-asr
TypeLanguage
StatusActive
CreatorAlibabaAlibaba
Providers
Input ModalitiesText
Output ModalitiesText

Capabilities

Input1/5
Text✓
Image·
Audio·
Video·
PDF·
Output1/5
Text✓
Image·
Audio·
Video·
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandard
Audio In
$ / sec
$0.000035

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Text 4 Embedding——$0.070—Available
Text 3 Embedding——$0.070—Available
HappyHorse 1.0————Available
ASR————Current
ASR Flash————Available
ASR Flash 8K Realtime————Available
ASR MTL————Available
ASR MTL Realtime————Available
ASR Realtime————Available
Coder—1.0M$0.300$1.50Available
Coder Plus—131K$0.502$1.00Available

Model IDs

alibaba-asr
fun-asr
fun-asr-2025-08-25
fun-asr-2025-11-07