ASR is Alibaba's language model. A general-purpose automatic speech recognition model for converting spoken audio to text.
Specifications
Canonical IDalibaba-asr
TypeLanguage
StatusActive
CreatorAlibabaAlibaba
Providers
Input ModalitiesText
Output ModalitiesText

Capabilities

Input1/5
Text
Image·
Audio·
Video·
PDF·
Output1/5
Text
Image·
Audio·
Video·
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandard
Audio In
$ / sec
$0.000035

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Text 4 Embedding$0.070Available
Text 3 Embedding$0.070Available
HappyHorse 1.0Available
ASRCurrent
ASR FlashAvailable
ASR Flash 8K RealtimeAvailable
ASR MTLAvailable
ASR MTL RealtimeAvailable
ASR RealtimeAvailable
Coder1.0M$0.300$1.50Available
Coder Plus131K$0.502$1.00Available

Model IDs

alibaba-asr
fun-asr
fun-asr-2025-08-25
fun-asr-2025-11-07