Flash is Alibaba's language model with a 998K context window and up to 33K output tokens, starting at $0.05 / 1M input and $0.4 / 1M output. A lightweight, high-speed Alibaba LLM tier designed for low-latency inference on everyday tasks.
Specifications
Canonical IDalibaba-flash
TypeLanguage
StatusActive
CreatorAlibabaAlibaba
Providers
Context Window998K tokens
Max Output33K tokens
Input ModalitiesText
Output ModalitiesText
Reasoning Effortsdefault

Capabilities

Input1/5
Text✓
Image·
Audio·
Video·
PDF·
Output1/5
Text✓
Image·
Audio·
Video·
Embedding·
Capabilities2/13
Reasoning✓
Adaptive Reasoning·
Function Calling✓
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandardBatch
Input
$ / 1M
Output
$ / 1M
Input
$ / 1M
Output
$ / 1M
Alibaba Qwen logo
Alibaba Qwen
qwen-flash
$0.05$0.4$0.025$0.2

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Flash—998K$0.050$0.400Current
ASR Flash————Available
ASR Flash 8K Realtime————Available
Flash US—1.0M——Available
MT Flash—16K$0.160$0.490Available

Other Models

ModelTierReleasedContextInput / 1MOutput / 1M
Text 4 Embedding———$0.070—
Text 3 Embedding———$0.070—
HappyHorse 1.0—————
ASR—————
ASR MTL—————
ASR MTL Realtime—————
ASR Realtime—————
Coder——1.0M$0.300$1.50
Coder PlusPlus—131K$0.502$1.00
Coder TurboTurbo—131K$0.287$0.861

Model IDs

alibaba-flash
dashscope/qwen-flash
dashscope/qwen-flash-2025-07-28
qwen_ai_platform/qwen-flash
qwen_ai_platform/qwen-flash-2025-07-28
qwen-flash
qwen-flash-2025-07-28
qwencloud/qwen-flash
qwencloud/qwen-flash-2025-07-28