Flash US is Alibaba's language model with a 1.0M context window and up to 33K output tokens. A US-region-routed variant of Alibaba's Flash-tier LLM for low-latency inference.
Specifications
Canonical IDalibaba-flash-us
TypeLanguage
StatusActive
CreatorAlibabaAlibaba
Providers
Context Window1.0M tokens
Max Output33K tokens
Input ModalitiesText
Output ModalitiesText

Capabilities

Input1/5
Text✓
Image·
Audio·
Video·
PDF·
Output1/5
Text✓
Image·
Audio·
Video·
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandardBatch
Input
$ / 1M
Output
$ / 1M
Input
$ / 1M
Output
$ / 1M
Alibaba Qwen logo
Alibaba Qwen
qwen-flash-us
$0.05$0.4$0.025$0.2

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Flash US—1.0M——Current
ASR Flash————Available
ASR Flash 8K Realtime————Available
Flash—998K$0.050$0.400Available
MT Flash—16K$0.160$0.490Available

Other Models

ModelTierReleasedContextInput / 1MOutput / 1M
Text 4 Embedding———$0.070—
Text 3 Embedding———$0.070—
HappyHorse 1.0—————
ASR—————
ASR MTL—————
ASR MTL Realtime—————
ASR Realtime—————
Coder——1.0M$0.300$1.50
Coder PlusPlus—131K$0.502$1.00
Coder TurboTurbo—131K$0.287$0.861

Model IDs

alibaba-flash-us
qwen-flash-2025-07-28-us
qwen-flash-us