Qwen3 VL is Alibaba's embedding model, starting at $0.1 / 1M input. A Qwen3 vision-language model for multimodal understanding of images and text.
Specifications
Canonical IDalibaba-qwen3-vl
TypeEmbedding
StatusActive
CreatorAlibabaAlibaba
Providers
Input ModalitiesText
Output ModalitiesEmbedding

Capabilities

Input1/5
Text✓
Image·
Audio·
Video·
PDF·
Output1/5
Text·
Image·
Audio·
Video·
Embedding✓
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandardBatch
Input
$ / 1M
Input
$ / 1M
Alibaba Qwen logo
Alibaba Qwen
qwen3-vl-embedding
$0.258$0.129
Alibaba Qwen logo
Alibaba Qwen
qwen3-vl-rerank
$0.1$0.05

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Qwen3.8 2.4T A95B1.0M$2.00$6.00Available
Qwen Audio 3 Flash ASR————Available
Qwen Audio 3 Flash ASR Filetrans————Available
Qwen Audio 3 Flash ASR Streaming————Available
Qwen Audio 3 Flash Realtime——$0.230$0.930Available
Qwen Audio 3 Plus Realtime——$0.800$6.40Available
Qwen Audio 3 Plus TTS————Available
Qwen Audio 3.1 Plus Realtime——$0.800$6.40Available
Qwen Image 3————Available
Qwen Image 3.0 Pro————Available
Qwen3 VL——$0.100—Current

Model IDs

alibaba-qwen3-vl
qwen3-vl-embedding
qwen3-vl-rerank