Qwen3 VL 235B A22B Thinking is Alibaba's language model with a 131K context window and up to 33K output tokens, starting at $0.4 / 1M input and $4.00 / 1M output. A 235B MoE vision-language model with enhanced multimodal reasoning, particularly optimized for STEM and mathematical problem-solving with visual inputs.
Specifications
Canonical IDalibaba-qwen3-vl-thinking
TypeLanguage
StatusActive
CreatorAlibabaAlibaba
Providers
Context Window131K tokens
Max Output33K tokens
Input ModalitiesImagePDF
Output ModalitiesText
Reasoning Effortsdefault
Release Date · 11 months ago

Capabilities

Input2/5
Text·
Image
Audio·
Video·
PDF
Output1/5
Text
Image·
Audio·
Video·
Embedding·
Capabilities2/13
Reasoning
Adaptive Reasoning·
Function Calling
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandard
Input
$ / 1M
Output
$ / 1M
Vercel AI Gateway logo
Vercel AI Gateway
alibaba/qwen3-vl-thinking
$0.4$4.00

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Qwen3.8 2.4T A95B1.0M$2.00$6.00Available
Qwen Audio 3 Flash ASRAvailable
Qwen Audio 3 Flash ASR FiletransAvailable
Qwen Audio 3 Flash ASR StreamingAvailable
Qwen Audio 3 Flash Realtime$0.450$4.50Available
Qwen Audio 3 Plus Realtime$0.800$6.40Available
Qwen Audio 3 Plus TTSAvailable
Qwen Image 3Available
Qwen Image 3.0 ProAvailable
EAGLE Qwen 2.5 3B InstructAvailable
Qwen3 VL 235B A22B Thinking131K$0.400$4.00Current

Model IDs

alibaba-qwen3-vl-thinking
alibaba/qwen3-vl-thinking