Qwen VL OCR is Alibaba's image to text model with a 38K context window and up to 8K output tokens, starting at $0.043 / 1M input and $0.072 / 1M output. A Qwen visual language model from Alibaba specialized for optical character recognition and document text extraction.
Specifications
Canonical IDalibaba-qwen-vl-ocr
TypeImage to Text
StatusActive
CreatorAlibabaAlibaba
Providers
Context Window38K tokens
Max Output8K tokens
Input ModalitiesText
Output ModalitiesText

Capabilities

Input1/5
Text
Image·
Audio·
Video·
PDF·
Output1/5
Text
Image·
Audio·
Video·
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandardBatch
Input
$ / 1M
Output
$ / 1M
Input
$ / 1M
Output
$ / 1M
Alibaba Qwen logo
Alibaba Qwen
qwen-vl-ocr
$0.07$0.16$0.035$0.08
Alibaba Qwen logo
Alibaba Qwen
qwen-vl-ocr-2024-10-28
$0.717$0.717$0.358$0.358
Alibaba Qwen logo
Alibaba Qwen
qwen-vl-ocr-latest
$0.043$0.072$0.0215$0.036

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Qwen3.8 2.4T A95B1.0M$2.00$6.00Available
Qwen Audio 3 Flash ASRAvailable
Qwen Audio 3 Flash ASR FiletransAvailable
Qwen Audio 3 Flash ASR StreamingAvailable
Qwen Audio 3 Flash Realtime$0.450$4.50Available
Qwen Audio 3 Plus Realtime$0.800$6.40Available
Qwen Audio 3 Plus TTSAvailable
Qwen Image 3Available
Qwen Image 3.0 ProAvailable
EAGLE Qwen 2.5 3B InstructAvailable
Qwen VL OCR38K$0.043$0.072Current

Model IDs

alibaba-qwen-vl-ocr
qwen-vl-ocr
qwen-vl-ocr-2024-10-28
qwen-vl-ocr-2025-04-13
qwen-vl-ocr-2025-08-28
qwen-vl-ocr-2025-11-20
qwen-vl-ocr-latest