Qwen3 TTS VD is Alibaba's text to speech model, starting at $0.115 / 1M input. A Qwen3 TTS model with voice design capabilities for creating and customizing synthetic speaker voices.
Specifications
Canonical IDalibaba-qwen3-tts-vd
TypeText to Speech
StatusActive
CreatorAlibabaAlibaba
Providers
Input ModalitiesText
Output ModalitiesAudio

Capabilities

Input1/5
Text✓
Image·
Audio·
Video·
PDF·
Output1/5
Text·
Image·
Audio✓
Video·
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandardBatch
Input
$ / 1M
Input
$ / 1M
Alibaba Qwen logo
Alibaba Qwen
qwen3-tts-vd-2026-01-26
$0.115$0.0575

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Qwen3.8 2.4T A95B1.0M$2.00$6.00Available
Qwen Audio 3 Flash ASR————Available
Qwen Audio 3 Flash ASR Filetrans————Available
Qwen Audio 3 Flash ASR Streaming————Available
Qwen Audio 3 Flash Realtime——$0.230$0.930Available
Qwen Audio 3 Plus Realtime——$0.800$6.40Available
Qwen Audio 3 Plus TTS————Available
Qwen Audio 3.1 Plus Realtime——$0.800$6.40Available
Qwen Image 3————Available
Qwen Image 3.0 Pro————Available
Qwen3 TTS VD——$0.115—Current

Model IDs

alibaba-qwen3-tts-vd
qwen3-tts-vd-2026-01-26