Qwen-Audio 3.1 Plus TTS is Alibaba's text to speech model. A multilingual text-to-speech model from Alibaba's Qwen-Audio series tuned for expressive, high-fidelity voice synthesis.
Specifications
Canonical IDalibaba-qwen-audio-3-1-plus-tts
TypeText to Speech
StatusActive
CreatorAlibabaAlibaba
Input ModalitiesText
Output ModalitiesAudio

Capabilities

Input1/5
Text✓
Image·
Audio·
Video·
PDF·
Output1/5
Text·
Image·
Audio✓
Video·
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Qwen-Audio 3.1 Plus TTS————Current
Qwen Audio 3 Plus Realtime——$0.800$6.40Available
Qwen Audio 3 Plus TTS————Available
Qwen Audio 3.1 Plus Realtime——$0.800$6.40Available
Qwen3.7 Plus1.0M$0.282$1.13Available
Qwen3.6 Plus1.0M$0.325$1.95Available
Qwen Plus Thinking1.0M——Available
Qwen VL Plus8K$0.210$0.630Available
Qwen Plus1.0M$0.115$0.287Deprecated
Qwen3.5 Omni Plus——$1.40$11.00Available

Other Models

ModelTierReleasedContextInput / 1MOutput / 1M
Qwen3.8 2.4T A95B—1.0M$2.00$6.00
Qwen Image 3—————
Qwen Audio 3 Flash ASRFlash————
Qwen Audio 3 Flash ASR FiletransFlash————
Qwen Audio 3 Flash ASR StreamingFlash————
Qwen Audio 3 Flash RealtimeFlash——$0.230$0.930
Qwen Image 3.0 ProPro————
EAGLE Qwen 2.5 3B Instruct—————
Qwen-Image 2.1—————
DeepSeek R1 Qwen3 8B—————

Model IDs

alibaba-qwen-audio-3-1-plus-tts
qwen-audio-3-1-tts-plus