Fish Audio S1 is Fish Audio's language model, starting at $15.00 / 1M input. A neural TTS/voice model trained on over 2 million hours of audio with online RLHF (GRPO), supporting open-domain emotion, tone, and special effect markers with very low word and character error rates.
Specifications
Canonical IDfish-audio-s1
TypeLanguage
StatusActive
CreatorFish Audio
Providers
Input ModalitiesText
Output ModalitiesText
Release Date · 10 months ago

Capabilities

Input1/5
Text
Image·
Audio·
Video·
PDF·
Output1/5
Text
Image·
Audio·
Video·
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandard
Input
$ / 1M
Vercel AI Gateway logo
Vercel AI Gateway
fish-audio/s1
$15.00

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
MiniMax Speech 2 HDAvailable
MiniMax Speech 2 TurboAvailable
MiniMax Speech 2.6Available
MiniMax Speech HD 2.6Available
MiniMax Speech HD 2.8Available
MiniMax Speech Turbo 2.6Available
MiniMax Speech Turbo 2.8Available
Fish Audio S2.1 Pro$15.00Available
Fish Audio Speech 1.5Available
Fish Audio S2 Pro$15.00Available
Fish Audio S1$15.00Current

Model IDs

fish-audio-s1
fish-audio/s1