Fish Audio Transcribe 1 is Fish Audio's language model, starting at $0.0001 / 1M input. An ASR model that converts spoken audio into accurate text with timed segments, returning transcripts, duration, and timestamped segment data.
Specifications
Canonical IDfish-audio-transcribe-1
TypeLanguage
StatusActive
CreatorFish Audio
Providers
Input ModalitiesText
Output ModalitiesText
Release Date · 5 months ago

Capabilities

Input1/5
Text
Image·
Audio·
Video·
PDF·
Output1/5
Text
Image·
Audio·
Video·
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandard
Input
$ / 1M
Vercel AI Gateway logo
Vercel AI Gateway
fish-audio/transcribe-1
$0.0001

Cost Calculator

US Dollar ($)
Preset:

Model IDs

fish-audio-transcribe-1
fish-audio/transcribe-1