H3 Text to Video is H3's video generation model. A text-to-video generation model that produces video clips directly from natural language prompts.
Specifications
Canonical IDh3-text-to-video
TypeVideo Generation
StatusActive
CreatorH3
Providers
Input ModalitiesText
Output ModalitiesVideo

Capabilities

Input1/5
Text
Image·
Audio·
Video·
PDF·
Output1/5
Text·
Image·
Audio·
Video
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandard
Video Out
$ / sec
fal.ai logo
fal.ai
fal_ai/minimax/h3/text-to-video
$0.130

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
MiniMax H3Available
H3 Text to VideoCurrent
H3 Reference to VideoAvailable

Model IDs

fal_ai/minimax/h3/text-to-video
h3-text-to-video