InclusionAI Ling 3 Flash is Inclusionai's language model with a 262K context window and up to 33K output tokens, available from 5 providers, starting at $0.021 / 1M input and $0.063 / 1M output. A 124B-parameter Mixture-of-Experts LLM with ~5.1B active parameters per token, optimized for token-efficient inference with reasoning and tool-use capabilities.
Specifications
Canonical IDinclusionai-ling-3-flash
TypeLanguage
StatusActive
CreatorInclusionai
Providers
Context Window262K tokens
Max Output33K tokens
Input ModalitiesText
Output ModalitiesText
Reasoning Effortsdefault
Parameters127B
HuggingFace Likes359
HuggingFace Downloads (30d)17,020
HuggingFace Downloads (all-time)17,029
Release Date · 1 month ago
Benchmarks
Intelligence Index
#76
Coding Index
#61
GPQA
#88
HLE
#100
Time to First Token
#487
SciCode
#112
LCR
#125
Output TPS
#4

Capabilities

Input1/5
Text
Image·
Audio·
Video·
PDF·
Output1/5
Text
Image·
Audio·
Video·
Embedding·
Capabilities5/13
Reasoning
Adaptive Reasoning·
Function Calling
Parallel Function Calling·
Structured Outputs
Native JSON Schema
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandard
Input
$ / 1M
Output
$ / 1M
Cache Read
$ / 1M
DeepInfra logo
DeepInfra
deepinfra/inclusionAI/Ling-3.0-flash
$0.06$0.18$0.012
Hugging Face logo
Hugging Face
novita:inclusionai/ling-3.0-flash
$0.06$0.18N/A
Novita logo
Novita
novita/inclusionai/ling-3.0-flash
$0.06$0.18$0.012
OpenRouter logo
OpenRouter
inclusionai/ling-3.0-flash
$0.021$0.063$0.0042
Vercel AI Gateway logo
Vercel AI Gateway
inclusionai/ling-3.0-flash
$0.06$0.18$0.012

Cost Calculator

US Dollar ($)
Preset:

Cheapest Instances to Run It

Cloud GPU instances that can host InclusionAI Ling 3 Flash, ranked by cheapest on-demand price. The model needs about 306 GB of GPU memory at FP16 precision (estimated from its parameter count), so treat the fit as guidance rather than a guarantee.

All clouds
FP16 (full precision)
US Dollar ($)
Instance
Cloud
GPU
VRAM
Price
Cheapest region
Standard_NC96ads_A100_v4Azure4× NVIDIA A100320 GB$14.69/hr
g7e.24xlargeAWS4× RTX PRO Server 6000384 GB$16.57/hr
g4-standard-192GCP4× nvidia-rtx-pro-6000384 GB$18.00/hr
7 more instances can run InclusionAI Ling 3 Flash
Unlock the full ranked list and FP8 / INT4 quantization with a CloudPrice subscription.

Model IDs

accounts/fireworks/models/ling-3-flash
deepinfra/inclusionAI/Ling-3.0-flash
inclusionai-ling-3-flash
inclusionai/ling-3.0-flash
inclusionAI/Ling-3.0-flash
inclusionai/ling-3.0-flash-free
inclusionai/ling-3.0-flash:free
ling-3-0-flash
novita/inclusionai/ling-3.0-flash