Nemotron 3 Embed 8B is NVIDIA's embedding model. An 8-billion-parameter text embedding model producing high-dimensional vectors with matryoshka support for truncation, suited for retrieval and semantic search tasks.
Specifications
Canonical IDnvidia-nemotron-3-8b-embed
TypeEmbedding
StatusActive
CreatorNVIDIANVIDIA
Input ModalitiesText
Output ModalitiesEmbedding
Parameters8B

Capabilities

Input1/5
Text
Image·
Audio·
Video·
PDF·
Output1/5
Text·
Image·
Audio·
Video·
Embedding
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Cheapest Instances to Run It

Cloud GPU instances that can host Nemotron 3 Embed 8B, ranked by cheapest on-demand price. The model needs about 19 GB of GPU memory at FP16 precision (estimated from its parameter count), so treat the fit as guidance rather than a guarantee.

All clouds
FP16 (full precision)
US Dollar ($)
Instance
Cloud
GPU
VRAM
Price
Cheapest region
g2-standard-4GCPnvidia-l424 GB$0.705/hr
g6.xlargeAWSL422 GB$0.805/hr
g2-standard-8GCPnvidia-l424 GB$0.851/hr
7 more instances can run Nemotron 3 Embed 8B
Unlock the full ranked list and FP8 / INT4 quantization with a CloudPrice subscription.

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Ministral 3 14B Instruct256K$0.200$0.200Available
Ministral 3 3B Instruct256K$0.100$0.100Available
Ministral 3 8B Instruct256K$0.150$0.150Available
Nemotron 3 Embed 8BCurrent

Model IDs

accounts/fireworks/models/nemotron-3-embed-8b-bf16
nvidia-nemotron-3-8b-embed