Phi-3.5 Vision Instruct is Microsoft's language model with a 128K context window and up to 4K output tokens. An instruction-tuned multimodal Phi-3.5 model with vision capabilities for image understanding and visual question answering.
Specifications
Canonical IDmicrosoft-phi-3-5-vision-instruct
TypeLanguage
StatusActive
CreatorMicrosoftMicrosoft
Providers
Context Window128K tokens
Max Output4K tokens
Input ModalitiesImage
Output ModalitiesText

Capabilities

Input1/5
Text·
Image✓
Audio·
Video·
PDF·
Output1/5
Text✓
Image·
Audio·
Video·
Embedding·
Capabilities0/13
Reasoning·
Adaptive Reasoning·
Function Calling·
Parallel Function Calling·
Structured Outputs·
Native JSON Schema·
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandard
Input
$ / 1M
Output
$ / 1M
Azure AI Foundry logo
Azure AI Foundry
microsoft:phi35vinstruct
$0.13$0.52

Cost Calculator

US Dollar ($)
Preset:

Versions

VersionReleasedContextInput / 1MOutput / 1MStatus
Phi-4 Mini Instruct131K$0.075$0.300Deprecated
Phi-416K$0.070$0.140Available
Phi-4 Mini————Available
Phi-4 Multimodal————Available
Phi-4 Eagle————Available
Phi-4 Mini MM————Available
Phi-4 Mini Reasoning—131K——Available
Phi-4 Multimodal Instruct—131K$0.080$0.320Available
Phi-4 Reasoning—33K——Available
Phi-4 Reasoning Plus————Available
Phi-3.5 Vision Instruct—128K——Current

Model IDs

azure_ai/Phi-3.5-vision-instruct
microsoft-phi-3-5-vision-instruct