GLM Flash Latest is Zhipu AI's language model with a 1.3M context window and up to 131K output tokens, starting at $0.075 / 1M input and $0.25 / 1M output. A lightweight, fast-inference variant of Zhipu's GLM large language model family designed for high-throughput conversational applications.
Specifications
Canonical IDzhipu-glm-flash
TypeLanguage
StatusActive
CreatorZhipu AIZhipu AI
Providers
Context Window1.3M tokens
Max Output131K tokens
Input ModalitiesImageTextVideo
Output ModalitiesText
Reasoning Effortsdefault
Release Date · 7 days ago
Deprecation Date

Capabilities

Input3/5
Text
Image
Audio·
Video
PDF·
Output1/5
Text
Image·
Audio·
Video·
Embedding·
Capabilities4/13
Reasoning
Adaptive Reasoning·
Function Calling
Parallel Function Calling·
Structured Outputs
Native JSON Schema
Web Search·
URL Context·
Computer Use·
Code Execution·
File Search·
Prompt Caching·
Assistant Prefill·

Pricing by Provider

US Dollar ($)
Per 1M tokens
ProviderStandard
Input
$ / 1M
Output
$ / 1M
Cache Read
$ / 1M
OpenRouter logo
OpenRouter
~z-ai/glm-flash-latest
$0.075$0.25$0.015

Cost Calculator

US Dollar ($)
Preset:

Other Models

ModelTierReleasedContextInput / 1MOutput / 1M
GigaChat 2128K
GigaChat 2 LiteLite128K
GigaChat 2 MaxMax128K
GigaChat 2 ProPro128K

Model IDs

~z-ai/glm-flash-latest
zhipu-glm-flash