- glm/glm-5.3-flash
glm/glm-5.3-flash
1.25M 上下文 · $0.0900 / M 输入 Token · $0.3000 / M 输出 Token
GLM 5.3 Flash 是 GLM 5 系列首个原生多模态模型,在 OurToken 上作为高性价比路由,适合开发者评估托管接入、编程智能体、视觉语言任务、长上下文工作、价格与生产负载。
历史可用性数据会随时间积累,当前状态反映最近一次健康检查结果。
价格
按量计费
无需预付,仅按实际使用量收费
API 使用
API 接入指南
代码示例
使用 OurToken API 端点调用该模型。下面的示例使用原生 HTTP 请求,并采用该模型家族推荐的接口格式。
curl https://api.ourtoken.ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "glm-5.3-flash",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"max_tokens": 256
}'Chat Completions API 参考
通过 OpenAI Chat Completions 兼容接口创建聊天响应。SDK 的 Base URL 使用 https://api.ourtoken.ai/v1,接口路径使用 POST /chat/completions。
认证方式
| Content-Type | application/json |
| Authorization | Bearer YOUR_API_KEY |
请求体
| 字段 | 类型 | 是否必填 | 说明 |
|---|---|---|---|
| model | string | 必填 | 要调用的模型 ID。 |
| messages | array<object> | 必填 | 发送给模型的对话消息列表。 |
| max_tokens | integer | 可选 | 最大输出 Token 数。 |
| temperature | number | 可选 | 采样温度。 |
| top_p | number | 可选 | 核采样参数。 |
| stream | boolean | 可选 | 是否返回流式响应。 |
| stream_options | object | 可选 | 流式响应的附加选项。 |
| tools | array<object> | 可选 | 提供给模型使用的工具列表。 |
| tool_choice | string | object | 可选 | 控制模型如何选择工具。 |
| response_format | object | 可选 | 控制结构化输出,例如 JSON object 响应。 |
响应体
| 字段 | 类型 | 是否必填 | 说明 |
|---|---|---|---|
| id | string | 必填 | 唯一的聊天补全响应标识。 |
| object | "chat.completion" | 必填 | Chat Completions API 返回的对象类型。 |
| created | integer | 必填 | 响应创建时的 Unix 时间戳。 |
| model | string | 必填 | 生成响应的模型。 |
| choices | array<object> | 必填 | 模型返回的候选响应列表。 |
| choices[].message.role | string | 必填 | 返回聊天消息的角色。 |
| choices[].message.content | string | 可选 | 返回聊天消息中的文本内容。 |
| choices[].finish_reason | string | 可选 | 生成停止的原因。 |
| usage | object | 可选 | 该聊天补全响应的 Token 用量信息。 |
| usage.prompt_tokens | integer | 可选 | 输入 Token 数。 |
| usage.completion_tokens | integer | 可选 | 输出 Token 数。 |
| usage.total_tokens | integer | 可选 | 总 Token 数。 |
| usage.prompt_tokens_details | object | 可选 | 输入 Token 用量明细。 |
| usage.prompt_tokens_details.cached_tokens | integer | 可选 | 从缓存命中的 Token 数。 |
模型介绍
GLM glm-5.3-flash
GLM 5.3 Flash 是 GLM 5 系列首个原生多模态模型,在 OurToken 上作为高性价比路由,适合开发者评估托管接入、编程智能体、视觉语言任务、长上下文工作、价格与生产负载。
GLM 5.3 Flash 以 320B 总参数、仅 18B 激活参数,在多模态、编程与长上下文负载上接近 GLM-5 代能力,同时大幅降低服务成本。 当你想用一个端点完成模型测试、价格查看、API key、用量日志与生产接入时,可以通过 OurToken 调用 glm 5.3 flash api。
亮点说明
- 输入、输出与 cache read token 均按官方 GLM 5.3 Flash 参考价的 60% 计价。
- 通过与其他受支持模型相同的 OurToken 端点即可完成 OpenAI 兼容接入。
- GLM 5 系列首个原生多模态模型,以 18B 激活参数支持文本与视觉输入。
- 稀疏与线性注意力混合架构,配合长上下文窗口降低服务成本。
- Dashboard 日志与用量可见性便于团队在启动后比较请求成本。
关键特性
- 模型 ID:glm-5.3-flash
- OurToken 输入价格:每 1M tokens $0.0900
- OurToken 输出价格:每 1M tokens $0.3000
- OurToken cache read 价格:每 1M tokens $0.0180
- OurToken cache write 价格:每 1M tokens $0
- 提供商:GLM
规格参数
面向开发者的 glm 5.3 flash api 功能
使用 glm 5.3 flash api 获得统一 GLM 接入、glm 5.3 flash pricing 可见性、多模态评估、高性价比编程与生产工作流测试。
统一接入
通过 OurToken 统一端点调用 glm 5.3 flash api,无需单独维护 GLM provider 集成。开发者可以创建一个 API key,使用 glm-5.3-flash 作为模型 ID,并在测试和生产中复用 OpenAI 兼容请求模式。
价格可见性
在路由流量前查看 glm 5.3 flash pricing:OurToken 列出每 1M tokens 输入 $0.0900、输出 $0.3000、cache read $0.0180,cache write 记为 $0,便于团队估算提示词与智能体工作负载成本。
多模态输入
在图片与文档理解、视觉推理以及文本-视觉混合提示上评估 GLM 5 系列首个原生多模态模型,同时覆盖常规聊天与编程任务。
高性价比编程
用仓库任务、coding-plan 会话与 OpenCode 风格开发提示测试 GLM 5.3 Flash。凭借 18B 激活参数,它面向接近旗舰级的编程与智能体能力,同时保持更低的服务成本。
长上下文工作
借助稀疏与线性注意力长上下文窗口处理大型代码库与长程会话,降低长上下文服务成本。
提供商对比
评估提供商选择时,可将 OurToken 托管接入与其他 GLM provider 列表对比。OurToken 聚焦 API key、用量日志、价格可见性与统一端点,而非单独的 provider 配置。
如何在 OurToken 使用 glm 5.3 flash api
创建 API key,复制 glm-5.3-flash,比较 glm 5.3 flash pricing,调用统一端点,并测试编程工作流。
创建密钥
在 dashboard 创建 OurToken API key,并保存到安全的服务端环境变量。这样后端可以稳定访问 glm 5.3 flash api,而不会在浏览器代码、笔记本或公开仓库中暴露凭据。
01复制模型
在请求体中使用 glm-5.3-flash 作为 model 值。把准确的 GLM 5.3 Flash 模型 ID 放进配置,有助于开发者在比较本地测试、预发布流量和生产路由时避免命名错误。
02调用端点
使用 API key、模型 ID 与提示词负载,向 OurToken 统一 API 端点发送 chat completion 请求。现有的 OpenAI 兼容请求模式通常只需修改 base URL、凭据与 model 值即可复用。
03比较价格
在扩展流量前比较 glm 5.3 flash pricing:OurToken 列出每 1M tokens 输入 $0.0900、输出 $0.3000、cache read $0.0180。Cache write 记为 $0,请把已缓存提示与普通输入、输出分开统计。
04测试编程
用自己的 glm 5.3 flash 编程计划运行仓库任务、一次性应用构建、OpenCode 风格智能体会话与回归提示,并结合 18B 激活参数的定位记录延迟、质量与成本。
05监控用量
上线后,在历史日志中查看请求数、输入 token、输出 token、cache read token 与花费。这有助于团队比较 glm 5.3 flash 模型在真实流量下的表现,而不是只看 benchmark 帖子或 provider 列表。
06glm 5.3 flash api 常见问题
解答 glm 5.3 flash api 接入、glm-5.3-flash 模型 ID、价格、模型架构、编程工作流与提供商对比问题。