GLM

glm/glm-5.3-flash

1.25M 上下文 · $0.0900 / M 输入 Token · $0.3000 / M 输出 Token

GLM 5.3 Flash 是 GLM 5 系列首个原生多模态模型,在 OurToken 上作为高性价比路由,适合开发者评估托管接入、编程智能体、视觉语言任务、长上下文工作、价格与生产负载。

获取 API Key
24H 状态监控

历史可用性数据会随时间积累,当前状态反映最近一次健康检查结果。

价格

按量计费

无需预付,仅按实际使用量收费

60% of official price
输入$0.15 / M$0.0900 / M Token
输出$0.50 / M$0.3000 / M Token
缓存输入$0.03 / M$0.0180 / M Token
缓存写入$0 / M$0 / M Token

API 使用

API 接入指南

基础地址https://api.ourtoken.ai/v1
API 端点chat/completions
完整地址https://api.ourtoken.ai/v1/chat/completions
模型 IDglm-5.3-flash
获取 API Key

代码示例

使用 OurToken API 端点调用该模型。下面的示例使用原生 HTTP 请求,并采用该模型家族推荐的接口格式。

curl https://api.ourtoken.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [
      {
        "role": "user",
        "content": "Hello!"
      }
    ],
    "max_tokens": 256
  }'

Chat Completions API 参考

通过 OpenAI Chat Completions 兼容接口创建聊天响应。SDK 的 Base URL 使用 https://api.ourtoken.ai/v1,接口路径使用 POST /chat/completions。

认证方式

Content-Typeapplication/json
AuthorizationBearer YOUR_API_KEY

请求体

字段类型是否必填说明
modelstring必填要调用的模型 ID。
messagesarray<object>必填发送给模型的对话消息列表。
max_tokensinteger可选最大输出 Token 数。
temperaturenumber可选采样温度。
top_pnumber可选核采样参数。
streamboolean可选是否返回流式响应。
stream_optionsobject可选流式响应的附加选项。
toolsarray<object>可选提供给模型使用的工具列表。
tool_choicestring | object可选控制模型如何选择工具。
response_formatobject可选控制结构化输出,例如 JSON object 响应。

响应体

字段类型是否必填说明
idstring必填唯一的聊天补全响应标识。
object"chat.completion"必填Chat Completions API 返回的对象类型。
createdinteger必填响应创建时的 Unix 时间戳。
modelstring必填生成响应的模型。
choicesarray<object>必填模型返回的候选响应列表。
choices[].message.rolestring必填返回聊天消息的角色。
choices[].message.contentstring可选返回聊天消息中的文本内容。
choices[].finish_reasonstring可选生成停止的原因。
usageobject可选该聊天补全响应的 Token 用量信息。
usage.prompt_tokensinteger可选输入 Token 数。
usage.completion_tokensinteger可选输出 Token 数。
usage.total_tokensinteger可选总 Token 数。
usage.prompt_tokens_detailsobject可选输入 Token 用量明细。
usage.prompt_tokens_details.cached_tokensinteger可选从缓存命中的 Token 数。

模型介绍

GLM glm-5.3-flash

GLM 5.3 Flash 是 GLM 5 系列首个原生多模态模型,在 OurToken 上作为高性价比路由,适合开发者评估托管接入、编程智能体、视觉语言任务、长上下文工作、价格与生产负载。

GLM 5.3 Flash 以 320B 总参数、仅 18B 激活参数,在多模态、编程与长上下文负载上接近 GLM-5 代能力,同时大幅降低服务成本。 当你想用一个端点完成模型测试、价格查看、API key、用量日志与生产接入时,可以通过 OurToken 调用 glm 5.3 flash api。

亮点说明

  • 输入、输出与 cache read token 均按官方 GLM 5.3 Flash 参考价的 60% 计价。
  • 通过与其他受支持模型相同的 OurToken 端点即可完成 OpenAI 兼容接入。
  • GLM 5 系列首个原生多模态模型,以 18B 激活参数支持文本与视觉输入。
  • 稀疏与线性注意力混合架构,配合长上下文窗口降低服务成本。
  • Dashboard 日志与用量可见性便于团队在启动后比较请求成本。

关键特性

  • 模型 ID:glm-5.3-flash
  • OurToken 输入价格:每 1M tokens $0.0900
  • OurToken 输出价格:每 1M tokens $0.3000
  • OurToken cache read 价格:每 1M tokens $0.0180
  • OurToken cache write 价格:每 1M tokens $0
  • 提供商:GLM

规格参数

提供商GLM
模型类型多模态大模型 (LLM + VLM)
模型 IDglm-5.3-flash
OurToken 输入价格$0.0900 / 1M tokens
OurToken 输出价格$0.3000 / 1M tokens
OurToken Cache Read 价格$0.0180 / 1M tokens
OurToken Cache Write 价格$0 / 1M tokens
官方输入参考价$0.15 / 1M tokens
官方输出参考价$0.50 / 1M tokens
官方 Cache Read 参考价$0.03 / 1M tokens

面向开发者的 glm 5.3 flash api 功能

使用 glm 5.3 flash api 获得统一 GLM 接入、glm 5.3 flash pricing 可见性、多模态评估、高性价比编程与生产工作流测试。

统一接入

通过 OurToken 统一端点调用 glm 5.3 flash api,无需单独维护 GLM provider 集成。开发者可以创建一个 API key,使用 glm-5.3-flash 作为模型 ID,并在测试和生产中复用 OpenAI 兼容请求模式。

价格可见性

在路由流量前查看 glm 5.3 flash pricing:OurToken 列出每 1M tokens 输入 $0.0900、输出 $0.3000、cache read $0.0180,cache write 记为 $0,便于团队估算提示词与智能体工作负载成本。

多模态输入

在图片与文档理解、视觉推理以及文本-视觉混合提示上评估 GLM 5 系列首个原生多模态模型,同时覆盖常规聊天与编程任务。

高性价比编程

用仓库任务、coding-plan 会话与 OpenCode 风格开发提示测试 GLM 5.3 Flash。凭借 18B 激活参数,它面向接近旗舰级的编程与智能体能力,同时保持更低的服务成本。

长上下文工作

借助稀疏与线性注意力长上下文窗口处理大型代码库与长程会话,降低长上下文服务成本。

提供商对比

评估提供商选择时,可将 OurToken 托管接入与其他 GLM provider 列表对比。OurToken 聚焦 API key、用量日志、价格可见性与统一端点,而非单独的 provider 配置。

如何在 OurToken 使用 glm 5.3 flash api

创建 API key,复制 glm-5.3-flash,比较 glm 5.3 flash pricing,调用统一端点,并测试编程工作流。

创建密钥

在 dashboard 创建 OurToken API key,并保存到安全的服务端环境变量。这样后端可以稳定访问 glm 5.3 flash api,而不会在浏览器代码、笔记本或公开仓库中暴露凭据。

01

复制模型

在请求体中使用 glm-5.3-flash 作为 model 值。把准确的 GLM 5.3 Flash 模型 ID 放进配置,有助于开发者在比较本地测试、预发布流量和生产路由时避免命名错误。

02

调用端点

使用 API key、模型 ID 与提示词负载,向 OurToken 统一 API 端点发送 chat completion 请求。现有的 OpenAI 兼容请求模式通常只需修改 base URL、凭据与 model 值即可复用。

03

比较价格

在扩展流量前比较 glm 5.3 flash pricing:OurToken 列出每 1M tokens 输入 $0.0900、输出 $0.3000、cache read $0.0180。Cache write 记为 $0,请把已缓存提示与普通输入、输出分开统计。

04

测试编程

用自己的 glm 5.3 flash 编程计划运行仓库任务、一次性应用构建、OpenCode 风格智能体会话与回归提示,并结合 18B 激活参数的定位记录延迟、质量与成本。

05

监控用量

上线后,在历史日志中查看请求数、输入 token、输出 token、cache read token 与花费。这有助于团队比较 glm 5.3 flash 模型在真实流量下的表现,而不是只看 benchmark 帖子或 provider 列表。

06

glm 5.3 flash api 常见问题

解答 glm 5.3 flash api 接入、glm-5.3-flash 模型 ID、价格、模型架构、编程工作流与提供商对比问题。

01

什么是 glm 5.3 flash api?

glm 5.3 flash api 是 OurToken 上可用的 GLM 5.3 Flash 模型路由,面向希望以高性价比托管接入 GLM 5 系列首个原生多模态模型的开发者。你可以用 glm-5.3-flash 模型 ID 和 OurToken API key,通过统一 API 流程调用。
02

OurToken 上 glm 5.3 flash 的价格是多少?

OurToken 上 glm 5.3 flash 的价格为每 1M input tokens $0.0900、每 1M output tokens $0.3000。目录同时列出 cache read 每 1M tokens $0.0180、cache write $0,官方参考价为输入 $0.15、输出 $0.50、cache read $0.03。
03

GLM 5.3 Flash 应使用哪个模型 ID?

API 请求中请使用 glm-5.3-flash 作为精确 model 值。在开发、预发布和生产环境保持模型 ID 不变,可以避免团队比较 GLM 5.3 Flash 模型行为、价格、延迟和编程质量时出现路由不一致。
04

GLM 5.3 Flash 使用什么架构?

GLM 5.3 Flash 拥有 320B 总参数,每次前向仅激活 18B,引入了稀疏与线性注意力混合架构以降低长上下文服务成本。据官方资料,它在编程与智能体任务上接近 GLM-5 级表现,同时保持高性价比。
05

可以通过 OurToken 测试 GLM 5.3 Flash 编程工作流吗?

可以。你可以通过 OurToken 调用 glm-5.3-flash,并使用真实仓库提示词、工具调用任务和 coding-plan 会话测试 GLM 5.3 Flash 编程工作流。请按自己的验收标准比较输出质量、延迟、token 用量和失败模式。
06

GLM 5.3 Flash 是多模态模型吗?

是的。GLM 5.3 Flash 是 GLM 5 系列首个原生多模态模型,使用 30T token 多模态语料训练,支持文本与视觉输入,适合图片理解、文档处理与文本-视觉混合智能体任务。