DeepSeek

deepseek/deepseek-flash

1M 上下文 · $0.1800 / M 输入 Token · $0.7200 / M 输出 Token

DeepSeek V4.1 Flash 是 OurToken 上的 DeepSeek 模型路由,适合需要原生图像理解、超长上下文和低成本生产流量的开发者。它接替已下线的 V4 Flash 系列,并通过 deepseek-flash 模型 ID 调用。

获取 API Key
24H 状态监控

历史可用性数据会随时间积累,当前状态反映最近一次健康检查结果。

价格

按量计费

无需预付,仅按实际使用量收费

60% of official price
输入$0.30 / M$0.1800 / M Token
输出$1.20 / M$0.7200 / M Token
缓存输入$0.006 / M$0.0036 / M Token
缓存写入$0 / M$0 / M Token

API 使用

API 接入指南

基础地址https://api.ourtoken.ai/v1
API 端点chat/completions
完整地址https://api.ourtoken.ai/v1/chat/completions
模型 IDdeepseek-flash
获取 API Key

代码示例

使用 OurToken API 端点调用该模型。下面的示例使用原生 HTTP 请求,并采用该模型家族推荐的接口格式。

curl https://api.ourtoken.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "deepseek-flash",
    "messages": [
      {
        "role": "user",
        "content": "Hello!"
      }
    ],
    "max_tokens": 256
  }'

Chat Completions API 参考

通过 OpenAI Chat Completions 兼容接口创建聊天响应。SDK 的 Base URL 使用 https://api.ourtoken.ai/v1,接口路径使用 POST /chat/completions。

认证方式

Content-Typeapplication/json
AuthorizationBearer YOUR_API_KEY

请求体

字段类型是否必填说明
modelstring必填要调用的模型 ID。
messagesarray<object>必填发送给模型的对话消息列表。
max_tokensinteger可选最大输出 Token 数。
temperaturenumber可选采样温度。
top_pnumber可选核采样参数。
streamboolean可选是否返回流式响应。
stream_optionsobject可选流式响应的附加选项。
toolsarray<object>可选提供给模型使用的工具列表。
tool_choicestring | object可选控制模型如何选择工具。
response_formatobject可选控制结构化输出,例如 JSON object 响应。

响应体

字段类型是否必填说明
idstring必填唯一的聊天补全响应标识。
object"chat.completion"必填Chat Completions API 返回的对象类型。
createdinteger必填响应创建时的 Unix 时间戳。
modelstring必填生成响应的模型。
choicesarray<object>必填模型返回的候选响应列表。
choices[].message.rolestring必填返回聊天消息的角色。
choices[].message.contentstring可选返回聊天消息中的文本内容。
choices[].finish_reasonstring可选生成停止的原因。
usageobject可选该聊天补全响应的 Token 用量信息。
usage.prompt_tokensinteger可选输入 Token 数。
usage.completion_tokensinteger可选输出 Token 数。
usage.total_tokensinteger可选总 Token 数。
usage.prompt_tokens_detailsobject可选输入 Token 用量明细。
usage.prompt_tokens_details.cached_tokensinteger可选从缓存命中的 Token 数。

模型介绍

DeepSeek deepseek-flash

DeepSeek V4.1 Flash 是 OurToken 上的 DeepSeek 模型路由,适合需要原生图像理解、超长上下文和低成本生产流量的开发者。它接替已下线的 V4 Flash 系列,并通过 deepseek-flash 模型 ID 调用。

DeepSeek V4.1 Flash 为团队提供更低成本的 DeepSeek 路由,具备 1M Token 上下文、原生图像理解能力和最高 384K 输出,适合需要长提示词和可预测价格的应用场景。 当你希望通过 OurToken 统一 API 测试 DeepSeek 工作流,同时在一个控制台中管理模型 ID、用量日志、缓存成本和价格评估时,可以使用 DeepSeek V4.1 Flash API。

亮点说明

  • 输入和输出 Token 为 DeepSeek V4.1 Flash 官方高峰参考价格的 60%。
  • 可通过与其它支持模型相同的 OurToken 端点完成 OpenAI 兼容 API 接入。
  • 1M Token 上下文与最高 384K 输出,适合长文档、代码仓库和多轮 agent。
  • 原生图像理解,视觉与文本提示词可以在同一个请求中提交。
  • 控制台日志和用量可见性帮助团队在上线后复盘请求成本。

关键特性

  • 模型 ID:deepseek-flash
  • OurToken 输入价格:每 1M Token $0.1800
  • OurToken 输出价格:每 1M Token $0.7200
  • OurToken 缓存读取价格:每 1M Token $0.0036
  • OurToken 缓存写入价格:每 1M Token $0
  • 提供商:DeepSeek

规格参数

提供商DeepSeek
模型类型多模态混合专家(MoE)大语言模型
模型 IDdeepseek-flash
总参数量552B(MoE)
激活参数量输入 8B / 输出 16B
上下文长度1M tokens
最大输出384K tokens
思考模式默认开启,可切换非思考模式
图像输入支持
OurToken 输入价格$0.1800 / 1M tokens
OurToken 输出价格$0.7200 / 1M tokens
OurToken 缓存读取价格$0.0036 / 1M tokens
OurToken 缓存写入价格$0 / 1M tokens
官方高峰输入参考价$0.30 / 1M tokens
官方高峰输出参考价$1.20 / 1M tokens
官方高峰缓存读取参考价$0.006 / 1M tokens

DeepSeek V4.1 Flash API 功能

在 OurToken 上获得 DeepSeek V4.1 Flash API 接入、价格透明度、模型 ID、上下文上限与开发者工作流支持。一条路由用同一个 key 覆盖聊天、编程和 agent 流量,用量日志与成本保持可见。

统一接入

通过 OurToken 统一端点调用 DeepSeek V4.1 Flash API,与其它支持模型共用同一个 OpenAI 兼容接口。一个 API key 即可覆盖 chat completions、responses 和 Anthropic 风格 messages,因此你可以在不维护单独 provider 集成路径的情况下,把 DeepSeek V4.1 Flash 与其它路由做对比。

价格透明

OurToken 列出 DeepSeek V4.1 Flash 每百万 Token 的输入、输出、缓存读取和缓存写入价格,并与官方高峰参考价并列展示。由于该模型缓存命中价格远低于缓存未命中、闲时低于高峰,扩容前先看这张表有助于预估支出。

1M 上下文

DeepSeek V4.1 Flash 支持 1M Token 上下文和最高 384K 输出,适合长文档、大型代码仓库和多轮 agent。在 OurToken 上提交长提示词时,可以观察缓存读取价格如何改变重复上下文的成本。

视觉与多模态输入

V4.1 Flash 是 DeepSeek 首个具备原生图像理解能力的 Flash 模型,一次 deepseek v4.1 flash api 调用即可把截图、扫描页或图表与文本指令一起提交。结合 1M 上下文,可用于文档审阅和视觉 QA 工作流。

思考模式与工具调用

该模型默认运行在思考模式,同时支持非思考模式、工具调用、JSON 输出和结构化响应。这一组合适合需要先推理任务、再返回可被应用校验的机器可读载荷的助手场景。

Agent 与编程工作流

把 Claude Code、Codex CLI 或 OpenCode 等编程 agent 指向 OurToken 端点,并选择 DeepSeek V4.1 Flash 作为模型。OurToken 为这些工具提供了配置指南,Responses API 与 Anthropic 兼容端点也能让已有 agent 集成继续可用。

如何在 OurToken 使用 DeepSeek V4.1 Flash

六步从新建 API key 走到生产流量:选择模型 ID、发送第一个请求、比较 DeepSeek V4.1 Flash API 价格,然后监控用量与成本。

创建 API Key

登录 OurToken,在 API Keys 页面创建 key,并把它保存到环境变量而不是提交进代码仓库。在围绕 DeepSeek V4.1 Flash 搭建集成之前,先确认 key 可用。

01

选择模型 ID

新集成请使用 deepseek-flash 作为 model 值。如果你已经在使用 deepseek-v4-flash 或 deepseek-v4-flash-vision-exp,这些名称仍可解析并由 V4.1 Flash 提供服务,因此可以等到下个发布周期再迁移。

02

发送第一个请求

先把客户端指向 OurToken 的 chat completions 端点,发送一条短提示词,再逐步增加复杂度。流式输出、system prompt 和多轮历史都遵循 OpenAI 请求结构,现有 SDK 代码通常只需改 base URL 和 model。

03

比较价格与缓存成本

查看 DeepSeek V4.1 Flash 价格表中的输入、输出和缓存读取,并注意闲时流量比高峰时段更便宜。然后按自己的提示词结构估算,因为在 agent 负载中缓存命中率决定了大部分账单。

04

配置思考模式与工具

决定每个工作负载使用思考模式还是非思考模式;如果响应要进入其它系统,再定义工具和 JSON schema。在确定默认值之前,请用同一批提示词对比两种设置。

05

监控用量与成本

上线后在 OurToken 控制台查看请求日志、Token 数量和按模型统计的成本。把延迟与质量和你现有路由做对比,并在 DeepSeek 调整官方价格后重新核对 DeepSeek V4.1 Flash API 价格。

06

DeepSeek V4.1 Flash FAQ

回答开发者在采用这条路由前最常问的问题:它是什么、多少钱、该用哪个模型 ID、支持哪些能力,以及 V4 Pro 变更对现有流量的影响。

01

DeepSeek V4.1 Flash API 是什么?

DeepSeek V4.1 Flash 是 deepseek-flash 这一 API 名称背后的模型,于 2026 年 9 月 10 日发布,是 DeepSeek 最新的 Flash 版本。它是 552B 参数的混合专家模型,输入激活 8B、输出激活 16B,具备 1M Token 上下文、最高 384K 输出和原生图像理解能力。OurToken 通过统一端点提供该模型。
02

DeepSeek V4.1 Flash API 价格是多少?

官方高峰价为每百万缓存未命中输入 Token $0.30、每百万输出 Token $1.20、每百万缓存命中输入 Token $0.006,闲时价格为高峰的一半。OurToken 上这条 DeepSeek V4.1 Flash API 路由按官方高峰价的 60% 计价,请以本页价格表展示的输入、输出、缓存读取和缓存写入数值为实际计费依据。
03

DeepSeek V4.1 Flash 应该使用哪个模型 ID?

新集成请使用 deepseek-flash,这是 DeepSeek 官方发布的名称。部分 provider 与博客会把同一个模型写成 deepseek-v4.1-flash 或 deepseek v4.1-flash,因此第三方文档里会出现这些写法,但它们并不是官方 API 取值。旧名称 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 仍可解析,并由 V4.1 Flash 提供服务。
04

在 OurToken 上如何调用 DeepSeek V4.1 Flash API?

创建 API key,把客户端指向 OurToken 端点,并传入 deepseek-flash 作为 model 值。请求遵循 OpenAI chat completions 结构;如果你的工具已经使用 responses 或 Anthropic 风格 messages,也可以直接沿用。随后把延迟、质量和成本与当前路由对比,再切换生产流量。
05

DeepSeek V4.1 Flash 适合编程和 agent 工作流吗?

对于编程助手和 agent 来说它是一个合理默认值:模型支持工具调用、JSON 输出、面向大型仓库的 1M Token 上下文,以及用于多步任务的思考模式。OurToken 提供了 Claude Code、Codex CLI 和 OpenCode 的配置指南,你可以直接在团队现有工具中测试。请用你自己的提示词衡量效果。
06

deepseek-v4-pro 会在 9 月 14 日停止工作吗?

从北京时间 2026 年 9 月 14 日 12:00 起,发往 deepseek-v4-pro 的请求会被路由到 V4.1 Flash 并按 Flash 价格计费,也就是名称仍可用,但背后的模型会变化。如果你需要稳定行为,请固定具体模型 ID,并在切换后用你的提示词重新测试。