- deepseek/deepseek-flash
deepseek/deepseek-flash
1M 上下文 · $0.1800 / M 输入 Token · $0.7200 / M 输出 Token
DeepSeek V4.1 Flash 是 OurToken 上的 DeepSeek 模型路由,适合需要原生图像理解、超长上下文和低成本生产流量的开发者。它接替已下线的 V4 Flash 系列,并通过 deepseek-flash 模型 ID 调用。
历史可用性数据会随时间积累,当前状态反映最近一次健康检查结果。
价格
按量计费
无需预付,仅按实际使用量收费
API 使用
API 接入指南
代码示例
使用 OurToken API 端点调用该模型。下面的示例使用原生 HTTP 请求,并采用该模型家族推荐的接口格式。
curl https://api.ourtoken.ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "deepseek-flash",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"max_tokens": 256
}'Chat Completions API 参考
通过 OpenAI Chat Completions 兼容接口创建聊天响应。SDK 的 Base URL 使用 https://api.ourtoken.ai/v1,接口路径使用 POST /chat/completions。
认证方式
| Content-Type | application/json |
| Authorization | Bearer YOUR_API_KEY |
请求体
| 字段 | 类型 | 是否必填 | 说明 |
|---|---|---|---|
| model | string | 必填 | 要调用的模型 ID。 |
| messages | array<object> | 必填 | 发送给模型的对话消息列表。 |
| max_tokens | integer | 可选 | 最大输出 Token 数。 |
| temperature | number | 可选 | 采样温度。 |
| top_p | number | 可选 | 核采样参数。 |
| stream | boolean | 可选 | 是否返回流式响应。 |
| stream_options | object | 可选 | 流式响应的附加选项。 |
| tools | array<object> | 可选 | 提供给模型使用的工具列表。 |
| tool_choice | string | object | 可选 | 控制模型如何选择工具。 |
| response_format | object | 可选 | 控制结构化输出,例如 JSON object 响应。 |
响应体
| 字段 | 类型 | 是否必填 | 说明 |
|---|---|---|---|
| id | string | 必填 | 唯一的聊天补全响应标识。 |
| object | "chat.completion" | 必填 | Chat Completions API 返回的对象类型。 |
| created | integer | 必填 | 响应创建时的 Unix 时间戳。 |
| model | string | 必填 | 生成响应的模型。 |
| choices | array<object> | 必填 | 模型返回的候选响应列表。 |
| choices[].message.role | string | 必填 | 返回聊天消息的角色。 |
| choices[].message.content | string | 可选 | 返回聊天消息中的文本内容。 |
| choices[].finish_reason | string | 可选 | 生成停止的原因。 |
| usage | object | 可选 | 该聊天补全响应的 Token 用量信息。 |
| usage.prompt_tokens | integer | 可选 | 输入 Token 数。 |
| usage.completion_tokens | integer | 可选 | 输出 Token 数。 |
| usage.total_tokens | integer | 可选 | 总 Token 数。 |
| usage.prompt_tokens_details | object | 可选 | 输入 Token 用量明细。 |
| usage.prompt_tokens_details.cached_tokens | integer | 可选 | 从缓存命中的 Token 数。 |
模型介绍
DeepSeek deepseek-flash
DeepSeek V4.1 Flash 是 OurToken 上的 DeepSeek 模型路由,适合需要原生图像理解、超长上下文和低成本生产流量的开发者。它接替已下线的 V4 Flash 系列,并通过 deepseek-flash 模型 ID 调用。
DeepSeek V4.1 Flash 为团队提供更低成本的 DeepSeek 路由,具备 1M Token 上下文、原生图像理解能力和最高 384K 输出,适合需要长提示词和可预测价格的应用场景。 当你希望通过 OurToken 统一 API 测试 DeepSeek 工作流,同时在一个控制台中管理模型 ID、用量日志、缓存成本和价格评估时,可以使用 DeepSeek V4.1 Flash API。
亮点说明
- 输入和输出 Token 为 DeepSeek V4.1 Flash 官方高峰参考价格的 60%。
- 可通过与其它支持模型相同的 OurToken 端点完成 OpenAI 兼容 API 接入。
- 1M Token 上下文与最高 384K 输出,适合长文档、代码仓库和多轮 agent。
- 原生图像理解,视觉与文本提示词可以在同一个请求中提交。
- 控制台日志和用量可见性帮助团队在上线后复盘请求成本。
关键特性
- 模型 ID:deepseek-flash
- OurToken 输入价格:每 1M Token $0.1800
- OurToken 输出价格:每 1M Token $0.7200
- OurToken 缓存读取价格:每 1M Token $0.0036
- OurToken 缓存写入价格:每 1M Token $0
- 提供商:DeepSeek
规格参数
DeepSeek V4.1 Flash API 功能
在 OurToken 上获得 DeepSeek V4.1 Flash API 接入、价格透明度、模型 ID、上下文上限与开发者工作流支持。一条路由用同一个 key 覆盖聊天、编程和 agent 流量,用量日志与成本保持可见。
统一接入
通过 OurToken 统一端点调用 DeepSeek V4.1 Flash API,与其它支持模型共用同一个 OpenAI 兼容接口。一个 API key 即可覆盖 chat completions、responses 和 Anthropic 风格 messages,因此你可以在不维护单独 provider 集成路径的情况下,把 DeepSeek V4.1 Flash 与其它路由做对比。
价格透明
OurToken 列出 DeepSeek V4.1 Flash 每百万 Token 的输入、输出、缓存读取和缓存写入价格,并与官方高峰参考价并列展示。由于该模型缓存命中价格远低于缓存未命中、闲时低于高峰,扩容前先看这张表有助于预估支出。
1M 上下文
DeepSeek V4.1 Flash 支持 1M Token 上下文和最高 384K 输出,适合长文档、大型代码仓库和多轮 agent。在 OurToken 上提交长提示词时,可以观察缓存读取价格如何改变重复上下文的成本。
视觉与多模态输入
V4.1 Flash 是 DeepSeek 首个具备原生图像理解能力的 Flash 模型,一次 deepseek v4.1 flash api 调用即可把截图、扫描页或图表与文本指令一起提交。结合 1M 上下文,可用于文档审阅和视觉 QA 工作流。
思考模式与工具调用
该模型默认运行在思考模式,同时支持非思考模式、工具调用、JSON 输出和结构化响应。这一组合适合需要先推理任务、再返回可被应用校验的机器可读载荷的助手场景。
Agent 与编程工作流
把 Claude Code、Codex CLI 或 OpenCode 等编程 agent 指向 OurToken 端点,并选择 DeepSeek V4.1 Flash 作为模型。OurToken 为这些工具提供了配置指南,Responses API 与 Anthropic 兼容端点也能让已有 agent 集成继续可用。
如何在 OurToken 使用 DeepSeek V4.1 Flash
六步从新建 API key 走到生产流量:选择模型 ID、发送第一个请求、比较 DeepSeek V4.1 Flash API 价格,然后监控用量与成本。
创建 API Key
登录 OurToken,在 API Keys 页面创建 key,并把它保存到环境变量而不是提交进代码仓库。在围绕 DeepSeek V4.1 Flash 搭建集成之前,先确认 key 可用。
01选择模型 ID
新集成请使用 deepseek-flash 作为 model 值。如果你已经在使用 deepseek-v4-flash 或 deepseek-v4-flash-vision-exp,这些名称仍可解析并由 V4.1 Flash 提供服务,因此可以等到下个发布周期再迁移。
02发送第一个请求
先把客户端指向 OurToken 的 chat completions 端点,发送一条短提示词,再逐步增加复杂度。流式输出、system prompt 和多轮历史都遵循 OpenAI 请求结构,现有 SDK 代码通常只需改 base URL 和 model。
03比较价格与缓存成本
查看 DeepSeek V4.1 Flash 价格表中的输入、输出和缓存读取,并注意闲时流量比高峰时段更便宜。然后按自己的提示词结构估算,因为在 agent 负载中缓存命中率决定了大部分账单。
04配置思考模式与工具
决定每个工作负载使用思考模式还是非思考模式;如果响应要进入其它系统,再定义工具和 JSON schema。在确定默认值之前,请用同一批提示词对比两种设置。
05监控用量与成本
上线后在 OurToken 控制台查看请求日志、Token 数量和按模型统计的成本。把延迟与质量和你现有路由做对比,并在 DeepSeek 调整官方价格后重新核对 DeepSeek V4.1 Flash API 价格。
06DeepSeek V4.1 Flash FAQ
回答开发者在采用这条路由前最常问的问题:它是什么、多少钱、该用哪个模型 ID、支持哪些能力,以及 V4 Pro 变更对现有流量的影响。