DeepSeek

deepseek/deepseek-flash

1M contexto · $0.1800 / M tokens de entrada · $0.7200 / M tokens de saída

DeepSeek V4.1 Flash é uma rota de modelo DeepSeek na OurToken para desenvolvedores que precisam de compreensão nativa de imagens, contexto muito longo e tráfego de produção com bom custo-benefício. Ele substitui a linha V4 Flash descontinuada e é chamado pelo model ID deepseek-flash.

Obter chave de API
Monitor de Status 24H

Dados históricos de disponibilidade são coletados ao longo do tempo. O status atual reflete a última verificação.

Preços

Pagamento por uso

Sem custo inicial; pague apenas pelo que usar

60% of official price
Entrada$0.30 / M$0.1800 / M Tokens
Saída$1.20 / M$0.7200 / M Tokens
Entrada em cache$0.006 / M$0.0036 / M Tokens
Gravação de cache$0 / M$0 / M Tokens

Uso da API

Guia de acesso à API

URL basehttps://api.ourtoken.ai/v1
Endpoint da APIchat/completions
URL completahttps://api.ourtoken.ai/v1/chat/completions
ID do modelodeepseek-flash
Obter chave de API

Exemplos de código

Use o endpoint da API OurToken para este modelo. Os exemplos abaixo usam requisições HTTP diretas e o endpoint recomendado para a família do modelo.

curl https://api.ourtoken.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "deepseek-flash",
    "messages": [
      {
        "role": "user",
        "content": "Hello!"
      }
    ],
    "max_tokens": 256
  }'

Referência da API Chat Completions

Crie uma resposta de chat com o endpoint compatível com OpenAI Chat Completions. Use https://api.ourtoken.ai/v1 como SDK Base URL e POST /chat/completions como endpoint.

Autorização

Content-Typeapplication/json
AuthorizationBearer YOUR_API_KEY

Corpo da requisição

CampoTipoObrigatórioDescrição
modelstringObrigatórioModel ID a chamar.
messagesarray<object>ObrigatórioMensagens da conversa enviadas ao modelo.
max_tokensintegerOpcionalNúmero máximo de tokens de saída.
temperaturenumberOpcionalTemperatura de amostragem.
top_pnumberOpcionalParâmetro de nucleus sampling.
streambooleanOpcionalDefine se a resposta será retornada em streaming.
stream_optionsobjectOpcionalOpções adicionais para respostas em streaming.
toolsarray<object>OpcionalTools disponíveis para o modelo.
tool_choicestring | objectOpcionalControla como o modelo seleciona tools.
response_formatobjectOpcionalControla saída estruturada, como respostas em objeto JSON.

Corpo da resposta

CampoTipoObrigatórioDescrição
idstringObrigatórioIdentificador único da chat completion.
object"chat.completion"ObrigatórioTipo de objeto retornado pela API Chat Completions.
createdintegerObrigatórioTimestamp Unix de criação da resposta.
modelstringObrigatórioModelo que gerou a resposta.
choicesarray<object>ObrigatórioRespostas candidatas retornadas pelo modelo.
choices[].message.rolestringObrigatórioRole da mensagem de chat retornada.
choices[].message.contentstringOpcionalConteúdo de texto na mensagem de chat retornada.
choices[].finish_reasonstringOpcionalMotivo pelo qual a geração parou.
usageobjectOpcionalInformações de uso de tokens da chat completion.
usage.prompt_tokensintegerOpcionalContagem de tokens de entrada.
usage.completion_tokensintegerOpcionalContagem de tokens de saída.
usage.total_tokensintegerOpcionalContagem total de tokens.
usage.prompt_tokens_detailsobjectOpcionalDetalhamento do uso de tokens de entrada.
usage.prompt_tokens_details.cached_tokensintegerOpcionalTokens servidos a partir de cache.

Introdução ao modelo

DeepSeek deepseek-flash

DeepSeek V4.1 Flash é uma rota de modelo DeepSeek na OurToken para desenvolvedores que precisam de compreensão nativa de imagens, contexto muito longo e tráfego de produção com bom custo-benefício. Ele substitui a linha V4 Flash descontinuada e é chamado pelo model ID deepseek-flash.

DeepSeek V4.1 Flash dá aos times uma rota DeepSeek de menor custo com janela de contexto de 1M tokens, compreensão nativa de imagens e até 384K tokens de saída para aplicações que exigem prompts longos e preços previsíveis. Use a API DeepSeek V4.1 Flash quando quiser testar workflows DeepSeek pela API unificada da OurToken, mantendo model IDs, logs de uso, custos de cache e revisão de preços em um só dashboard.

Por que ele se destaca

  • 60% do preço de pico oficial de referência do DeepSeek V4.1 Flash para tokens de entrada e saída.
  • Setup de API compatível com OpenAI pelo mesmo endpoint da OurToken usado por outros modelos suportados.
  • Uma janela de contexto de 1M tokens com até 384K tokens de saída para documentos longos, repositórios e agentes multi-turno.
  • Compreensão nativa de imagens, permitindo que prompts de visão e texto viajem em uma única request.
  • Logs no dashboard e visibilidade de uso ajudam times a revisar o custo de requests após o lançamento.

Principais recursos

  • Model ID: deepseek-flash
  • Preço de entrada: $0.1800 por 1M tokens na OurToken
  • Preço de saída: $0.7200 por 1M tokens na OurToken
  • Preço de cache read: $0.0036 por 1M tokens na OurToken
  • Preço de cache write: $0 por 1M tokens na OurToken
  • Provedor: DeepSeek

Especificações

ProvedorDeepSeek
Tipo de modeloLLM multimodal Mixture-of-Experts (MoE)
Model IDdeepseek-flash
Total de parâmetros552B (MoE)
Parâmetros ativos8B entrada / 16B saída
Comprimento de contexto1M tokens
Saída máxima384K tokens
Modo de raciocínioAtivado por padrão, non-thinking opcional
Entrada de imagemSuportada
Preço de entrada OurToken$0.1800 / 1M tokens
Preço de saída OurToken$0.7200 / 1M tokens
Preço de cache read OurToken$0.0036 / 1M tokens
Preço de cache write OurToken$0 / 1M tokens
Referência oficial de entrada (pico)$0.30 / 1M tokens
Referência oficial de saída (pico)$1.20 / 1M tokens
Referência oficial de cache read (pico)$0.006 / 1M tokens

Recursos da API DeepSeek V4.1 Flash

A OurToken cobre acesso à API DeepSeek V4.1 Flash, preços, model ID, limites de contexto e workflow de desenvolvimento. Esta rota mantém uma única chave para tráfego de chat, coding e agentes, com logs de uso e custo visíveis.

Acesso unificado à API

Chame a API DeepSeek V4.1 Flash pelo mesmo endpoint compatível com OpenAI que a OurToken usa para todos os modelos suportados. Uma chave de API cobre chat completions, responses e mensagens no estilo Anthropic, para que você compare o DeepSeek V4.1 Flash com outras rotas sem manter um caminho de integração separado por provedor.

Preços de tokens transparentes

A OurToken lista o preço do DeepSeek V4.1 Flash por milhão de tokens para entrada, saída, cache read e cache write, ao lado do preço de pico oficial de referência. Como o modelo cobra cache hits muito abaixo de cache misses e tráfego fora de pico abaixo do pico, conferir essa tabela antes de escalar ajuda a prever o gasto.

Janela de contexto de 1M

O DeepSeek V4.1 Flash suporta uma janela de contexto de 1M tokens com até 384K tokens de saída, o que atende documentos longos, repositórios grandes e agentes multi-turno. Na OurToken você pode enviar prompts longos e observar como o preço de cache read muda o custo de contexto repetido.

Visão e entrada multimodal

O V4.1 Flash é o primeiro build Flash da DeepSeek com compreensão nativa de imagens, então uma única chamada à deepseek v4.1 flash api pode combinar screenshots, páginas digitalizadas ou diagramas com instruções de texto. Combine isso com uma janela de contexto de 1M para workflows de revisão de documentos e QA visual.

Raciocínio e tool calls

O modelo roda em modo de raciocínio por padrão e também suporta modo non-thinking, tool calls, saída JSON e respostas estruturadas. Essa combinação atende assistentes que precisam raciocinar sobre uma tarefa e então retornar payloads legíveis por máquina que sua aplicação pode validar.

Workflows de agentes e coding

Aponte agentes de coding como Claude Code, Codex CLI ou OpenCode para o endpoint da OurToken e selecione DeepSeek V4.1 Flash como modelo. A OurToken publica guias de configuração para essas ferramentas, e a Responses API mais o endpoint compatível com Anthropic mantêm integrações de agentes existentes funcionando.

Como usar o DeepSeek V4.1 Flash na OurToken

Siga seis passos para ir de uma nova chave de API ao tráfego de produção: escolha o model ID, envie uma primeira request, compare os preços da API DeepSeek V4.1 Flash e depois monitore uso e custo.

Criar uma chave de API

Entre na OurToken e crie uma chave na página de chaves de API. Copie-a para o seu ambiente em vez de colocá-la no controle de versão, depois confirme que a chave está ativa antes de construir o resto da integração em torno do DeepSeek V4.1 Flash.

01

Selecionar o Model ID

Use deepseek-flash como valor do modelo para novas integrações. Se você já usa deepseek-v4-flash ou deepseek-v4-flash-vision-exp, esses nomes ainda resolvem e são servidos pelo V4.1 Flash, então a migração pode esperar até o próximo ciclo de release.

02

Enviar sua primeira request

Aponte seu client para o endpoint de chat completions da OurToken e envie um prompt curto antes de adicionar complexidade. Streaming, system prompts e histórico multi-turno seguem o formato de request da OpenAI, então código de SDK existente normalmente precisa apenas de mudança de base URL e de modelo.

03

Comparar preços e custo de cache

Confira a tabela de preços do DeepSeek V4.1 Flash para entrada, saída e cache read, e observe que tráfego fora de pico custa menos que horários de pico. Depois estime seu próprio mix de prompts, porque as taxas de cache hit decidem a maior parte da conta em workloads de agentes.

04

Configurar raciocínio e ferramentas

Decida se cada workload deve rodar em modo de raciocínio ou non-thinking, depois defina suas ferramentas e o schema JSON se a resposta alimentar outro sistema. Teste as duas configurações com os mesmos prompts antes de definir um padrão.

05

Monitorar uso e custo

Acompanhe logs de requests, contagens de tokens e custo por modelo no dashboard da OurToken após o lançamento. Compare latência e qualidade com as rotas que você já opera, e revise os preços da API DeepSeek V4.1 Flash sempre que a DeepSeek atualizar as tarifas oficiais.

06

FAQ da API DeepSeek V4.1 Flash

Respostas às perguntas que desenvolvedores fazem antes de adotar esta rota: o que é, quanto custa, qual model ID usar, o que suporta e como a mudança do V4 Pro afeta o tráfego existente.

01

O que é a API DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash é o modelo por trás do nome de API deepseek-flash, lançado em September 10, 2026 como o build Flash mais recente da DeepSeek. É um modelo mixture-of-experts de 552B com 8B parâmetros ativos na entrada e 16B na saída, janela de contexto de 1M tokens, até 384K tokens de saída e compreensão nativa de imagens. A OurToken o expõe por um único endpoint unificado.
02

Quanto custa a API DeepSeek V4.1 Flash?

O preço oficial de pico é $0.30 por milhão de tokens de entrada com cache miss, $1.20 por milhão de tokens de saída e $0.006 por milhão de tokens de entrada com cache hit, com tarifas fora de pico pela metade. A OurToken lista esta rota da API DeepSeek V4.1 Flash a 60% do preço de pico, então confira a tabela de preços nesta página para os números de entrada, saída, cache read e cache write que serão cobrados.
03

Qual model ID devo usar para o DeepSeek V4.1 Flash?

Use deepseek-flash para novas integrações; esse é o nome publicado pela DeepSeek. Provedores e posts de blog costumam escrever o mesmo modelo como deepseek-v4.1-flash ou deepseek v4.1-flash, então essas grafias aparecem em docs de terceiros mesmo não sendo o valor oficial de API. Os nomes anteriores deepseek-v4-flash e deepseek-v4-flash-vision-exp ainda resolvem e são servidos pelo V4.1 Flash.
04

Como chamo a API DeepSeek V4.1 Flash na OurToken?

Crie uma chave de API, aponte seu client para o endpoint da OurToken e passe deepseek-flash como valor do modelo. As requests seguem o formato chat completions da OpenAI, e responses e mensagens no estilo Anthropic também estão disponíveis se suas ferramentas já usam esses formatos. Depois compare latência, qualidade e custo com sua rota atual antes de migrar o tráfego de produção.
05

O DeepSeek V4.1 Flash é bom para coding e workflows de agentes?

É um padrão razoável para assistentes de coding e agentes: o modelo suporta tool calls, saída JSON, contexto de 1M tokens para repositórios grandes e modo de raciocínio para tarefas de várias etapas. A OurToken publica guias de configuração para Claude Code, Codex CLI e OpenCode, para que você o teste nas ferramentas que seu time já usa. Meça com seus próprios prompts.
06

O deepseek-v4-pro vai parar de funcionar em September 14?

A partir de 12:00 Beijing time de September 14, 2026, requests para deepseek-v4-pro são roteadas para o V4.1 Flash e cobradas pelo preço do Flash, então o nome continua funcionando enquanto o modelo por trás dele muda. Se você precisa de comportamento estável, fixe um model ID específico e reteste seus prompts após a troca.