- deepseek/deepseek-flash
deepseek/deepseek-flash
1M contexto · $0.1800 / M tokens de entrada · $0.7200 / M tokens de saída
DeepSeek V4.1 Flash é uma rota de modelo DeepSeek na OurToken para desenvolvedores que precisam de compreensão nativa de imagens, contexto muito longo e tráfego de produção com bom custo-benefício. Ele substitui a linha V4 Flash descontinuada e é chamado pelo model ID deepseek-flash.
Dados históricos de disponibilidade são coletados ao longo do tempo. O status atual reflete a última verificação.
Preços
Pagamento por uso
Sem custo inicial; pague apenas pelo que usar
Uso da API
Guia de acesso à API
Exemplos de código
Use o endpoint da API OurToken para este modelo. Os exemplos abaixo usam requisições HTTP diretas e o endpoint recomendado para a família do modelo.
curl https://api.ourtoken.ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "deepseek-flash",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"max_tokens": 256
}'Referência da API Chat Completions
Crie uma resposta de chat com o endpoint compatível com OpenAI Chat Completions. Use https://api.ourtoken.ai/v1 como SDK Base URL e POST /chat/completions como endpoint.
Autorização
| Content-Type | application/json |
| Authorization | Bearer YOUR_API_KEY |
Corpo da requisição
| Campo | Tipo | Obrigatório | Descrição |
|---|---|---|---|
| model | string | Obrigatório | Model ID a chamar. |
| messages | array<object> | Obrigatório | Mensagens da conversa enviadas ao modelo. |
| max_tokens | integer | Opcional | Número máximo de tokens de saída. |
| temperature | number | Opcional | Temperatura de amostragem. |
| top_p | number | Opcional | Parâmetro de nucleus sampling. |
| stream | boolean | Opcional | Define se a resposta será retornada em streaming. |
| stream_options | object | Opcional | Opções adicionais para respostas em streaming. |
| tools | array<object> | Opcional | Tools disponíveis para o modelo. |
| tool_choice | string | object | Opcional | Controla como o modelo seleciona tools. |
| response_format | object | Opcional | Controla saída estruturada, como respostas em objeto JSON. |
Corpo da resposta
| Campo | Tipo | Obrigatório | Descrição |
|---|---|---|---|
| id | string | Obrigatório | Identificador único da chat completion. |
| object | "chat.completion" | Obrigatório | Tipo de objeto retornado pela API Chat Completions. |
| created | integer | Obrigatório | Timestamp Unix de criação da resposta. |
| model | string | Obrigatório | Modelo que gerou a resposta. |
| choices | array<object> | Obrigatório | Respostas candidatas retornadas pelo modelo. |
| choices[].message.role | string | Obrigatório | Role da mensagem de chat retornada. |
| choices[].message.content | string | Opcional | Conteúdo de texto na mensagem de chat retornada. |
| choices[].finish_reason | string | Opcional | Motivo pelo qual a geração parou. |
| usage | object | Opcional | Informações de uso de tokens da chat completion. |
| usage.prompt_tokens | integer | Opcional | Contagem de tokens de entrada. |
| usage.completion_tokens | integer | Opcional | Contagem de tokens de saída. |
| usage.total_tokens | integer | Opcional | Contagem total de tokens. |
| usage.prompt_tokens_details | object | Opcional | Detalhamento do uso de tokens de entrada. |
| usage.prompt_tokens_details.cached_tokens | integer | Opcional | Tokens servidos a partir de cache. |
Introdução ao modelo
DeepSeek deepseek-flash
DeepSeek V4.1 Flash é uma rota de modelo DeepSeek na OurToken para desenvolvedores que precisam de compreensão nativa de imagens, contexto muito longo e tráfego de produção com bom custo-benefício. Ele substitui a linha V4 Flash descontinuada e é chamado pelo model ID deepseek-flash.
DeepSeek V4.1 Flash dá aos times uma rota DeepSeek de menor custo com janela de contexto de 1M tokens, compreensão nativa de imagens e até 384K tokens de saída para aplicações que exigem prompts longos e preços previsíveis. Use a API DeepSeek V4.1 Flash quando quiser testar workflows DeepSeek pela API unificada da OurToken, mantendo model IDs, logs de uso, custos de cache e revisão de preços em um só dashboard.
Por que ele se destaca
- 60% do preço de pico oficial de referência do DeepSeek V4.1 Flash para tokens de entrada e saída.
- Setup de API compatível com OpenAI pelo mesmo endpoint da OurToken usado por outros modelos suportados.
- Uma janela de contexto de 1M tokens com até 384K tokens de saída para documentos longos, repositórios e agentes multi-turno.
- Compreensão nativa de imagens, permitindo que prompts de visão e texto viajem em uma única request.
- Logs no dashboard e visibilidade de uso ajudam times a revisar o custo de requests após o lançamento.
Principais recursos
- Model ID: deepseek-flash
- Preço de entrada: $0.1800 por 1M tokens na OurToken
- Preço de saída: $0.7200 por 1M tokens na OurToken
- Preço de cache read: $0.0036 por 1M tokens na OurToken
- Preço de cache write: $0 por 1M tokens na OurToken
- Provedor: DeepSeek
Especificações
Recursos da API DeepSeek V4.1 Flash
A OurToken cobre acesso à API DeepSeek V4.1 Flash, preços, model ID, limites de contexto e workflow de desenvolvimento. Esta rota mantém uma única chave para tráfego de chat, coding e agentes, com logs de uso e custo visíveis.
Acesso unificado à API
Chame a API DeepSeek V4.1 Flash pelo mesmo endpoint compatível com OpenAI que a OurToken usa para todos os modelos suportados. Uma chave de API cobre chat completions, responses e mensagens no estilo Anthropic, para que você compare o DeepSeek V4.1 Flash com outras rotas sem manter um caminho de integração separado por provedor.
Preços de tokens transparentes
A OurToken lista o preço do DeepSeek V4.1 Flash por milhão de tokens para entrada, saída, cache read e cache write, ao lado do preço de pico oficial de referência. Como o modelo cobra cache hits muito abaixo de cache misses e tráfego fora de pico abaixo do pico, conferir essa tabela antes de escalar ajuda a prever o gasto.
Janela de contexto de 1M
O DeepSeek V4.1 Flash suporta uma janela de contexto de 1M tokens com até 384K tokens de saída, o que atende documentos longos, repositórios grandes e agentes multi-turno. Na OurToken você pode enviar prompts longos e observar como o preço de cache read muda o custo de contexto repetido.
Visão e entrada multimodal
O V4.1 Flash é o primeiro build Flash da DeepSeek com compreensão nativa de imagens, então uma única chamada à deepseek v4.1 flash api pode combinar screenshots, páginas digitalizadas ou diagramas com instruções de texto. Combine isso com uma janela de contexto de 1M para workflows de revisão de documentos e QA visual.
Raciocínio e tool calls
O modelo roda em modo de raciocínio por padrão e também suporta modo non-thinking, tool calls, saída JSON e respostas estruturadas. Essa combinação atende assistentes que precisam raciocinar sobre uma tarefa e então retornar payloads legíveis por máquina que sua aplicação pode validar.
Workflows de agentes e coding
Aponte agentes de coding como Claude Code, Codex CLI ou OpenCode para o endpoint da OurToken e selecione DeepSeek V4.1 Flash como modelo. A OurToken publica guias de configuração para essas ferramentas, e a Responses API mais o endpoint compatível com Anthropic mantêm integrações de agentes existentes funcionando.
Como usar o DeepSeek V4.1 Flash na OurToken
Siga seis passos para ir de uma nova chave de API ao tráfego de produção: escolha o model ID, envie uma primeira request, compare os preços da API DeepSeek V4.1 Flash e depois monitore uso e custo.
Criar uma chave de API
Entre na OurToken e crie uma chave na página de chaves de API. Copie-a para o seu ambiente em vez de colocá-la no controle de versão, depois confirme que a chave está ativa antes de construir o resto da integração em torno do DeepSeek V4.1 Flash.
01Selecionar o Model ID
Use deepseek-flash como valor do modelo para novas integrações. Se você já usa deepseek-v4-flash ou deepseek-v4-flash-vision-exp, esses nomes ainda resolvem e são servidos pelo V4.1 Flash, então a migração pode esperar até o próximo ciclo de release.
02Enviar sua primeira request
Aponte seu client para o endpoint de chat completions da OurToken e envie um prompt curto antes de adicionar complexidade. Streaming, system prompts e histórico multi-turno seguem o formato de request da OpenAI, então código de SDK existente normalmente precisa apenas de mudança de base URL e de modelo.
03Comparar preços e custo de cache
Confira a tabela de preços do DeepSeek V4.1 Flash para entrada, saída e cache read, e observe que tráfego fora de pico custa menos que horários de pico. Depois estime seu próprio mix de prompts, porque as taxas de cache hit decidem a maior parte da conta em workloads de agentes.
04Configurar raciocínio e ferramentas
Decida se cada workload deve rodar em modo de raciocínio ou non-thinking, depois defina suas ferramentas e o schema JSON se a resposta alimentar outro sistema. Teste as duas configurações com os mesmos prompts antes de definir um padrão.
05Monitorar uso e custo
Acompanhe logs de requests, contagens de tokens e custo por modelo no dashboard da OurToken após o lançamento. Compare latência e qualidade com as rotas que você já opera, e revise os preços da API DeepSeek V4.1 Flash sempre que a DeepSeek atualizar as tarifas oficiais.
06FAQ da API DeepSeek V4.1 Flash
Respostas às perguntas que desenvolvedores fazem antes de adotar esta rota: o que é, quanto custa, qual model ID usar, o que suporta e como a mudança do V4 Pro afeta o tráfego existente.