DeepSeek

deepseek/deepseek-flash

1M 컨텍스트 · $0.1800 / M 입력 토큰 · $0.7200 / M 출력 토큰

DeepSeek V4.1 Flash는 네이티브 이미지 이해, 초장문 컨텍스트, 비용 효율적인 프로덕션 트래픽이 필요한 개발자를 위해 OurToken에서 제공되는 DeepSeek 모델 라우트입니다. 종료된 V4 Flash 라인을 대체하며 deepseek-flash model ID로 호출합니다.

API 키 받기
24H 상태 모니터

과거 가동률 데이터는 시간이 지남에 따라 수집됩니다. 현재 상태는 최근 상태 확인을 반영합니다.

가격

사용량 기반 결제

선불 비용 없이 사용한 만큼만 결제

60% of official price
입력$0.30 / M$0.1800 / M 토큰
출력$1.20 / M$0.7200 / M 토큰
캐시된 입력$0.006 / M$0.0036 / M 토큰
캐시 쓰기$0 / M$0 / M 토큰

API 사용법

API 액세스 가이드

기본 URLhttps://api.ourtoken.ai/v1
API 엔드포인트chat/completions
전체 URLhttps://api.ourtoken.ai/v1/chat/completions
모델 IDdeepseek-flash
API 키 받기

코드 예시

이 모델에는 OurToken API 엔드포인트를 사용하세요. 아래 예시는 직접 HTTP 요청과 모델 패밀리에 권장되는 엔드포인트를 사용합니다.

curl https://api.ourtoken.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "deepseek-flash",
    "messages": [
      {
        "role": "user",
        "content": "Hello!"
      }
    ],
    "max_tokens": 256
  }'

Chat Completions API 참조

OpenAI Chat Completions 호환 엔드포인트로 채팅 응답을 생성합니다. SDK Base URL로 https://api.ourtoken.ai/v1을 사용하고 엔드포인트로 POST /chat/completions를 사용하세요.

인증

Content-Typeapplication/json
AuthorizationBearer YOUR_API_KEY

요청 본문

필드타입필수설명
modelstring필수호출할 모델 ID입니다.
messagesarray<object>필수모델에 전송된 대화 메시지입니다.
max_tokensinteger선택 사항최대 출력 토큰 수입니다.
temperaturenumber선택 사항샘플링 온도입니다.
top_pnumber선택 사항Nucleus 샘플링 매개변수입니다.
streamboolean선택 사항스트리밍 응답을 반환할지 여부입니다.
stream_optionsobject선택 사항스트리밍 응답을 위한 추가 옵션입니다.
toolsarray<object>선택 사항모델에서 사용할 수 있는 도구입니다.
tool_choicestring | object선택 사항모델이 도구를 선택하는 방식을 제어합니다.
response_formatobject선택 사항JSON 객체 응답 같은 구조화된 출력을 제어합니다.

응답 본문

필드타입필수설명
idstring필수고유한 채팅 완료 식별자입니다.
object"chat.completion"필수Chat Completions API가 반환하는 객체 타입입니다.
createdinteger필수응답이 생성된 Unix 타임스탬프입니다.
modelstring필수응답을 생성한 모델입니다.
choicesarray<object>필수모델이 반환한 후보 응답입니다.
choices[].message.rolestring필수반환된 채팅 메시지의 역할입니다.
choices[].message.contentstring선택 사항반환된 채팅 메시지의 텍스트 콘텐츠입니다.
choices[].finish_reasonstring선택 사항생성이 중지된 이유입니다.
usageobject선택 사항채팅 완료의 토큰 사용량 정보입니다.
usage.prompt_tokensinteger선택 사항입력 토큰 수입니다.
usage.completion_tokensinteger선택 사항출력 토큰 수입니다.
usage.total_tokensinteger선택 사항총 토큰 수입니다.
usage.prompt_tokens_detailsobject선택 사항입력 토큰 사용량 분석입니다.
usage.prompt_tokens_details.cached_tokensinteger선택 사항캐시에서 제공된 토큰입니다.

모델 소개

DeepSeek deepseek-flash

DeepSeek V4.1 Flash는 네이티브 이미지 이해, 초장문 컨텍스트, 비용 효율적인 프로덕션 트래픽이 필요한 개발자를 위해 OurToken에서 제공되는 DeepSeek 모델 라우트입니다. 종료된 V4 Flash 라인을 대체하며 deepseek-flash model ID로 호출합니다.

DeepSeek V4.1 Flash는 팀에 더 낮은 비용의 DeepSeek 라우트를 제공합니다. 1M 토큰 컨텍스트 윈도우, 네이티브 이미지 이해, 최대 384K 출력 토큰을 갖추어 긴 프롬프트와 예측 가능한 가격이 필요한 애플리케이션 작업에 적합합니다. 하나의 대시보드에서 model IDs, 사용량 로그, 캐시 비용, 가격 검토를 유지하면서 OurToken 통합 API를 통해 DeepSeek 워크플로를 테스트하고 싶을 때 DeepSeek V4.1 Flash API를 사용하세요.

돋보이는 이유

  • 입력 및 출력 토큰에 대해 공식 피크 DeepSeek V4.1 Flash 기준 가격의 60%.
  • 지원되는 다른 모델에 사용되는 동일한 OurToken 엔드포인트를 통한 OpenAI 호환 API 설정.
  • 긴 문서, 리포지토리, 다중 턴 에이전트를 위한 1M 토큰 컨텍스트 윈도우와 최대 384K 출력 토큰.
  • 네이티브 이미지 이해를 지원하므로 비전 프롬프트와 텍스트 프롬프트를 하나의 요청으로 보낼 수 있습니다.
  • 대시보드 로그와 사용량 가시성은 출시 후 팀이 요청 비용을 검토하는 데 도움이 됩니다.

주요 기능

  • Model ID: deepseek-flash
  • Input price: $0.1800 per 1M tokens on OurToken
  • Output price: $0.7200 per 1M tokens on OurToken
  • Cache read price: $0.0036 per 1M tokens on OurToken
  • Cache write price: $0 per 1M tokens on OurToken
  • Provider: DeepSeek

사양

ProviderDeepSeek
Model TypeMultimodal Mixture-of-Experts (MoE) LLM
Model IDdeepseek-flash
Total Parameters552B (MoE)
Active Parameters8B input / 16B output
Context Length1M tokens
Max Output384K tokens
Thinking ModeEnabled by default, non-thinking optional
Image InputSupported
OurToken Input Price$0.1800 / 1M tokens
OurToken Output Price$0.7200 / 1M tokens
OurToken Cache Read Price$0.0036 / 1M tokens
OurToken Cache Write Price$0 / 1M tokens
Official Peak Input Reference$0.30 / 1M tokens
Official Peak Output Reference$1.20 / 1M tokens
Official Peak Cache Read Reference$0.006 / 1M tokens

DeepSeek V4.1 Flash API 기능

OurToken은 DeepSeek V4.1 Flash API 액세스, 가격, model ID, 컨텍스트 한도, 개발자 워크플로를 지원합니다. 이 라우트는 채팅, 코딩, 에이전트 트래픽 전반에서 하나의 키를 유지하면서 사용량 로그와 비용을 계속 확인할 수 있게 합니다.

통합 API 액세스

OurToken이 지원하는 모든 모델에 사용하는 동일한 OpenAI 호환 엔드포인트를 통해 DeepSeek V4.1 Flash API를 호출하세요. 하나의 API 키로 chat completions, responses, Anthropic 스타일 messages를 모두 처리하므로 별도의 제공업체 전용 통합 경로를 유지하지 않고도 DeepSeek V4.1 Flash를 다른 라우트와 비교할 수 있습니다.

투명한 토큰 가격

OurToken은 DeepSeek V4.1 Flash의 입력, 출력, cache read, cache write 가격을 100만 토큰 기준으로 공식 피크 기준 가격과 나란히 표시합니다. 이 모델은 cache hit를 cache miss보다 훨씬 저렴하게, 오프피크 트래픽을 피크보다 저렴하게 과금하므로, 확장 전에 이 표를 확인하면 지출을 예측하는 데 도움이 됩니다.

1M 컨텍스트 윈도우

DeepSeek V4.1 Flash는 최대 384K 출력 토큰과 함께 1M 토큰 컨텍스트 윈도우를 지원하므로 긴 문서, 대형 리포지토리, 다중 턴 에이전트에 적합합니다. OurToken에서는 긴 프롬프트를 보내고 cache read 가격이 반복 컨텍스트 비용을 어떻게 바꾸는지 확인할 수 있습니다.

비전 및 멀티모달 입력

V4.1 Flash는 네이티브 이미지 이해를 갖춘 DeepSeek 최초의 Flash 빌드이므로, 한 번의 deepseek v4.1 flash api 호출로 스크린샷, 스캔한 페이지, 다이어그램을 텍스트 지시와 함께 보낼 수 있습니다. 여기에 1M 컨텍스트 윈도우를 더하면 문서 검토와 시각적 QA 워크플로에 활용할 수 있습니다.

Thinking 모드와 도구 호출

이 모델은 기본적으로 thinking mode로 동작하며 non-thinking mode, 도구 호출, JSON 출력, 구조화된 응답도 지원합니다. 이 조합은 작업을 먼저 추론한 뒤 애플리케이션이 검증할 수 있는 기계 판독 가능한 페이로드를 반환해야 하는 어시스턴트에 적합합니다.

에이전트 및 코딩 워크플로

Claude Code, Codex CLI, OpenCode 같은 코딩 에이전트를 OurToken 엔드포인트로 지정하고 모델로 DeepSeek V4.1 Flash를 선택하세요. OurToken은 이러한 도구에 대한 설정 가이드를 제공하며, Responses API와 Anthropic 호환 엔드포인트는 기존 에이전트 통합을 계속 동작하게 합니다.

OurToken에서 DeepSeek V4.1 Flash를 사용하는 방법

새 API 키에서 프로덕션 트래픽까지 여섯 단계로 진행하세요: model ID를 선택하고, 첫 요청을 보내고, DeepSeek V4.1 Flash API 가격을 비교한 뒤 사용량과 비용을 모니터링합니다.

API 키 생성

OurToken에 로그인하고 API Keys 페이지에서 키를 만드세요. 소스 관리 대신 환경 변수에 복사한 뒤, DeepSeek V4.1 Flash를 중심으로 나머지 통합을 구축하기 전에 키가 활성 상태인지 확인하세요.

01

Model ID 선택

새 통합에는 모델 값으로 deepseek-flash를 사용하세요. 이미 deepseek-v4-flash 또는 deepseek-v4-flash-vision-exp를 운영 중이라면 그 이름도 여전히 해석되며 V4.1 Flash가 처리하므로, 마이그레이션은 다음 릴리스 주기까지 미룰 수 있습니다.

02

첫 요청 보내기

복잡도를 더하기 전에 클라이언트를 OurToken chat completions 엔드포인트로 지정하고 짧은 프롬프트를 보내세요. 스트리밍, system prompt, 다중 턴 기록은 모두 OpenAI 요청 형식을 따르므로 기존 SDK 코드는 보통 base URL과 모델만 변경하면 됩니다.

03

가격과 캐시 비용 비교

입력, 출력, cache read에 대한 DeepSeek V4.1 Flash 가격표를 확인하고, 오프피크 트래픽이 피크 시간대보다 저렴하다는 점을 기억하세요. 그런 다음 자체 프롬프트 구성을 기준으로 추정해 보세요. 에이전트 워크로드에서는 cache hit 비율이 청구 금액의 대부분을 결정하기 때문입니다.

04

Thinking과 도구 구성

각 워크로드를 thinking mode로 실행할지 non-thinking mode로 실행할지 결정하고, 응답이 다른 시스템으로 전달된다면 도구와 JSON 스키마를 정의하세요. 기본값을 정하기 전에 동일한 프롬프트로 두 설정을 모두 테스트하세요.

05

사용량과 비용 모니터링

출시 후 OurToken 대시보드에서 요청 로그, 토큰 수, 모델별 비용을 확인하세요. 이미 운영 중인 라우트와 지연 시간 및 품질을 비교하고, DeepSeek이 공식 요금을 갱신할 때마다 DeepSeek V4.1 Flash API 가격을 다시 확인하세요.

06

DeepSeek V4.1 Flash FAQ

이 라우트를 도입하기 전에 개발자들이 묻는 질문에 대한 답변입니다: 무엇인지, 비용은 얼마인지, 어떤 model ID를 사용해야 하는지, 무엇을 지원하는지, V4 Pro 변경이 기존 트래픽에 어떤 영향을 주는지.

01

DeepSeek V4.1 Flash API란 무엇인가요?

DeepSeek V4.1 Flash는 deepseek-flash라는 API 이름 뒤에 있는 모델로, September 10, 2026에 DeepSeek의 최신 Flash 빌드로 출시되었습니다. 입력에 8B, 출력에 16B 활성 파라미터를 사용하는 552B Mixture-of-Experts 모델이며, 1M 토큰 컨텍스트 윈도우, 최대 384K 출력 토큰, 네이티브 이미지 이해를 갖추고 있습니다. OurToken은 하나의 통합 엔드포인트를 통해 이 모델을 제공합니다.
02

DeepSeek V4.1 Flash API 비용은 얼마인가요?

공식 피크 가격은 100만 cache-miss 입력 토큰당 $0.30, 100만 출력 토큰당 $1.20, 100만 cache-hit 입력 토큰당 $0.006이며, 오프피크 요금은 그 절반입니다. OurToken은 이 DeepSeek V4.1 Flash API 라우트를 공식 피크 가격의 60%로 표시하므로, 실제 청구될 입력, 출력, cache read, cache write 수치는 이 페이지의 가격표에서 확인하세요.
03

DeepSeek V4.1 Flash에는 어떤 model ID를 사용해야 하나요?

새 통합에는 deepseek-flash를 사용하세요. 이것이 DeepSeek이 게시하는 이름입니다. 제공업체와 블로그에서는 같은 모델을 흔히 deepseek-v4.1-flash 또는 deepseek v4.1-flash로 표기하므로 이러한 표기가 타사 문서에 등장하지만, 공식 API 값은 아닙니다. 이전 이름인 deepseek-v4-flash와 deepseek-v4-flash-vision-exp도 여전히 해석되며 V4.1 Flash가 처리합니다.
04

OurToken에서 DeepSeek V4.1 Flash API를 어떻게 호출하나요?

API 키를 만들고 클라이언트를 OurToken 엔드포인트로 지정한 뒤 모델 값으로 deepseek-flash를 전달하세요. 요청은 OpenAI chat completions 형식을 따르며, 이미 responses나 Anthropic 스타일 messages를 사용하는 도구가 있다면 그것도 그대로 사용할 수 있습니다. 그런 다음 현재 라우트와 지연 시간, 품질, 비용을 비교한 뒤 프로덕션 트래픽을 전환하세요.
05

DeepSeek V4.1 Flash는 코딩과 에이전트 워크플로에 적합한가요?

코딩 어시스턴트와 에이전트에 합리적인 기본값입니다. 이 모델은 도구 호출, JSON 출력, 대형 리포지토리를 위한 1M 토큰 컨텍스트, 다단계 작업을 위한 thinking mode를 지원합니다. OurToken은 Claude Code, Codex CLI, OpenCode 설정 가이드를 제공하므로 팀이 이미 사용하는 도구에서 바로 테스트할 수 있습니다. 자체 프롬프트로 측정하세요.
06

deepseek-v4-pro는 9월 14일에 작동을 멈추나요?

September 14, 2026 12:00 Beijing time부터 deepseek-v4-pro로 보낸 요청은 V4.1 Flash로 라우팅되고 Flash 가격으로 청구됩니다. 즉 이름은 계속 작동하지만 그 뒤의 모델이 바뀝니다. 안정적인 동작이 필요하다면 특정 model ID를 고정하고 전환 후 프롬프트를 다시 테스트하세요.