- deepseek/deepseek-flash
deepseek/deepseek-flash
1M 컨텍스트 · $0.1800 / M 입력 토큰 · $0.7200 / M 출력 토큰
DeepSeek V4.1 Flash는 네이티브 이미지 이해, 초장문 컨텍스트, 비용 효율적인 프로덕션 트래픽이 필요한 개발자를 위해 OurToken에서 제공되는 DeepSeek 모델 라우트입니다. 종료된 V4 Flash 라인을 대체하며 deepseek-flash model ID로 호출합니다.
과거 가동률 데이터는 시간이 지남에 따라 수집됩니다. 현재 상태는 최근 상태 확인을 반영합니다.
가격
사용량 기반 결제
선불 비용 없이 사용한 만큼만 결제
API 사용법
API 액세스 가이드
코드 예시
이 모델에는 OurToken API 엔드포인트를 사용하세요. 아래 예시는 직접 HTTP 요청과 모델 패밀리에 권장되는 엔드포인트를 사용합니다.
curl https://api.ourtoken.ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "deepseek-flash",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"max_tokens": 256
}'Chat Completions API 참조
OpenAI Chat Completions 호환 엔드포인트로 채팅 응답을 생성합니다. SDK Base URL로 https://api.ourtoken.ai/v1을 사용하고 엔드포인트로 POST /chat/completions를 사용하세요.
인증
| Content-Type | application/json |
| Authorization | Bearer YOUR_API_KEY |
요청 본문
| 필드 | 타입 | 필수 | 설명 |
|---|---|---|---|
| model | string | 필수 | 호출할 모델 ID입니다. |
| messages | array<object> | 필수 | 모델에 전송된 대화 메시지입니다. |
| max_tokens | integer | 선택 사항 | 최대 출력 토큰 수입니다. |
| temperature | number | 선택 사항 | 샘플링 온도입니다. |
| top_p | number | 선택 사항 | Nucleus 샘플링 매개변수입니다. |
| stream | boolean | 선택 사항 | 스트리밍 응답을 반환할지 여부입니다. |
| stream_options | object | 선택 사항 | 스트리밍 응답을 위한 추가 옵션입니다. |
| tools | array<object> | 선택 사항 | 모델에서 사용할 수 있는 도구입니다. |
| tool_choice | string | object | 선택 사항 | 모델이 도구를 선택하는 방식을 제어합니다. |
| response_format | object | 선택 사항 | JSON 객체 응답 같은 구조화된 출력을 제어합니다. |
응답 본문
| 필드 | 타입 | 필수 | 설명 |
|---|---|---|---|
| id | string | 필수 | 고유한 채팅 완료 식별자입니다. |
| object | "chat.completion" | 필수 | Chat Completions API가 반환하는 객체 타입입니다. |
| created | integer | 필수 | 응답이 생성된 Unix 타임스탬프입니다. |
| model | string | 필수 | 응답을 생성한 모델입니다. |
| choices | array<object> | 필수 | 모델이 반환한 후보 응답입니다. |
| choices[].message.role | string | 필수 | 반환된 채팅 메시지의 역할입니다. |
| choices[].message.content | string | 선택 사항 | 반환된 채팅 메시지의 텍스트 콘텐츠입니다. |
| choices[].finish_reason | string | 선택 사항 | 생성이 중지된 이유입니다. |
| usage | object | 선택 사항 | 채팅 완료의 토큰 사용량 정보입니다. |
| usage.prompt_tokens | integer | 선택 사항 | 입력 토큰 수입니다. |
| usage.completion_tokens | integer | 선택 사항 | 출력 토큰 수입니다. |
| usage.total_tokens | integer | 선택 사항 | 총 토큰 수입니다. |
| usage.prompt_tokens_details | object | 선택 사항 | 입력 토큰 사용량 분석입니다. |
| usage.prompt_tokens_details.cached_tokens | integer | 선택 사항 | 캐시에서 제공된 토큰입니다. |
모델 소개
DeepSeek deepseek-flash
DeepSeek V4.1 Flash는 네이티브 이미지 이해, 초장문 컨텍스트, 비용 효율적인 프로덕션 트래픽이 필요한 개발자를 위해 OurToken에서 제공되는 DeepSeek 모델 라우트입니다. 종료된 V4 Flash 라인을 대체하며 deepseek-flash model ID로 호출합니다.
DeepSeek V4.1 Flash는 팀에 더 낮은 비용의 DeepSeek 라우트를 제공합니다. 1M 토큰 컨텍스트 윈도우, 네이티브 이미지 이해, 최대 384K 출력 토큰을 갖추어 긴 프롬프트와 예측 가능한 가격이 필요한 애플리케이션 작업에 적합합니다. 하나의 대시보드에서 model IDs, 사용량 로그, 캐시 비용, 가격 검토를 유지하면서 OurToken 통합 API를 통해 DeepSeek 워크플로를 테스트하고 싶을 때 DeepSeek V4.1 Flash API를 사용하세요.
돋보이는 이유
- 입력 및 출력 토큰에 대해 공식 피크 DeepSeek V4.1 Flash 기준 가격의 60%.
- 지원되는 다른 모델에 사용되는 동일한 OurToken 엔드포인트를 통한 OpenAI 호환 API 설정.
- 긴 문서, 리포지토리, 다중 턴 에이전트를 위한 1M 토큰 컨텍스트 윈도우와 최대 384K 출력 토큰.
- 네이티브 이미지 이해를 지원하므로 비전 프롬프트와 텍스트 프롬프트를 하나의 요청으로 보낼 수 있습니다.
- 대시보드 로그와 사용량 가시성은 출시 후 팀이 요청 비용을 검토하는 데 도움이 됩니다.
주요 기능
- Model ID: deepseek-flash
- Input price: $0.1800 per 1M tokens on OurToken
- Output price: $0.7200 per 1M tokens on OurToken
- Cache read price: $0.0036 per 1M tokens on OurToken
- Cache write price: $0 per 1M tokens on OurToken
- Provider: DeepSeek
사양
DeepSeek V4.1 Flash API 기능
OurToken은 DeepSeek V4.1 Flash API 액세스, 가격, model ID, 컨텍스트 한도, 개발자 워크플로를 지원합니다. 이 라우트는 채팅, 코딩, 에이전트 트래픽 전반에서 하나의 키를 유지하면서 사용량 로그와 비용을 계속 확인할 수 있게 합니다.
통합 API 액세스
OurToken이 지원하는 모든 모델에 사용하는 동일한 OpenAI 호환 엔드포인트를 통해 DeepSeek V4.1 Flash API를 호출하세요. 하나의 API 키로 chat completions, responses, Anthropic 스타일 messages를 모두 처리하므로 별도의 제공업체 전용 통합 경로를 유지하지 않고도 DeepSeek V4.1 Flash를 다른 라우트와 비교할 수 있습니다.
투명한 토큰 가격
OurToken은 DeepSeek V4.1 Flash의 입력, 출력, cache read, cache write 가격을 100만 토큰 기준으로 공식 피크 기준 가격과 나란히 표시합니다. 이 모델은 cache hit를 cache miss보다 훨씬 저렴하게, 오프피크 트래픽을 피크보다 저렴하게 과금하므로, 확장 전에 이 표를 확인하면 지출을 예측하는 데 도움이 됩니다.
1M 컨텍스트 윈도우
DeepSeek V4.1 Flash는 최대 384K 출력 토큰과 함께 1M 토큰 컨텍스트 윈도우를 지원하므로 긴 문서, 대형 리포지토리, 다중 턴 에이전트에 적합합니다. OurToken에서는 긴 프롬프트를 보내고 cache read 가격이 반복 컨텍스트 비용을 어떻게 바꾸는지 확인할 수 있습니다.
비전 및 멀티모달 입력
V4.1 Flash는 네이티브 이미지 이해를 갖춘 DeepSeek 최초의 Flash 빌드이므로, 한 번의 deepseek v4.1 flash api 호출로 스크린샷, 스캔한 페이지, 다이어그램을 텍스트 지시와 함께 보낼 수 있습니다. 여기에 1M 컨텍스트 윈도우를 더하면 문서 검토와 시각적 QA 워크플로에 활용할 수 있습니다.
Thinking 모드와 도구 호출
이 모델은 기본적으로 thinking mode로 동작하며 non-thinking mode, 도구 호출, JSON 출력, 구조화된 응답도 지원합니다. 이 조합은 작업을 먼저 추론한 뒤 애플리케이션이 검증할 수 있는 기계 판독 가능한 페이로드를 반환해야 하는 어시스턴트에 적합합니다.
에이전트 및 코딩 워크플로
Claude Code, Codex CLI, OpenCode 같은 코딩 에이전트를 OurToken 엔드포인트로 지정하고 모델로 DeepSeek V4.1 Flash를 선택하세요. OurToken은 이러한 도구에 대한 설정 가이드를 제공하며, Responses API와 Anthropic 호환 엔드포인트는 기존 에이전트 통합을 계속 동작하게 합니다.
OurToken에서 DeepSeek V4.1 Flash를 사용하는 방법
새 API 키에서 프로덕션 트래픽까지 여섯 단계로 진행하세요: model ID를 선택하고, 첫 요청을 보내고, DeepSeek V4.1 Flash API 가격을 비교한 뒤 사용량과 비용을 모니터링합니다.
API 키 생성
OurToken에 로그인하고 API Keys 페이지에서 키를 만드세요. 소스 관리 대신 환경 변수에 복사한 뒤, DeepSeek V4.1 Flash를 중심으로 나머지 통합을 구축하기 전에 키가 활성 상태인지 확인하세요.
01Model ID 선택
새 통합에는 모델 값으로 deepseek-flash를 사용하세요. 이미 deepseek-v4-flash 또는 deepseek-v4-flash-vision-exp를 운영 중이라면 그 이름도 여전히 해석되며 V4.1 Flash가 처리하므로, 마이그레이션은 다음 릴리스 주기까지 미룰 수 있습니다.
02첫 요청 보내기
복잡도를 더하기 전에 클라이언트를 OurToken chat completions 엔드포인트로 지정하고 짧은 프롬프트를 보내세요. 스트리밍, system prompt, 다중 턴 기록은 모두 OpenAI 요청 형식을 따르므로 기존 SDK 코드는 보통 base URL과 모델만 변경하면 됩니다.
03가격과 캐시 비용 비교
입력, 출력, cache read에 대한 DeepSeek V4.1 Flash 가격표를 확인하고, 오프피크 트래픽이 피크 시간대보다 저렴하다는 점을 기억하세요. 그런 다음 자체 프롬프트 구성을 기준으로 추정해 보세요. 에이전트 워크로드에서는 cache hit 비율이 청구 금액의 대부분을 결정하기 때문입니다.
04Thinking과 도구 구성
각 워크로드를 thinking mode로 실행할지 non-thinking mode로 실행할지 결정하고, 응답이 다른 시스템으로 전달된다면 도구와 JSON 스키마를 정의하세요. 기본값을 정하기 전에 동일한 프롬프트로 두 설정을 모두 테스트하세요.
05사용량과 비용 모니터링
출시 후 OurToken 대시보드에서 요청 로그, 토큰 수, 모델별 비용을 확인하세요. 이미 운영 중인 라우트와 지연 시간 및 품질을 비교하고, DeepSeek이 공식 요금을 갱신할 때마다 DeepSeek V4.1 Flash API 가격을 다시 확인하세요.
06DeepSeek V4.1 Flash FAQ
이 라우트를 도입하기 전에 개발자들이 묻는 질문에 대한 답변입니다: 무엇인지, 비용은 얼마인지, 어떤 model ID를 사용해야 하는지, 무엇을 지원하는지, V4 Pro 변경이 기존 트래픽에 어떤 영향을 주는지.