DeepSeek

deepseek/deepseek-flash

1M konteks · $0.1800 / M token input · $0.7200 / M token output

DeepSeek V4.1 Flash adalah rute model DeepSeek di OurToken untuk developer yang membutuhkan pemahaman gambar native, konteks sangat panjang, dan traffic produksi yang hemat biaya. Model ini menggantikan lini V4 Flash yang dihentikan dan dipanggil melalui model ID deepseek-flash.

Dapatkan API key
Monitor Status 24H

Data uptime historis dikumpulkan seiring waktu. Status saat ini mencerminkan pemeriksaan kesehatan terbaru.

Harga

Bayar sesuai pemakaian

Tanpa biaya di awal; bayar hanya untuk yang Anda gunakan

60% of official price
Masukan$0.30 / M$0.1800 / M Token
Keluaran$1.20 / M$0.7200 / M Token
Input tersimpan$0.006 / M$0.0036 / M Token
Penulisan cache$0 / M$0 / M Token

Penggunaan API

Panduan akses API

URL dasarhttps://api.ourtoken.ai/v1
Endpoint APIchat/completions
URL lengkaphttps://api.ourtoken.ai/v1/chat/completions
ID modeldeepseek-flash
Dapatkan API key

Contoh kode

Gunakan endpoint API OurToken untuk model ini. Contoh di bawah memakai request HTTP langsung dan endpoint yang direkomendasikan untuk keluarga model ini.

curl https://api.ourtoken.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "deepseek-flash",
    "messages": [
      {
        "role": "user",
        "content": "Hello!"
      }
    ],
    "max_tokens": 256
  }'

Referensi API Chat Completions

Buat respons chat dengan endpoint yang kompatibel dengan OpenAI Chat Completions. Gunakan https://api.ourtoken.ai/v1 sebagai SDK Base URL dan POST /chat/completions sebagai endpoint.

Otorisasi

Content-Typeapplication/json
AuthorizationBearer YOUR_API_KEY

Isi permintaan

KolomTipeWajibDeskripsi
modelstringWajibModel ID yang akan dipanggil.
messagesarray<object>WajibPesan percakapan yang dikirim ke model.
max_tokensintegerOpsionalJumlah maksimum token output.
temperaturenumberOpsionalTemperature sampling.
top_pnumberOpsionalParameter nucleus sampling.
streambooleanOpsionalApakah respons dikembalikan sebagai streaming.
stream_optionsobjectOpsionalOpsi tambahan untuk respons streaming.
toolsarray<object>OpsionalTools yang tersedia untuk model.
tool_choicestring | objectOpsionalMengontrol cara model memilih tools.
response_formatobjectOpsionalMengontrol output terstruktur, seperti respons objek JSON.

Isi respons

KolomTipeWajibDeskripsi
idstringWajibIdentifier unik chat completion.
object"chat.completion"WajibTipe objek yang dikembalikan oleh API Chat Completions.
createdintegerWajibTimestamp Unix saat respons dibuat.
modelstringWajibModel yang menghasilkan respons.
choicesarray<object>WajibKandidat respons yang dikembalikan oleh model.
choices[].message.rolestringWajibRole dari pesan chat yang dikembalikan.
choices[].message.contentstringOpsionalKonten teks dalam pesan chat yang dikembalikan.
choices[].finish_reasonstringOpsionalAlasan generasi berhenti.
usageobjectOpsionalInformasi penggunaan token untuk chat completion.
usage.prompt_tokensintegerOpsionalJumlah token input.
usage.completion_tokensintegerOpsionalJumlah token output.
usage.total_tokensintegerOpsionalJumlah token total.
usage.prompt_tokens_detailsobjectOpsionalRincian penggunaan token input.
usage.prompt_tokens_details.cached_tokensintegerOpsionalToken yang dilayani dari cache.

Pengenalan model

DeepSeek deepseek-flash

DeepSeek V4.1 Flash adalah rute model DeepSeek di OurToken untuk developer yang membutuhkan pemahaman gambar native, konteks sangat panjang, dan traffic produksi yang hemat biaya. Model ini menggantikan lini V4 Flash yang dihentikan dan dipanggil melalui model ID deepseek-flash.

DeepSeek V4.1 Flash memberi tim rute DeepSeek berbiaya lebih rendah dengan jendela konteks 1M token, pemahaman gambar native, dan hingga 384K token output untuk pekerjaan aplikasi yang membutuhkan prompt panjang dan harga yang dapat diprediksi. Gunakan API DeepSeek V4.1 Flash saat ingin menguji workflow DeepSeek melalui API terpadu OurToken sambil menjaga model ID, log penggunaan, biaya cache, dan review harga dalam satu dashboard.

Mengapa model ini menonjol

  • 60% dari harga referensi resmi (peak) DeepSeek V4.1 Flash untuk token input dan output.
  • Setup API kompatibel OpenAI melalui endpoint OurToken yang sama dengan model lain yang didukung.
  • Jendela konteks 1M token dengan hingga 384K token output untuk dokumen panjang, repository, dan agent multi-turn.
  • Pemahaman gambar native, sehingga prompt vision dan teks dapat dikirim dalam satu request.
  • Log dashboard dan visibilitas penggunaan membantu tim meninjau biaya request setelah launch.

Fitur utama

  • Model ID: deepseek-flash
  • Harga input: $0.1800 per 1M tokens di OurToken
  • Harga output: $0.7200 per 1M tokens di OurToken
  • Harga cache read: $0.0036 per 1M tokens di OurToken
  • Harga cache write: $0 per 1M tokens di OurToken
  • Provider: DeepSeek

Spesifikasi

ProviderDeepSeek
Tipe modelMultimodal Mixture-of-Experts (MoE) LLM
Model IDdeepseek-flash
Total parameter552B (MoE)
Parameter aktif8B input / 16B output
Panjang konteks1M tokens
Max Output384K tokens
Mode thinkingAktif secara default, non-thinking opsional
Input gambarDidukung
Harga input OurToken$0.1800 / 1M tokens
Harga output OurToken$0.7200 / 1M tokens
Harga cache read OurToken$0.0036 / 1M tokens
Harga cache write OurToken$0 / 1M tokens
Referensi input resmi (peak)$0.30 / 1M tokens
Referensi output resmi (peak)$1.20 / 1M tokens
Referensi cache read resmi (peak)$0.006 / 1M tokens

Fitur API DeepSeek V4.1 Flash

OurToken mencakup akses API DeepSeek V4.1 Flash, harga, model ID, batas konteks, dan workflow developer. Rute ini menjaga satu key untuk traffic chat, coding, dan agent sementara log penggunaan dan biaya tetap terlihat.

Akses API terpadu

Panggil API DeepSeek V4.1 Flash melalui endpoint kompatibel OpenAI yang sama yang dipakai OurToken untuk setiap model yang didukung. Satu API key mencakup chat completions, responses, dan pesan bergaya Anthropic, sehingga DeepSeek V4.1 Flash dapat dibandingkan dengan rute lain tanpa memelihara jalur integrasi provider yang terpisah.

Harga token yang transparan

OurToken mencantumkan harga DeepSeek V4.1 Flash per juta token untuk input, output, cache read, dan cache write, bersebelahan dengan harga referensi resmi (peak). Karena model menagih cache hit jauh lebih murah daripada cache miss dan traffic off-peak lebih murah daripada peak, memeriksa tabel ini sebelum scale membantu memperkirakan spend.

Jendela konteks 1M

DeepSeek V4.1 Flash mendukung jendela konteks 1M token dengan hingga 384K token output, cocok untuk dokumen panjang, repository besar, dan agent multi-turn. Di OurToken, prompt panjang dapat dikirim dan dampak harga cache read terhadap biaya konteks berulang dapat dipantau.

Input vision dan multimodal

V4.1 Flash adalah build Flash pertama DeepSeek dengan pemahaman gambar native, sehingga satu panggilan deepseek v4.1 flash api dapat mencampur screenshot, halaman hasil scan, atau diagram dengan instruksi teks. Kombinasikan dengan jendela konteks 1M untuk review dokumen dan workflow QA visual.

Thinking dan tool call

Model berjalan dalam mode thinking secara default dan juga mendukung mode non-thinking, tool call, output JSON, dan respons terstruktur. Kombinasi itu cocok untuk assistant yang harus menalar sebuah tugas lalu mengembalikan payload machine-readable yang dapat divalidasi aplikasi.

Workflow agent dan coding

Arahkan coding agent seperti Claude Code, Codex CLI, atau OpenCode ke endpoint OurToken dan pilih DeepSeek V4.1 Flash sebagai model. OurToken menerbitkan panduan setup untuk tool tersebut, dan Responses API plus endpoint kompatibel Anthropic menjaga integrasi agent yang sudah ada tetap berjalan.

Cara menggunakan DeepSeek V4.1 Flash di OurToken

Ikuti enam langkah dari API key baru hingga traffic produksi: pilih model ID, kirim request pertama, bandingkan harga API DeepSeek V4.1 Flash, lalu pantau penggunaan dan biaya.

Buat API key

Masuk ke OurToken dan buat key dari halaman API Keys. Salin ke environment, bukan ke source control, lalu pastikan key aktif sebelum membangun sisa integrasi di sekitar DeepSeek V4.1 Flash.

01

Pilih Model ID

Gunakan deepseek-flash sebagai nilai model untuk integrasi baru. Jika sudah men-deploy deepseek-v4-flash atau deepseek-v4-flash-vision-exp, nama tersebut masih berfungsi dan dilayani oleh V4.1 Flash, sehingga migrasi dapat menunggu siklus rilis berikutnya.

02

Kirim request pertama

Arahkan client ke endpoint chat completions OurToken dan kirim prompt pendek sebelum menambah kompleksitas. Streaming, system prompt, dan riwayat multi-turn semuanya mengikuti bentuk request OpenAI, sehingga kode SDK yang ada biasanya hanya perlu mengganti base URL dan model.

03

Bandingkan harga dan biaya cache

Periksa tabel harga DeepSeek V4.1 Flash untuk input, output, dan cache read, dan perhatikan bahwa traffic off-peak lebih murah daripada jam peak. Lalu perkirakan komposisi prompt sendiri, karena tingkat cache hit menentukan sebagian besar tagihan pada workload agent.

04

Konfigurasi thinking dan tool

Tentukan apakah setiap workload sebaiknya berjalan di mode thinking atau non-thinking, lalu definisikan tool dan skema JSON jika responsnya dipakai sistem lain. Uji kedua pengaturan dengan prompt yang sama sebelum menetapkan default.

05

Pantau penggunaan dan biaya

Pantau log request, jumlah token, dan biaya per model di dashboard OurToken setelah launch. Bandingkan latensi dan kualitas dengan rute yang sudah dijalankan, dan periksa ulang harga API DeepSeek V4.1 Flash setiap kali DeepSeek memperbarui tarif resmi.

06

FAQ DeepSeek V4.1 Flash

Jawaban atas pertanyaan yang diajukan developer sebelum mengadopsi rute ini: apa itu, berapa biayanya, model ID mana yang dipakai, apa yang didukung, dan bagaimana perubahan V4 Pro memengaruhi traffic yang ada.

01

Apa itu API DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash adalah model di balik nama API deepseek-flash, dirilis pada September 10, 2026 sebagai build Flash terbaru DeepSeek. Ini adalah model mixture-of-experts 552B dengan 8B parameter aktif pada input dan 16B pada output, jendela konteks 1M token, hingga 384K token output, dan pemahaman gambar native. OurToken mengeksposnya melalui satu endpoint terpadu.
02

Berapa harga API DeepSeek V4.1 Flash?

Harga resmi pada peak adalah $0.30 per juta token input cache-miss, $1.20 per juta token output, dan $0.006 per juta token input cache-hit, dengan tarif off-peak setengahnya. OurToken mencantumkan rute API DeepSeek V4.1 Flash ini pada 60% dari harga resmi (peak), jadi periksa tabel harga di halaman ini untuk angka input, output, cache read, dan cache write yang akan ditagih.
03

Model ID apa yang harus dipakai untuk DeepSeek V4.1 Flash?

Gunakan deepseek-flash untuk integrasi baru; itu nama yang dipublikasikan DeepSeek. Provider dan posting blog sering menulis model yang sama sebagai deepseek-v4.1-flash atau deepseek v4.1-flash, sehingga ejaan tersebut muncul di dokumentasi pihak ketiga meskipun bukan nilai API resmi. Nama sebelumnya deepseek-v4-flash dan deepseek-v4-flash-vision-exp masih berfungsi dan dilayani oleh V4.1 Flash.
04

Bagaimana cara memanggil API DeepSeek V4.1 Flash di OurToken?

Buat API key, arahkan client ke endpoint OurToken, dan kirim deepseek-flash sebagai nilai model. Request mengikuti bentuk chat completions OpenAI, dan responses serta pesan bergaya Anthropic juga tersedia jika tooling sudah memakainya. Lalu bandingkan latensi, kualitas, dan biaya dengan rute saat ini sebelum memindahkan traffic produksi.
05

Apakah DeepSeek V4.1 Flash cocok untuk coding dan workflow agent?

Ini default yang wajar untuk coding assistant dan agent: model mendukung tool call, output JSON, konteks 1M token untuk repository besar, dan mode thinking untuk tugas multi-langkah. OurToken menerbitkan panduan setup untuk Claude Code, Codex CLI, dan OpenCode, sehingga bisa diuji di tool yang sudah dipakai tim. Ukur dengan prompt sendiri.
06

Apakah deepseek-v4-pro akan berhenti berfungsi pada September 14?

Mulai 12:00 Beijing time pada September 14, 2026, request ke deepseek-v4-pro dialihkan ke V4.1 Flash dan ditagih dengan harga Flash, sehingga namanya tetap berfungsi sementara model di baliknya berubah. Jika membutuhkan perilaku yang stabil, pin model ID tertentu dan uji ulang prompt setelah pergantian.