- deepseek/deepseek-flash
deepseek/deepseek-flash
1M konteks · $0.1800 / M token input · $0.7200 / M token output
DeepSeek V4.1 Flash adalah rute model DeepSeek di OurToken untuk developer yang membutuhkan pemahaman gambar native, konteks sangat panjang, dan traffic produksi yang hemat biaya. Model ini menggantikan lini V4 Flash yang dihentikan dan dipanggil melalui model ID deepseek-flash.
Data uptime historis dikumpulkan seiring waktu. Status saat ini mencerminkan pemeriksaan kesehatan terbaru.
Harga
Bayar sesuai pemakaian
Tanpa biaya di awal; bayar hanya untuk yang Anda gunakan
Penggunaan API
Panduan akses API
Contoh kode
Gunakan endpoint API OurToken untuk model ini. Contoh di bawah memakai request HTTP langsung dan endpoint yang direkomendasikan untuk keluarga model ini.
curl https://api.ourtoken.ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "deepseek-flash",
"messages": [
{
"role": "user",
"content": "Hello!"
}
],
"max_tokens": 256
}'Referensi API Chat Completions
Buat respons chat dengan endpoint yang kompatibel dengan OpenAI Chat Completions. Gunakan https://api.ourtoken.ai/v1 sebagai SDK Base URL dan POST /chat/completions sebagai endpoint.
Otorisasi
| Content-Type | application/json |
| Authorization | Bearer YOUR_API_KEY |
Isi permintaan
| Kolom | Tipe | Wajib | Deskripsi |
|---|---|---|---|
| model | string | Wajib | Model ID yang akan dipanggil. |
| messages | array<object> | Wajib | Pesan percakapan yang dikirim ke model. |
| max_tokens | integer | Opsional | Jumlah maksimum token output. |
| temperature | number | Opsional | Temperature sampling. |
| top_p | number | Opsional | Parameter nucleus sampling. |
| stream | boolean | Opsional | Apakah respons dikembalikan sebagai streaming. |
| stream_options | object | Opsional | Opsi tambahan untuk respons streaming. |
| tools | array<object> | Opsional | Tools yang tersedia untuk model. |
| tool_choice | string | object | Opsional | Mengontrol cara model memilih tools. |
| response_format | object | Opsional | Mengontrol output terstruktur, seperti respons objek JSON. |
Isi respons
| Kolom | Tipe | Wajib | Deskripsi |
|---|---|---|---|
| id | string | Wajib | Identifier unik chat completion. |
| object | "chat.completion" | Wajib | Tipe objek yang dikembalikan oleh API Chat Completions. |
| created | integer | Wajib | Timestamp Unix saat respons dibuat. |
| model | string | Wajib | Model yang menghasilkan respons. |
| choices | array<object> | Wajib | Kandidat respons yang dikembalikan oleh model. |
| choices[].message.role | string | Wajib | Role dari pesan chat yang dikembalikan. |
| choices[].message.content | string | Opsional | Konten teks dalam pesan chat yang dikembalikan. |
| choices[].finish_reason | string | Opsional | Alasan generasi berhenti. |
| usage | object | Opsional | Informasi penggunaan token untuk chat completion. |
| usage.prompt_tokens | integer | Opsional | Jumlah token input. |
| usage.completion_tokens | integer | Opsional | Jumlah token output. |
| usage.total_tokens | integer | Opsional | Jumlah token total. |
| usage.prompt_tokens_details | object | Opsional | Rincian penggunaan token input. |
| usage.prompt_tokens_details.cached_tokens | integer | Opsional | Token yang dilayani dari cache. |
Pengenalan model
DeepSeek deepseek-flash
DeepSeek V4.1 Flash adalah rute model DeepSeek di OurToken untuk developer yang membutuhkan pemahaman gambar native, konteks sangat panjang, dan traffic produksi yang hemat biaya. Model ini menggantikan lini V4 Flash yang dihentikan dan dipanggil melalui model ID deepseek-flash.
DeepSeek V4.1 Flash memberi tim rute DeepSeek berbiaya lebih rendah dengan jendela konteks 1M token, pemahaman gambar native, dan hingga 384K token output untuk pekerjaan aplikasi yang membutuhkan prompt panjang dan harga yang dapat diprediksi. Gunakan API DeepSeek V4.1 Flash saat ingin menguji workflow DeepSeek melalui API terpadu OurToken sambil menjaga model ID, log penggunaan, biaya cache, dan review harga dalam satu dashboard.
Mengapa model ini menonjol
- 60% dari harga referensi resmi (peak) DeepSeek V4.1 Flash untuk token input dan output.
- Setup API kompatibel OpenAI melalui endpoint OurToken yang sama dengan model lain yang didukung.
- Jendela konteks 1M token dengan hingga 384K token output untuk dokumen panjang, repository, dan agent multi-turn.
- Pemahaman gambar native, sehingga prompt vision dan teks dapat dikirim dalam satu request.
- Log dashboard dan visibilitas penggunaan membantu tim meninjau biaya request setelah launch.
Fitur utama
- Model ID: deepseek-flash
- Harga input: $0.1800 per 1M tokens di OurToken
- Harga output: $0.7200 per 1M tokens di OurToken
- Harga cache read: $0.0036 per 1M tokens di OurToken
- Harga cache write: $0 per 1M tokens di OurToken
- Provider: DeepSeek
Spesifikasi
Fitur API DeepSeek V4.1 Flash
OurToken mencakup akses API DeepSeek V4.1 Flash, harga, model ID, batas konteks, dan workflow developer. Rute ini menjaga satu key untuk traffic chat, coding, dan agent sementara log penggunaan dan biaya tetap terlihat.
Akses API terpadu
Panggil API DeepSeek V4.1 Flash melalui endpoint kompatibel OpenAI yang sama yang dipakai OurToken untuk setiap model yang didukung. Satu API key mencakup chat completions, responses, dan pesan bergaya Anthropic, sehingga DeepSeek V4.1 Flash dapat dibandingkan dengan rute lain tanpa memelihara jalur integrasi provider yang terpisah.
Harga token yang transparan
OurToken mencantumkan harga DeepSeek V4.1 Flash per juta token untuk input, output, cache read, dan cache write, bersebelahan dengan harga referensi resmi (peak). Karena model menagih cache hit jauh lebih murah daripada cache miss dan traffic off-peak lebih murah daripada peak, memeriksa tabel ini sebelum scale membantu memperkirakan spend.
Jendela konteks 1M
DeepSeek V4.1 Flash mendukung jendela konteks 1M token dengan hingga 384K token output, cocok untuk dokumen panjang, repository besar, dan agent multi-turn. Di OurToken, prompt panjang dapat dikirim dan dampak harga cache read terhadap biaya konteks berulang dapat dipantau.
Input vision dan multimodal
V4.1 Flash adalah build Flash pertama DeepSeek dengan pemahaman gambar native, sehingga satu panggilan deepseek v4.1 flash api dapat mencampur screenshot, halaman hasil scan, atau diagram dengan instruksi teks. Kombinasikan dengan jendela konteks 1M untuk review dokumen dan workflow QA visual.
Thinking dan tool call
Model berjalan dalam mode thinking secara default dan juga mendukung mode non-thinking, tool call, output JSON, dan respons terstruktur. Kombinasi itu cocok untuk assistant yang harus menalar sebuah tugas lalu mengembalikan payload machine-readable yang dapat divalidasi aplikasi.
Workflow agent dan coding
Arahkan coding agent seperti Claude Code, Codex CLI, atau OpenCode ke endpoint OurToken dan pilih DeepSeek V4.1 Flash sebagai model. OurToken menerbitkan panduan setup untuk tool tersebut, dan Responses API plus endpoint kompatibel Anthropic menjaga integrasi agent yang sudah ada tetap berjalan.
Cara menggunakan DeepSeek V4.1 Flash di OurToken
Ikuti enam langkah dari API key baru hingga traffic produksi: pilih model ID, kirim request pertama, bandingkan harga API DeepSeek V4.1 Flash, lalu pantau penggunaan dan biaya.
Buat API key
Masuk ke OurToken dan buat key dari halaman API Keys. Salin ke environment, bukan ke source control, lalu pastikan key aktif sebelum membangun sisa integrasi di sekitar DeepSeek V4.1 Flash.
01Pilih Model ID
Gunakan deepseek-flash sebagai nilai model untuk integrasi baru. Jika sudah men-deploy deepseek-v4-flash atau deepseek-v4-flash-vision-exp, nama tersebut masih berfungsi dan dilayani oleh V4.1 Flash, sehingga migrasi dapat menunggu siklus rilis berikutnya.
02Kirim request pertama
Arahkan client ke endpoint chat completions OurToken dan kirim prompt pendek sebelum menambah kompleksitas. Streaming, system prompt, dan riwayat multi-turn semuanya mengikuti bentuk request OpenAI, sehingga kode SDK yang ada biasanya hanya perlu mengganti base URL dan model.
03Bandingkan harga dan biaya cache
Periksa tabel harga DeepSeek V4.1 Flash untuk input, output, dan cache read, dan perhatikan bahwa traffic off-peak lebih murah daripada jam peak. Lalu perkirakan komposisi prompt sendiri, karena tingkat cache hit menentukan sebagian besar tagihan pada workload agent.
04Konfigurasi thinking dan tool
Tentukan apakah setiap workload sebaiknya berjalan di mode thinking atau non-thinking, lalu definisikan tool dan skema JSON jika responsnya dipakai sistem lain. Uji kedua pengaturan dengan prompt yang sama sebelum menetapkan default.
05Pantau penggunaan dan biaya
Pantau log request, jumlah token, dan biaya per model di dashboard OurToken setelah launch. Bandingkan latensi dan kualitas dengan rute yang sudah dijalankan, dan periksa ulang harga API DeepSeek V4.1 Flash setiap kali DeepSeek memperbarui tarif resmi.
06FAQ DeepSeek V4.1 Flash
Jawaban atas pertanyaan yang diajukan developer sebelum mengadopsi rute ini: apa itu, berapa biayanya, model ID mana yang dipakai, apa yang didukung, dan bagaimana perubahan V4 Pro memengaruhi traffic yang ada.