DeepSeek Merilis V4-Flash-0731: Latih Ulang Arsitektur yang Sama, Kemampuan Agen Langsung Berlipat Ganda

Pada 31 Juli, DeepSeek meluncurkan pembaruan V4-Flash. Tanpa mengubah arsitektur atau jumlah parameter sama sekali, mereka berhasil mendongkrak skor Terminal-Bench 2.1 dari 61.8 menjadi 82.7 melalui pelatihan pasca (post-training) ulang. Bobot model ini tetap dirilis di Hugging Face di bawah lisensi MIT. Apa arti semua ini bagi para pengembang dan perusahaan yang ingin membangun model AI mandiri?

Pada hari terakhir bulan Juli, notifikasi GitHub milik banyak engineer di Taiwan menampilkan pesan yang sama: DeepSeek telah diperbarui.

Tanpa konferensi pers, tanpa pengumuman sebelumnya, bobot (weights) modelnya langsung dirilis ke Hugging Face.

Yang menarik adalah lembar spesifikasinya—284B parameter total, 13B parameter aktif, persis sama dengan versi bulan April. Arsitekturnya tidak berubah, ukurannya pun sama. Namun, skor untuk tugas agen (agent tasks) melonjak hampir dua kali lipat.

Latar Belakang Peristiwa

Seri V4 DeepSeek resmi dirilis pada 24 April 2026, dengan dokumentasi resmi yang mencantumkan dua model: V4-Pro dengan 1.6T parameter total dan 49B parameter aktif, yang bersaing dengan model tertutup (closed-source) papan atas; serta V4-Flash dengan 284B parameter total dan 13B parameter aktif, yang berfokus pada kecepatan dan efisiensi biaya. Keduanya dilengkapi dengan konteks standar 100 ribu token, mendukung mode penalaran (thinking) dan non-penalaran, serta kompatibel dengan format API OpenAI ChatCompletions dan Anthropic. Pengumuman yang sama juga menyatakan bahwa deepseek-chat dan deepseek-reasoner lama akan dihentikan layanannya setelah 24 Juli 2026.

Pembaruan pada tanggal 31 Juli ini berfokus pada lini V4-Flash dengan kode versi 0731.

Poin Utama Pembaruan

  • Arsitektur sama sekali tidak berubah: Tetap menggunakan model MoE (Mixture of Experts) dengan 284B total parameter dan 13B parameter aktif. Pihak resmi menyatakan dengan jelas bahwa peningkatan ini berasal dari pelatihan ulang (post-training) yang diperbarui, bukan desain baru.
  • Kemampuan agen meningkat secara signifikan: Skor Terminal-Bench 2.1 mencapai 82.7, naik dari 61.8 pada versi pratinjau bulan April.
  • Tugas pemrograman ikut meningkat secara bersamaan: Skor DeepSWE mencapai 54.4.
  • Melampaui model internal yang lebih besar: Dalam setiap tolok ukur (benchmark) agen yang dirilis oleh DeepSeek, versi ini mengungguli pratinjau V4-Pro.
  • Bobot menggunakan lisensi MIT: Langsung diunggah ke Hugging Face, menjadikannya salah satu lisensi open-source paling longgar saat ini.
  • API secara native mendukung format Responses API dan telah dioptimalkan untuk Codex.

Mengapa "Melatih Ulang Arsitektur yang Sama" Jauh Lebih Menarik

Selama dua tahun terakhir, narasi peningkatan model hampir selalu berkisar pada "parameter lebih besar, data lebih banyak, dan daya komputasi lebih mahal." Kali ini tidak.

Langkah DeepSeek ini membuktikan satu hal: Melakukan post-training dengan benar pada arsitektur yang sudah ada dapat memberikan keuntungan yang jauh lebih hemat biaya daripada sekadar menumpuk parameter. Lonjakan dari 61.8 ke 82.7 adalah berita besar dalam pemutakhiran versi mana pun, dan mereka tidak mengeluarkan biaya sepeser pun untuk riset dan pengembangan arsitektur.

Implikasi bagi seluruh industri adalah: persaingan kemampuan model bergeser dari "siapa modelnya yang paling besar" ke "siapa yang lebih paham cara melatih agen." Hambatan masuk untuk yang kedua jauh lebih rendah, yang berarti ruang bagi para penantang untuk mengejar ketertinggalan jauh lebih besar dari yang dibayangkan.

Sejujurnya, saya merasa ini jauh lebih penting daripada sekadar kemunculan model lain yang berukuran lebih besar.

Analisis Dampak Pasar

Bagi Pengguna di Taiwan

Pengguna sehari-hari mungkin tidak akan langsung merasakannya dalam jangka pendek, tetapi melalui berbagai layanan pihak ketiga yang terintegrasi dengan DeepSeek, Anda akan merasakan bahwa "asisten AI kini lebih mandiri dalam menyelesaikan pekerjaan." Ini adalah wujud nyata dari peningkatan kemampuan agen—mengurangi frasa "Saya bantu daftarkan langkah-langkahnya" dan lebih banyak melakukan "Pekerjaan sudah selesai, hasilnya ada di sini."

Dampak pada sisi harga juga patut dicerminkan. Model open-source yang berkinerja tinggi akan terus menekan harga API di seluruh pasar, yang merupakan kabar baik bagi UKM dan pengembang independen di Taiwan.

Bagi Aplikasi Perusahaan di Taiwan

Peluang sesungguhnya terletak pada aspek kedaulatan data (data sovereignty).

Lisensi MIT beserta bobot model yang dapat diunduh berarti secara teori Anda dapat menjalankan model ini di server lokal (on-premise) Anda sendiri, sehingga data sama sekali tidak keluar negeri. Bagi industri yang berada di bawah regulasi ketat seperti keuangan, medis, dan hukum, ini adalah sesuatu yang tidak dapat diberikan oleh API tertutup.

Namun, harganya harus dijelaskan secara transparan. Model dengan total parameter 284B, meskipun hanya mengaktifkan 13B, tetap memerlukan memori GPU (VRAM) yang sangat besar untuk memuat bobotnya. Dalam banyak kasus, hal ini memerlukan perangkat keras tingkat server multi-GPU serta tenaga operasional yang memadai. Bagi sebagian besar UKM di Taiwan, menggunakan API atau layanan cloud yang di-hosting tetap jauh lebih hemat biaya.

Skenario penerapan mandiri (self-hosting) yang benar-benar layak hanya ada satu: Data sama sekali tidak boleh keluar negeri, dan volume penggunaannya cukup besar untuk menutupi biaya perangkat keras. Kedua syarat ini mutlak dipenuhi.

Selain itu, perlu diingat dari sisi keamanan siber dan kepatuhan: penggunaan model dari perusahaan yang berlatar belakang Tiongkok memiliki aturan dan batasan tambahan untuk industri tertentu serta pengadaan pemerintah. Harap periksa regulasi industri Anda sebelum penerapan, jangan sampai baru menyadari masalahnya saat audit tiba.

Bagi Pengembang

Tiga hal praktis yang dapat dilakukan:

Pertama, jika Anda sedang mengembangkan agen (agent), versi ini layak diuji ulang. Peningkatan kemampuan agen bukan sekadar angka pemasaran; Terminal-Bench menguji penyelesaian tugas nyata di lingkungan terminal, yang sangat mirip dengan skenario agen di dunia nyata. Jalankan pengujian dengan tugas Anda sendiri untuk melihat apakah model ini dapat menggantikan model yang sedang digunakan saat ini.

Kedua, kompatibilitas format API menurunkan biaya perpindahan (switching cost). Kompatibilitas dengan format OpenAI ChatCompletions dan Anthropic, ditambah dukungan native terhadap Responses API kali ini, berarti Anda dapat membandingkan berbagai model dengan sedikit modifikasi saja. Jika Anda ingin melakukan perbandingan harga dan perpindahan antar-model, Panduan OpenRouter adalah titik awal yang praktis.

Ketiga, jangan hanya melihat skor yang dipublikasikan oleh vendor. Ini adalah klise, namun selalu ada orang yang terjebak. Lingkungan pengujian, desain prompt, dan strategi percobaan ulang (retry strategy) dari skor benchmark semuanya dapat memengaruhi hasil; model yang sama bisa menghasilkan skor yang sangat berbeda di tangan orang yang berbeda. Menjalankan pengujian dengan tugas Anda sendiri adalah satu-satunya tolok ukur yang bermakna.

Tren Perkembangan Masa Depan

Pertama, post-training akan menjadi medan pertempuran kompetitif yang baru. Ketika keuntungan marjinal dari arsitektur mulai mendatar (diminishing returns), metode pelatihan menjadi sumber diferensiasi. Ini juga berarti kecepatan iterasi model akan semakin cepat—tanpa harus melakukan pra-pelatihan ulang (pre-training), cukup mengubah resep post-training untuk merilis versi baru.

Kedua, kesenjangan antara open-source dan closed-source akan menyusut pada tugas-tugas tertentu. Kemampuan general mungkin masih memiliki selisih, namun dalam bidang yang dapat diukur secara jelas seperti "pemrograman" dan "menjalankan tugas agen," kecepatan kejar model open-source sangat cepat. Ini adalah berita baik bagi perusahaan yang ingin mengendalikan biaya.

Ketiga, pemilihan model akan menjadi keputusan teknik, bukan keputusan merek. Ketika biaya perpindahan menjadi sangat rendah, memilih model akan kembali pada "mana yang berjalan dengan baik pada tugas saya dan harganya murah." Ini adalah hal yang baik bagi perusahaan di Taiwan—mereka tidak perlu lagi bertaruh pada satu pemasok tunggal.

Kesimpulan dan Komentar TheAI Akademi

Pembaruan kali ini tidak diiringi dengan konferensi pers yang megah, tetapi menyajikan cerita yang sangat penting: kemajuan AI tidak harus bergantung pada perangkat keras yang lebih mahal.

Dengan arsitektur yang sama, jumlah parameter yang sama, dan pelatihan ulang pada tahap post-training, kemampuan agen melonjak dari 61.8 ke 82.7. Ini adalah berita yang sangat memotivasi bagi tim-tim yang tidak memiliki sumber daya komputasi tak terbatas.

Komentar: Ketika nilai dari "melakukan pelatihan dengan benar" mulai melampaui "membuat model lebih besar," kompetisi ini bergeser dari permainan modal kembali menjadi masalah teknik. Dan dalam hal masalah teknik, tim-tim di Taiwan tidak pernah merasa takut.

Saran konkret bagi pembaca di Taiwan: Jika Anda sedang mengembangkan aplikasi AI, luangkan waktu satu jam minggu ini untuk melakukan satu hal—ganti model yang Anda gunakan saat ini dengan versi ini, jalankan tugas inti Anda, lalu catat biayanya dan tingkat keberhasilannya. Tidak perlu percaya pada skor benchmark apa pun; angka yang dihasilkan dari tugas Anda sendiri adalah satu-satunya yang nyata. Mengenai adopsi perusahaan, pastikan terlebih dahulu persyaratan kepatuhan industri Anda terhadap sumber model sebelum mendiskusikan evaluasi teknis.

Bacaan lanjutan: Analisis Rilis Claude Opus 5 dapat digunakan untuk membandingkan arah kubu model tertutup; untuk memahami implementasi agen AI, baca Panduan Implementasi AI Agent; sedangkan kemajuan model mandiri Taiwan dapat merujuk pada Situasi Terkini Yating dan TAIDE.

Sumber Data

Disusun berdasarkan informasi publik dan berpedoman pada pengumuman resmi. Skor tolok ukur merupakan angka yang dipublikasikan oleh vendor; performa aktual harap disesuaikan dengan pengujian pada tugas masing-masing. Artikel ini bukan merupakan nasihat investasi.

Pertanyaan yang Sering Diajukan

Apa perbedaan antara DeepSeek V4-Flash-0731 dengan versi bulan April lalu?

Arsitektur dan jumlah parameternya sama sekali tidak berubah, yaitu model MoE dengan total 284B parameter dan 13B parameter aktif. Perbedaannya terletak pada pelatihan pasca (post-training) yang baru untuk tugas-tugas agen, di mana skor Terminal-Bench 2.1 melonjak dari 61.8 pada versi pratinjau April lalu menjadi 82.7. Dengan kata lain, kemajuan kali ini berasal dari metode pelatihan, bukan desain modelnya.

Apakah lisensi MIT berarti saya bisa menggunakannya secara komersial?

Lisensi MIT adalah lisensi sumber terbuka (open-source) yang sangat longgar, yang umumnya mengizinkan penggunaan komersial, modifikasi, dan redistribusi, biasanya hanya dengan syarat mencantumkan pemberitahuan hak cipta. Namun, Anda tetap harus membaca dengan teliti syarat dan ketentuan lengkap serta kebijakan penggunaan yang disertakan di halaman model sebelum menggunakannya, karena lisensi bobot model terkadang menyertakan batasan tambahan. Untuk penerapan komersial, disarankan untuk berkonsultasi dengan ahli hukum.

Apakah praktis bagi perusahaan untuk membangun model ini secara mandiri?

Model dengan total 284B parameter, meskipun hanya mengaktifkan 13B parameter, tetap membutuhkan VRAM (memori video) yang sangat besar untuk memuat bobotnya, biasanya memerlukan perangkat keras kelas server multi-GPU. Bagi sebagian besar usaha kecil dan menengah, menggunakan API atau layanan cloud jauh lebih hemat biaya daripada membangun infrastruktur sendiri. Skenario yang benar-benar membutuhkan pembangunan mandiri adalah industri yang data internalnya tidak boleh keluar sama sekali, seperti layanan khusus di sektor keuangan dan kesehatan.

Mengapa "kemampuan agen" menjadi fokus utama persaingan?

Karena skenario penggunaannya telah berubah. Di masa lalu, persaingan berfokus pada kualitas jawaban atas suatu pertanyaan; kini, persaingannya adalah apakah AI mampu menjalankan berbagai langkah secara beruntun, memanggil alat (tools) dengan benar, dan memverifikasi hasilnya sendiri. Ujian seperti Terminal-Bench menguji kemampuan untuk menyelesaikan tugas nyata di lingkungan terminal, yang jauh lebih mendekati kebutuhan dunia kerja yang sebenarnya dibandingkan sekadar tanya jawab biasa.

繁體中文版 →