DeepSeek Lancarkan V4-Flash-0731: Latih Semula Seni Bina Yang Sama, Keupayaan Ejen Terus Berganda

DeepSeek telah mengemas kini V4-Flash pada 31 Julai. Tanpa mengubah seni bina dan bilangan parameter, mereka berjaya meningkatkan skor Terminal-Bench 2.1 daripada 61.8 kepada 82.7 melalui latihan susulan yang baharu. Berat model (weights) ini diletakkan di Hugging Face di bawah lesen MIT. Apakah maksudnya kepada pembangun tempatan dan syarikat yang ingin membina model sendiri?

Pada hari terakhir bulan Julai, notifikasi GitHub ramai jurutera di Taiwan dibanjiri mesej yang sama: DeepSeek telah dikemas kini.

Tiada majlis pelancaran, tiada pengumuman awal, bobot (weights) terus dimuat naik ke Hugging Face.

Apa yang menarik ialah helaian spesifikasinya—284B jumlah parameter, 13B parameter aktif, betul-betul sama seperti versi bulan April. Seni binanya tidak berubah, saiznya tidak berubah. Namun, skor untuk tugasan ejen melonjak hampir dua kali ganda.

Latar Belakang Peristiwa

Siri V4 DeepSeek rasmi dilancarkan pada 24 April 2026, dengan dokumentasi rasmi menyenaraikan dua model: V4-Pro dengan 1.6T jumlah parameter dan 49B aktif, diletakkan sebagai penanding model sumber tertutup teratas; manakala V4-Flash menampilkan 284B jumlah parameter dan 13B aktif, mengetengahkan kepantasan dan kecekapan kos. Kedua-duanya menampilkan konteks 1.000.000 token sebagai standard, menyokong mod penaakulan (thinking) dan bukan penaakulan, serta serasi dengan format API OpenAI ChatCompletions dan Anthropic. Pengumuman yang sama juga mengisytiharkan bahawa deepseek-chat dan deepseek-reasoner lama akan dihentikan perkhidmatannya selepas 24 Julai 2026.

Kemas kini pada 31 Julai ini melibatkan barisan V4-Flash, dengan kod versi 0731.

Fokus Utama Kali Ini

  • Seni bina kekal tanpa sebarang perubahan: Masih merupakan model MoE (Mixture of Experts) dengan 284B jumlah parameter dan 13B aktif. Pihak rasmi menjelaskan bahawa peningkatan ini terhasil daripada latihan susulan (post-training) yang semula, bukannya reka bentuk baharu.
  • Keupayaan ejen meningkat secara drastik: Skor Terminal-Bench 2.1 mencecah 82.7, manakala versi pratonton April lalu hanya pada 61.8.
  • Tugasan pengekodan turut meningkat: Skor DeepSWE mencapai 54.4.
  • Mengatasi model syarikat sendiri yang lebih besar: Dalam setiap penilaian ejen yang diterbitkan oleh DeepSeek, ia menewaskan versi pratonton V4-Pro.
  • Bobot menggunakan lesen MIT: Terus diletakkan di Hugging Face, menjadikannya salah satu lesen sumber terbuka yang paling longgar setakat ini.
  • Sokongan asli API untuk format Responses API, serta dioptimumkan untuk Codex.

Mengapa "Seni Bina Yang Sama Dilatih Semula" Lebih Menarik Perhatian

Sepanjang dua tahun lalu, naratif peningkatan model hampir selalunya berkisar pada "parameter lebih besar, data lebih banyak, kuasa pengkomputan lebih mahal." Kali ini tidak begitu.

Langkah DeepSeek ini membuktikan satu perkara: Melakukan latihan susulan (post-training) dengan betul pada seni bina sedia ada boleh memberikan pulangan yang jauh lebih berbaloi berbanding melumpuk parameter. Lonjakan dari 61.8 ke 82.7 ini dianggap berita besar dalam mana-mana kemas kini, dan mereka tidak perlu membelanjakan satu sen pun untuk R&D seni bina.

Implikasinya kepada keseluruhan industri ialah: Persaingan keupayaan model sedang beralih daripada "siapa modelnya paling besar" kepada "siapa yang lebih pakar melatih ejen." Halangan untuk yang kedua adalah jauh lebih rendah, bermakna ruang pengejaran untuk pihak pendatang baharu (latecomers) adalah lebih luas daripada yang disangkakan.

Secara jujur, saya merasakan ini jauh lebih penting daripada sekadar satu lagi model yang lebih besar.

Analisis Impak Pasaran

Kepada Pengguna di Taiwan

Pengguna harian tidak akan merasai impak secara langsung dalam masa terdekat, tetapi melalui pelbagai perkhidmatan pihak ketiga yang menyepadukan DeepSeek, anda akan mula merasai bahawa "Pembantu AI lebih cekap menyiapkan tugasan sendiri." Ini adalah manifestasi langsung daripada peningkatan keupayaan ejen—kurangkan sedikit "saya senaraikan langkah-langkah untuk anda," dan banyakkan "saya sudah siapkan, hasilnya ada di sini."

Impak dari segi harga juga wajar diberi perhatian. Model sumber terbuka yang berprestasi tinggi akan terus menekan harga pasaran API secara keseluruhan, yang tentunya berita baik buat PKS dan pembangun individu di Taiwan.

Kepada Aplikasi Perusahaan di Taiwan

Peluang sebenar terletak pada aspek kedaulatan data (data sovereignty).

Lesen MIT berserta bobot yang boleh dimuat turun bermakna secara teorinya anda boleh menjalankan model ini di pusat data anda sendiri, memastikan data tidak keluar langsung dari sempadan negara. Bagi industri yang tertakluk kepada kawal selia ketat seperti kewangan, penjagaan kesihatan, dan undang-undang, ini adalah sesuatu yang tidak boleh diberikan oleh API sumber tertutup.

Namun, harganya perlu dijelaskan dengan telus. Model dengan 284B jumlah parameter, walaupun hanya 13B yang aktif, tetap memerlukan memori GPU (VRAM) yang besar untuk dimuatkan. Dalam kebanyakan kes, ia memerlukan perkakasan gred pelayan berbilang kad (multi-card) serta tenaga kerja penyelenggaraan. Bagi kebanyakan PKS di Taiwan, menggunakan API atau hos awan masih jauh lebih kos efektif.

Senario sebenar yang benar-benar berbaloi untuk pemasangan sendiri (self-hosting) hanya ada satu: Data sama sekali tidak boleh keluar dari premis, dan volum penggunaan cukup besar untuk menampung kos perkakasan. Kedua-dua syarat ini mesti dipenuhi tanpa terkecuali.

Selain itu, aspek keselamatan siber dan pematuhan perlu diingatkan: Penggunaan model daripada vendor berlatarbelakangkan China tertakluk kepada peraturan dan sekatan tambahan bagi industri tertentu dan perolehan kerajaan. Sila sahkan peraturan industri anda sebelum pelaksanaan, agar tidak menunggu hingga audit dijalankan baharu menemui masalah.

Kepada Pembangun

Tiga perkara praktikal yang boleh dilakukan:

Pertama, jika anda sedang membina ejen (agent), versi ini wajar diuji semula. Peningkatan keupayaan ejen bukanlah angka pemasaran semata-mata. Terminal-Bench menguji keupayaan menyelesaikan tugasan sebenar dalam persekitaran terminal, yang sangat hampir dengan senario ejen dunia sebenar. Jalankan ujian menggunakan tugasan anda sendiri untuk melihat sama ada ia boleh menggantikan model sedia ada.

Kedua, keserasian format API mengurangkan kos peralihan. Keserasian dengan format OpenAI ChatCompletions dan Anthropic, ditambah sokongan asli Responses API kali ini, bermakna anda boleh membandingkan model yang berbeza dengan perubahan kod yang minimum. Jika anda ingin melakukan perbandingan harga dan penukaran berbilang model, Panduan OpenRouter adalah titik permulaan yang praktikal.

Ketiga, jangan hanya melihat skor yang diterbitkan oleh vendor. Ini adalah nasihat lama tetapi masih ramai yang terjebak. Persekitaran ujian, reka bentuk prompt, dan strategi percubaan semula (retry) bagi skor penarafan semuanya boleh mempengaruhi keputusan. Model yang sama boleh menghasilkan skor yang jauh berbeza apabila dikendalikan oleh orang yang berbeza. Menjalankan ujian pada tugasan anda sendiri adalah satu-satunya penilaian yang bermakna.

Trend Perkembangan Masa Depan

Pertama, latihan susulan (post-training) akan menjadi medan persaingan baharu. Apabila pulangan marginal seni bina semakin merosot, kaedah latihan akan menjadi sumber pembezaan (differentiation). Ini juga bermakna kelajuan iterasi model akan menjadi lebih pantas—tanpa perlu melakukan pra-latihan semula, hanya dengan mengubah resipi latihan susulan, versi baharu boleh dihasilkan.

Kedua, jurang antara sumber terbuka dan sumber tertutup akan terpadam pada tugasan tertentu. Keupayaan umum mungkin masih mempunyai jurang, tetapi dalam bidang yang boleh dinilai secara jelas seperti "pengekodan" dan "menjalankan tugasan ejen," kelajuan pengejaran model sumber terbuka adalah sangat pantas. Ini adalah berita baik untuk syarikat yang ingin mengawal kos.

Ketiga, pemilihan model akan menjadi keputusan kejuruteraan, bukannya keputusan jenayah/jenama. Apabila kos peralihan turun dengan ketara, pemilihan model akan kembali kepada "mana yang berprestasi baik pada tugasan saya dan murah." Ini adalah perkembangan sihat untuk syarikat di Taiwan—tidak perlu lagi bertaruh pada satu pembekal tunggal.

Rumusan dan Ulasan Akademi TheAI

Kemas kini kali ini hadir tanpa majlis pelancaran yang megah, tetapi ia menyampaikan satu naratif yang sangat penting: Kemajuan AI tidak semestinya bergantung kepada perkakasan yang lebih mahal.

Seni bina yang sama, jumlah parameter yang sama, dilatih semula pada bahagian latihan susulan, dan keupayaan ejen melonjak dari 61.8 kepada 82.7. Ini adalah berita yang sangat membakar semangat bagi pasukan yang tidak mempunyai sumber pengkomputan tanpa had.

Ulasan: Apabila nilai "melakukan latihan dengan betul" mula melebihi "membuat model lebih besar", perlumbaan ini telah berubah daripada permainan modal kembali kepada masalah kejuruteraan. Dan mengenai masalah kejuruteraan, pasukan di Taiwan tidak pernah merasa takut.

Cadangan konkrit untuk pembaca di Taiwan: Jika membangunkan aplikasi AI, luangkan masa sejam minggu ini untuk melakukan satu perkara—tukar model yang anda gunakan sekarang kepada versi ini, jalankan tugasan teras anda sekali, dan catat kos serta kadar kejayaan. Jangan percaya pada sebarang skor penarafan; angka yang terhasil daripada tugasan anda sendiri adalah yang paling benar. Bagi pelaksanaan perusahaan, pastikan anda mengesahkan keperluan pematuhan industri anda terhadap sumber model sebelum membincangkan penilaian teknikal.

Bacaan lanjut: Analisis Pelancaran Claude Opus 5 boleh dijadikan perbandingan dengan haluan kem sumber tertutup; untuk memahami pelaksanaan ejen AI, lihat Panduan Pelaksanaan AI Agent; manakala perkembangan model tempatan Taiwan boleh merujuk kepada Status Semasa Yating dan TAIDE.

Sumber Data

Disusun mengikut maklumat awam, sila rujuk kepada pihak rasmi sebagai rujukan utama. Skor penarafan adalah angka yang diumumkan oleh vendor; prestasi sebenar hendaklah dinilai berdasarkan ujian kendiri pada tugasan masing-masing. Artikel ini bukan merupakan nasihat pelaburan.

Soalan Lazim

Apakah perbezaan antara DeepSeek V4-Flash-0731 dengan versi bulan April?

Seni bina dan bilangan parameter langsung tidak berubah, iaitu model MoE dengan 284B jumlah parameter dan 13B parameter aktif. Perbezaannya terletak pada latihan susulan (post-training) baharu yang difokuskan pada tugasan ejen, di mana Terminal-Bench 2.1 meningkat daripada 61.8 pada versi pratonton April kepada 82.7. Secara ringkasnya, peningkatan kali ini datang daripada kaedah latihan dan bukannya reka bentuk model.

Adakah lesen MIT bermaksud saya boleh menggunakannya secara komersial?

Lesen MIT ialah lesen sumber terbuka yang sangat longgar. Ia secara amnya membenarkan penggunaan komersial, pengubahsuaian, dan pengedaran semula, selagi kenyataan lesen asal dikehendaki. Walau bagaimanapun, anda tetap perlu membaca terma lengkap dan dasar penggunaan pada halaman model sebelum menggunakannya secara praktikal kerana lesen berat model kadangkala mengenakan sekatan tambahan. Untuk pelancongan komersial, adalah dinasihatkan untuk berunding dengan pihak guaman.

Adakah praktikal untuk syarikat tempatan membina model ini sendiri?

Model dengan 284B jumlah parameter memerlukan memori paparan (VRAM) yang besar untuk dimuatkan, walaupun hanya 13B parameter diaktifkan, dan biasanya memerlukan perisian pelayan berbilang kad. Bagi kebanyakan PKS, menggunakan API atau hos awan adalah lebih menjimatkan berbanding membina sendiri. Senario yang benar-benar memerlukan pembinaan sendiri adalah industri di mana data tidak boleh keluar dari premis sama sekali, seperti perniagaan tertentu dalam sektor kewangan dan perubatan.

Mengapa "keupayaan ejen" menjadi titik tumpuan persaingan?

Ini kerana senario penggunaan sedang berubah. Pada masa lalu, persaingan adalah mengenai kualiti menjawab soalan; kini, ia adalah mengenai keupayaan untuk melaksanakan pelbagai langkah secara berterusan, memanggil alat dengan betul, dan mengesahkan keputusan sendiri. Ujian seperti Terminal-Bench menguji keupayaan untuk menyelesaikan tugasan sebenar dalam persekitaran terminal, yang jauh lebih hampir dengan keperluan persekitaran pengeluaran berbanding soal jawab mudah.

繁體中文版 →