Inilabas ang DeepSeek V4-Flash-0731: Parehong arkitektura ngunit muling sinanay, dumoble ang kakayahan sa pagiging agent

Noong Hulyo 31, in-update ng DeepSeek ang V4-Flash. Kahit walang binago sa arkitektura at bilang ng parameters, tinaas nito ang Terminal-Bench 2.1 mula 61.8 patungong 82.7 sa pamamagitan ng muling pag-post-train, at inilagay pa rin ang weights sa Hugging Face gamit ang MIT license. Ano kaya ang ibig sabihin nito para sa mga developer at kumpanyang gustong gumawa ng sarili nilang modelo?

Sa huling araw ng Hulyo, marami sa mga notification feed ng mga inhinyero sa Taiwan ang nakatanggap ng iisang mensahe: Nag-update ang DeepSeek.

Walang press conference, walang paunang abiso—diretsong inilagay ang mga weights sa Hugging Face.

Ang kawili-wili ay ang specs sheet—284B total parameters, 13B active parameters, na eksaktong pareho sa bersyon noong Abril. Walang binagong arkitektura at walang tinaas na size. Pero ang marka sa mga agentic tasks ay halos dumoble.

Background ng Kaganapan

Opisyal na inilunsad ang V4 series ng DeepSeek noong Abril 24, 2026, kung saan dalawang modelo ang nakalista sa opisyal na dokumentasyon: ang V4-Pro na may 1.6T total parameters at 49B active parameters na direktang nakikipag-kumpetensya sa mga nangungunang closed-source models; at ang V4-Flash na may 284B total parameters at 13B active parameters, na nakatutok sa bilis at pagiging cost-effective. Pareho silang may standard na 1.0M token context window, sumusuporta sa thinking at non-thinking modes, at compatible sa OpenAI ChatCompletions at Anthropic API formats. Inanunsyo rin sa parehong pahayag na ang lumang deepseek-chat at deepseek-reasoner ay ititigil na ang serbisyo pagkatapos ng Hulyo 24, 2026.

Ang in-update noong Hulyo 31 ay ang linya ng V4-Flash, na may version code na 0731.

Mga Pangunahing Punto ng Update

  • Walang binagong arkitektura: Nananatili itong 284B total parameters, 13B active MoE (Mixture of Experts) model. Malinaw na sinabi ng opisyal na ang pag-unlad ay nagmula sa reinjected post-training, hindi sa bagong disenyo.
  • Malaking pagtaas sa kakayahan ng Agent: Umabot sa 82.7 ang marka sa Terminal-Bench 2.1, mula sa 61.8 ng preview version noong Abril.
  • Sabay-sabay na pag-unlad sa Programming Tasks: Umabot sa 54.4 ang marka sa DeepSWE.
  • Nilampasan ang sarili nitong mas malaking modelo: Sa bawat agent evaluation na inilabas ng DeepSeek, tinalo nito ang V4-Pro preview version.
  • MIT License ang mga Weights: Direktang inilagay sa Hugging Face, na isa sa pinakamaluwag na open-source licenses sa ngayon.
  • Sinusuportahan nang katutubo (native) ng API ang Responses API format, at may iniakmang optimization para sa Codex.

Bakit Mas Kapansin-pansin ang "Pag-retrain sa Parehong Arkitektura"

Sa nakalipas na dalawang taon, ang kuwento ng pagpapahusay ng mga modelo ay halos palaging tungkol sa "mas malalaking parameter, mas maraming datos, at mas mahal na compute." Hindi ito ganoon ngayon.

Pinatunayan ng hakbang na ito ng DeepSeek ang isang bagay: Ang paggawa nang tama sa post-training gamit ang umiiral na arkitektura ay maaaring magbigay ng mas malaking pakinabang kaysa sa simpleng pagdaragdag ng mga parameter. Mula 61.8 hanggang 82.7, ang laki ng pagbabagong ito ay maituturing na malaking balita sa anumang pag-update, at ginawa nila ito nang hindi gumagastos ng kahit isang sentimo sa pananaliksik sa arkitektura.

Ang kahulugan nito para sa buong industriya ay: ang kumpetisyon sa kakayahan ng modelo ay lumilipat mula sa "sino ang may malaking modelo" patungo sa "sino ang mas bihasa sa pag-train ng mga agent." Mas mababa ang hadlang sa huli, na nangangahulugang mas malaki ang puwang para sa mga humahabol kaysa sa inaasahan.

Sa totoo lang, sa tingin ko mas mahalaga ito kaysa sa isa na namang mas malaking modelo.

Pagsusuri sa Epekto sa Merkado

Para sa mga Gumagamit sa Taiwan

Hindi ito direktang mararamdaman ng mga pang-araw-araw na user sa maikling panahon, ngunit sa pamamagitan ng iba't ibang third-party services na konektado sa DeepSeek, mararamdaman mong "mas kayang tapusin ng AI assistant ang mga bagay-bagay nang mag-isa." Direktang manipestasyon ito ng pinahusay na kakayahan ng agent—mas kaunting "Ilista ko para sa iyo ang mga hakbang" at mas maraming "Tapos na ako, narito ang resulta."

Pansinin din ang epekto sa presyo. Ang open-source at mataas ang performance na modelo ay patuloy na magpapababa ng mga presyo ng API sa buong merkado, na magandang balita para sa mga maliliit at katamtamang negosyo (SMEs) at mga indibidwal na developer sa Taiwan.

Para sa mga Aplikasyon ng Negosyo sa Taiwan

Ang tunay na oportunidad ay nasa data sovereignty.

Ang lisensya ng MIT at ang mga mada-download na weights ay nangangahulugang teoretikal na maaari mong patakbuhin ang modelo sa iyong sariling server room, at ang datos ay hindi kailanman lalabas ng bansa. Para sa mga industriya na may mahigpit na regulasyon tulad ng pananalapi, pangangalagang pangkalusugan, at batas, ito ang bagay na hindi maibibigay ng mga closed-source API.

Ngunit kailangang malinaw na sabihin ang kapalit. Kahit na 13B lamang ang aktibo para sa isang 284B total parameter na modelo, mangangailangan pa rin ito ng malaking halaga ng VRAM para ma-load ang mga weights. Sa karamihan ng mga kaso, nangangailangan ito ng multi-card server-grade hardware, pati na rin ng maintenance personnel. Para sa karamihan ng mga SME sa Taiwan, mas mura pa rin ang gumamit ng API o cloud hosting.

Mayroon lamang isang senaryo kung kailan talagang sulit ang self-hosting: Ang datos ay hindi kailanman dapat lumabas ng bansa, at ang paggamit ay sapat na malaki upang mabawi ang gastos sa hardware. Ang dalawang kundisyong ito ay parehong kinakailangan.

Bilang paalala rin sa bahagi ng seguridad at pagsunod (compliance): Ang paggamit ng mga modelong may pinagmulang kumpanya sa Tsina ay may karagdagang regulasyon at paghihigpit para sa ilang industriya at pagbili ng pamahalaan. Mangyaring kumpirmahin muna ang mga patakaran ng iyong industriya bago magpatupad, upang maiwasang malaman lamang ang problema sa oras ng pag-audit.

Para sa mga Developer

Tatlong praktikal na bagay na maaaring gawin:

Una, kung gumagawa ka ng mga agent, sulit na subukan muli ang bersyong ito. Ang pagpapabuti sa kakayahan ng agent ay hindi lamang mga numero sa marketing; sinusubok ng Terminal-Bench ang pagkumpleto ng mga tunay na gawain sa isang terminal environment, na napakalapit sa mga totoong sitwasyon ng agent. Patakbuhin ito gamit ang iyong sariling mga gawain upang makita kung maaari nitong palitan ang kasalukuyang modelo.

Pangalawa, binabawasan ng API format compatibility ang gastos sa paglipat. Ang pagiging compatible sa OpenAI ChatCompletions at Anthropic formats, kasama ang katutubong suporta sa Responses API sa pagkakataong ito, ay nangangahulugang maaari mong ihambing ang iba't ibang mga modelo sa pamamagitan ng napakaliit na pagbabago. Kung nais mong gumawa ng multi-model price comparison at switching, ang Gabay sa OpenRouter ay isang praktikal na panimulang punto.

Pangatlo, huwag lamang tumingin sa mga markang inilabas ng tagagawa. Ito ay isang lumang usapin ngunit may mga tao pa ring nagkakamali rito. Ang test environment, prompt design, at retry strategy ng mga evaluation score ay makakaapekto sa mga resulta. Ang parehong modelo ay maaaring magkaroon ng malaking pagkakaiba sa marka sa magkakaibang tao. Ang pagpapatakbo nito gamit ang iyong sariling mga gawain ang tanging makabuluhang pagsusuri.

Mga Trend sa Hinaharap

Una, ang post-training ay magiging bagong larangan ng digmaan para sa kumpetisyon. Habang bumababa ang marginal returns ng arkitektura, ang mga paraan ng pag-train ay nagiging pinagmulan ng pagkakaiba (differentiation). Ipinapahiwatig din nito na mas mabilis ang bilis ng pag-ulit ng mga modelo—hindi na kailangang i-re-pre-train, maaari na lamang baguhin ang post-training recipe upang makagawa ng bagong bersyon.

Pangalawa, ang agwat sa pagitan ng open-source at closed-source ay mawawala sa mga tiyak na gawain. Maaaring mayroon pang agwat sa pangkalahatang kakayahan, ngunit sa mga lugar na malinaw na nasusuri tulad ng "pagsulat ng programa" at "pagpapatakbo ng mga agent," napakabilis ng paghabol ng mga open-source na modelo. Magandang balita ito para sa mga negosyong nais kumontrol ng mga gastos.

Pangatlo, ang pagpili ng modelo ay magiging isang desisyong pang-inhinyero sa halip na isang desisyon sa tatak (brand). Kapag bumaba nang husto ang gastos sa paglipat, ang pagpili kung aling modelo ang gagamitin ay babalik sa "alin ang tumatakbo nang maayos sa aking gawain at mura." Magandang balita ito para sa mga negosyo sa Taiwan—hindi na kinakailangang magsugal sa iisang supplier lamang.

Buod at Puna ng TheAI學院

Walang marangyang press conference ang update na ito, ngunit nagkuwento ito ng isang napakahahalagang bagay: Ang pag-unlad ng AI ay hindi kinakailangang umasa sa mas mahal na hardware.

Parehong arkitektura, parehong dami ng parameter, at sa pamamagitan lamang ng muling pag-train ng post-training, ang kakayahan ng agent ay tumalon mula 61.8 patungong 82.7. Para sa mga koponang walang walang hanggang compute resources, talagang nakakaganyak itong balita.

Puna: Kapag ang halaga ng "pag-aayos nang tama sa training" ay nagsimulang lumampas sa "pagpapalaki ng modelo," ang kompetisyong ito ay lumipat mula sa isang laro ng kapital pabalik sa isang problemang pang-inhinyero. At ang mga problemang pang-inhinyero ay ang mga bagay na hindi kailanman ikinatakot ng mga koponan sa Taiwan.

Konkretong mungkahi sa mga mambabasa sa Taiwan: Kung bumubuo ka ng mga aplikasyon ng AI, maglaan ng isang oras ngayong linggo para gawin ang isang bagay—palitan ang modelong kasalukuyang ginagamit mo ng bersyong ito, patakbuhin ang iyong sarili mong pangunahing gawain, at itala ang gastos at rate ng tagumpay. Huwag maniwala sa anumang evaluation score; ang mga numerong nanggaling sa pagpapatakbo ng iyong sariling gawain ang tanging totoo. Para sa pagpapatupad ng negosyo, kumpirmahin muna ang mga kinakailangan sa pagsunod (compliance) ng iyong industriya para sa pinagmulan ng modelo bago pag-usapan ang teknikal na pagsusuri.

Karagdagang Pagbabasa: Ang Pagsusuri sa Paglulunsad ng Claude Opus 5 ay maaaring ihambing sa landas ng closed-source camp; upang maunawaan ang pagpapatupad ng mga AI agent, tingnan ang Gabay sa Pagpapatupad ng AI Agent; ang pag-unlad ng mga katutubong modelo sa Taiwan ay maaaring sumangguni sa Kasalukuyang Katayuan ng Yating at TAIDE.

Mga Pinagmulan ng Datos

Inayos ayon sa pampublikong impormasyon at batay sa opisyal na impormasyon. Ang mga evaluation score ay mga numerong inilabas ng tagagawa; para sa aktwal na pagganap, mangyaring sumangguni sa iyong sariling pagsusuri sa gawain. Ang artikulong ito ay hindi bumubuo ng payo sa pamumuhunan.

Mga Madalas Itanong

Ano ang pagkakaiba ng DeepSeek V4-Flash-0731 sa bersyon noong Abril?

Walang binago sa arkitektura at parameters—pareho pa rin itong MoE model na may 284B total parameters at 13B active. Ang pinagkaiba ay sumailalim ito sa bagong post-training para sa mga task ng agent, kaya tumaas ang Terminal-Bench 2.1 mula 61.8 noong Abril preview patungong 82.7. Sa madaling salita, ang pagbabagong ito ay dahil sa paraan ng pagsasanay, hindi sa disenyo ng modelo.

Pwede ko bang gamitin sa negosyo ang MIT license?

Ang MIT ay isang maluwag na open-source license na karaniwang nagpapahintulot sa commercial use, modification, at redistribution, kung saan kailangan lamang panatilihin ang copyright notice. Gayunpaman, mas mabuting basahin nang mabuti ang buong terms at usage policy sa page ng modelo bago ito gamitin, dahil minsan ay may mga karagdagang restriksyon. Para sa commercial deployment, inirerekomendang kumunsulta sa legal team.

Praktikal ba para sa mga kumpanya na mag-self-host ng modelong ito?

Ang modelong may 284B total parameters ay nangangailangan pa rin ng malaking VRAM para ma-load ang weights kahit 13B lang ang active, kaya kadalasan ay kailangan dito ng multi-GPU server-grade hardware. Para sa karamihan ng mga kumpanya, mas sulit ang paggamit ng API o cloud hosting kaysa sa mag-self-host. Ang tanging dahilan para mag-self-host ay kung ang data ay hinding-hindi dapat lumabas ng kumpanya, tulad ng ilang partikular na serbisyo sa finance at healthcare.

Bakit naging pokus ng kompetisyon ang "agent capabilities"?

Dahil nagbabago ang mga use case. Dati, ang labanan ay kung gaano kaganda sumagot sa mga tanong; ngayon, ang labanan ay kung kaya ba nitong magpatakbo ng sunud-sunod na hakbang, tamang tumawag ng tools, at i-verify ang mga resulta nang mag-isa. Ang mga test tulad ng Terminal-Bench ay sumusubok sa kakayahang tapusin ang mga totoong gawain sa terminal environment, na mas malapit sa pangangailangan ng production kaysa sa simpleng Q&A.

繁體中文版 →