台灣打造的 AI・什麼都可以問──免費試試 TheAI 對話,最懂台灣

DeepSeek 丟出 V4-Flash-0731:同一副架構重練,代理能力直接翻倍

DeepSeek 丟出 V4-Flash-0731:同一副架構重練,代理能力直接翻倍

DeepSeek 在 7 月 31 日更新 V4-Flash,架構與參數量一動也沒動,靠重新後訓練把 Terminal-Bench 2.1 從 61.8 拉到 82.7,權重仍以 MIT 授權放上 Hugging Face。這對台灣的開發者與想自建模型的企業意味著什麼?

七月的最後一天,很多台灣工程師的 GitHub 通知列跳出同一則訊息:DeepSeek 更新了。

沒有發表會,沒有預告,權重直接上 Hugging Face。

有意思的是規格表——284B 總參數、13B 啟用參數,跟四月那版一模一樣。架構沒改、大小沒變。但代理任務的分數,翻了將近一倍。

事件背景

DeepSeek 的 V4 系列在 2026 年 4 月 24 日正式登場,官方文件列出兩款:V4-Pro 是 1.6T 總參數、49B 啟用,對標頂尖閉源模型;V4-Flash 則是 284B 總參數、13B 啟用,主打快速與經濟。兩者都以 100 萬 token 上下文為標準配備,支援思考與非思考模式,並相容 OpenAI ChatCompletions 與 Anthropic 的 API 格式。同一份公告也宣布舊的 deepseek-chat 與 deepseek-reasoner 在 2026 年 7 月 24 日後停止服務。

七月三十一日這次更新的是 V4-Flash 這條線,版本代號 0731。

本次重點

  • 架構完全不變:仍是 284B 總參數、13B 啟用的 MoE(混合專家)模型,官方明確說明進步來自重新後訓練,不是新設計
  • 代理能力大幅提升:Terminal-Bench 2.1 得分 82.7,四月預覽版是 61.8
  • 程式任務同步進步:DeepSWE 得分 54.4
  • 超越自家更大的模型:在 DeepSeek 公布的每一項代理評測上,都勝過 V4-Pro 預覽版
  • 權重採 MIT 授權:直接放上 Hugging Face,是目前最寬鬆的開源授權之一
  • API 原生支援 Responses API 格式,並針對 Codex 做了適配

為什麼「同一副架構重練」這件事更值得注意

過去兩年,模型變強的敘事幾乎都是「參數更大、資料更多、算力更貴」。這次不是。

DeepSeek 這一手證明了一件事:在既有架構上把後訓練做對,帶來的增益可能比堆參數更划算。 從 61.8 到 82.7,這個幅度放在任何一次改版都算大新聞,而它沒有多花一分錢在架構研發上。

這對整個產業的意義是:模型能力的競爭正在從「誰的模型大」轉向「誰更懂怎麼訓練代理」。後者的門檻低很多,也代表後進者的追趕空間比想像中大。

老實說,我覺得這比又一個更大的模型重要得多。

市場影響分析

對台灣使用者

日常使用者短期不會有直接感受,但透過各種接了 DeepSeek 的第三方服務,你會感覺到「AI 助手比較會自己把事情做完」。這是代理能力提升的直接體現——少一點「我幫你列出步驟」,多一點「我做完了,結果在這」。

價格上的影響也值得留意。開源且高效能的模型會持續壓低整個市場的 API 價格,這對台灣的中小企業與個人開發者是好事。

對台灣企業應用

真正的機會在資料主權這一塊。

MIT 授權加上可下載的權重,代表理論上你可以把模型放在自己的機房裡跑,資料完全不出境。對金融、醫療、法務這些受嚴格監理的產業,這是閉源 API 給不了的東西。

但要講清楚代價。284B 總參數的模型即使只啟用 13B,載入權重仍需可觀的顯示記憶體,多數情況要多卡伺服器等級的硬體,加上維運人力。對多數台灣中小企業,用 API 或雲端託管仍然划算得多。

真正值得自架的情境只有一種:資料絕對不能出境,且用量夠大到攤得平硬體成本。 這兩個條件缺一不可。

另外要提醒的是資安與合規面:使用中國背景廠商的模型,部分產業與政府採購有額外的規範限制。導入前請先確認你所屬產業的規定,別等到稽核才發現問題。

對開發者

三個實際可做的事:

一、如果你在做 agent,這個版本值得重測。 代理能力的提升不是行銷數字,Terminal-Bench 考的是在終端機環境完成實際任務,跟真實的 agent 場景很接近。用你自己的任務跑一輪,看看是否能替換掉現有的模型。

二、API 格式相容性降低了切換成本。 相容 OpenAI ChatCompletions 與 Anthropic 格式,加上這次原生支援 Responses API,意味著你可以用很小的改動去比較不同模型。想做多模型比價與切換,OpenRouter 教學 是實用的起點。

三、別只看廠商公布的分數。 這是老生常談但每次都有人踩坑。評測分數的測試環境、prompt 設計與重試策略都會影響結果,同一個模型在不同人手上分數可以差很多。拿你自己的任務跑,才是唯一有意義的評測。

未來發展趨勢

一、後訓練會成為新的競爭戰場。 當架構的邊際效益遞減,訓練方法就變成差異化來源。這也代表模型的迭代速度會更快——不用重新預訓練,改個後訓練配方就能出新版本。

二、開源與閉源的差距會在特定任務上抹平。 通用能力可能還有落差,但在「寫程式」「跑代理任務」這類可明確評測的領域,開源模型的追趕速度很快。這對想控制成本的企業是好消息。

三、模型選擇會變成工程決策,而非品牌決策。 當切換成本降到很低,選哪個模型會回歸到「哪個在我的任務上跑得好、又便宜」。這對台灣企業是好事——不用再賭在單一供應商上。

TheAI學院 總結與評語

這次更新沒有華麗的發表會,但它講了一個很重要的故事:AI 的進步不一定要靠更貴的硬體。

同一副架構、同樣的參數量、重練一次後訓練,代理能力就從 61.8 到 82.7。這對那些沒有無限算力的團隊來說,其實是很勵志的消息。

評語:當「把訓練做對」的價值開始超過「把模型做大」,這場競賽就從資本遊戲變回了工程問題。而工程問題,台灣的團隊向來不怕。

給台灣讀者的具體建議:如果你在開發 AI 應用,這週撥一小時做一件事——把你目前用的模型,換成這個版本跑一次你自己的核心任務,記下成本與成功率。 不用相信任何評測分數,你的任務跑出來的數字才是真的。至於企業導入,先確認你所屬產業對模型來源的合規要求,再談技術評估。

延伸閱讀:Claude Opus 5 發布解析 可以對照閉源陣營的路線;想理解 AI 代理的實作,看 AI Agent 實作指南;台灣自主模型的進展則可參考 雅婷與 TAIDE 的現況

資料來源

依公開資訊整理、以官方為準。評測分數為廠商公布數字,實際表現請以自身任務實測為準。本文不構成投資建議。

常見問題

DeepSeek V4-Flash-0731 跟四月的版本差在哪?

架構與參數量完全沒變,都是 284B 總參數、13B 啟用的 MoE 模型。差別在於針對代理任務重新做了後訓練(post-training),Terminal-Bench 2.1 從四月預覽版的 61.8 提升到 82.7。換句話說,這次的進步來自訓練方法而非模型設計。

MIT 授權代表我可以商用嗎?

MIT 是相當寬鬆的開源授權,一般允許商業使用、修改與再散布,通常僅要求保留授權聲明。但實際使用前仍應詳讀模型頁面隨附的完整條款與使用政策,模型權重的授權有時會附加額外的使用限制。涉及商業部署建議諮詢法務。

台灣企業自架這個模型實際嗎?

284B 總參數的模型即使只啟用 13B,載入權重仍需可觀的顯示記憶體,通常要多卡伺服器等級的硬體。對多數台灣中小企業而言,用 API 或雲端託管比自建划算。真正需要自架的情境是資料絕對不能出境的產業,例如金融與醫療的特定業務。

為什麼「代理能力」變成競爭重點?

因為使用場景在變。過去比的是回答問題的品質,現在比的是能不能連續執行多個步驟、正確呼叫工具、自己驗證結果。Terminal-Bench 這類測驗考的正是在終端機環境裡完成實際任務的能力,這比單純的問答更貼近生產環境的需求。

資料來源:theai-editorial