DeepSeek 丢出 V4-Flash-0731:同一副架构重练,代理能力直接翻倍

DeepSeek 在 7 月 31 日更新 V4-Flash,架构与参数量一动也没动,靠重新后训练把 Terminal-Bench 2.1 从 61.8 拉到 82.7,权重仍以 MIT 授权放上 Hugging Face。这对台湾的开发者与想自建模型的企业意味着什么?

七月的最后一天,很多台湾工程师的 GitHub 通知列跳出同一则讯息:DeepSeek 更新了。

没有发表会,没有预告,权重直接上 Hugging Face。

有意思的是规格表——284B 总参数、13B 启用参数,跟四月那版一模一样。架构没改、大小没变。但代理任务的分数,翻了将近一倍。

事件背景

DeepSeek 的 V4 系列在 2026 年 4 月 24 日正式登场,官方文件列出两款:V4-Pro 是 1.6T 总参数、49B 启用,对标顶尖闭源模型;V4-Flash 则是 284B 总参数、13B 启用,主打快速与经济。两者都以 100 万 token 上下文为标准配备,支援思考与非思考模式,并相容 OpenAI ChatCompletions 与 Anthropic 的 API 格式。同一份公告也宣布旧的 deepseek-chat 与 deepseek-reasoner 在 2026 年 7 月 24 日后停止服务。

七月三十一日这次更新的是 V4-Flash 这条线,版本代号 0731。

本次重点

  • 架构完全不变:仍是 284B 总参数、13B 启用的 MoE(混合专家)模型,官方明确说明进步来自重新后训练,不是新设计
  • 代理能力大幅提升:Terminal-Bench 2.1 得分 82.7,四月预览版是 61.8
  • 程式任务同步进步:DeepSWE 得分 54.4
  • 超越自家更大的模型:在 DeepSeek 公布的每一项代理评测上,都胜过 V4-Pro 预览版
  • 权重采 MIT 授权:直接放上 Hugging Face,是目前最宽松的开源授权之一
  • API 原生支援 Responses API 格式,并针对 Codex 做了适配

为什么「同一副架构重练」这件事更值得注意

过去两年,模型变强的叙事几乎都是「参数更大、资料更多、算力更贵」。这次不是。

DeepSeek 这一手证明了一件事:在既有架构上把后训练做对,带来的增益可能比堆参数更划算。 从 61.8 到 82.7,这个幅度放在任何一次改版都算大新闻,而它没有多花一分钱在架构研发上。

这对整个产业的意义是:模型能力的竞争正在从「谁的模型大」转向「谁更懂怎么训练代理」。后者的门槛低很多,也代表后进者的追赶空间比想像中大。

老实说,我觉得这比又一个更大的模型重要得多。

市场影响分析

对台湾使用者

日常使用者短期不会有直接感受,但透过各种接了 DeepSeek 的第三方服务,你会感觉到「AI 助手比较会自己把事情做完」。这是代理能力提升的直接体现——少一点「我帮你列出步骤」,多一点「我做完了,结果在这」。

价格上的影响也值得留意。开源且高效能的模型会持续压低整个市场的 API 价格,这对台湾的中小企业与个人开发者是好事。

对台湾企业应用

真正的机会在资料主权这一块。

MIT 授权加上可下载的权重,代表理论上你可以把模型放在自己的机房里跑,资料完全不出境。对金融、医疗、法务这些受严格监理的产业,这是闭源 API 给不了的东西。

但要讲清楚代价。284B 总参数的模型即使只启用 13B,载入权重仍需可观的显示记忆体,多数情况要多卡伺服器等级的硬体,加上维运人力。对多数台湾中小企业,用 API 或云端托管仍然划算得多。

真正值得自架的情境只有一种:资料绝对不能出境,且用量够大到摊得平硬体成本。 这两个条件缺一不可。

另外要提醒的是资安与合规面:使用中国背景厂商的模型,部分产业与政府采购有额外的规范限制。导入前请先确认你所属产业的规定,别等到稽核才发现问题。

对开发者

三个实际可做的事:

一、如果你在做 agent,这个版本值得重测。 代理能力的提升不是行销数字,Terminal-Bench 考的是在终端机环境完成实际任务,跟真实的 agent 场景很接近。用你自己的任务跑一轮,看看是否能替换掉现有的模型。

二、API 格式相容性降低了切换成本。 相容 OpenAI ChatCompletions 与 Anthropic 格式,加上这次原生支援 Responses API,意味着你可以用很小的改动去比较不同模型。想做多模型比价与切换,OpenRouter 教学 是实用的起点。

三、别只看厂商公布的分数。 这是老生常谈但每次都有人踩坑。评测分数的测试环境、prompt 设计与重试策略都会影响结果,同一个模型在不同人手上分数可以差很多。拿你自己的任务跑,才是唯一有意义的评测。

未来发展趋势

一、后训练会成为新的竞争战场。 当架构的边际效益递减,训练方法就变成差异化来源。这也代表模型的迭代速度会更快——不用重新预训练,改个后训练配方就能出新版本。

二、开源与闭源的差距会在特定任务上抹平。 通用能力可能还有落差,但在「写程式」「跑代理任务」这类可明确评测的领域,开源模型的追赶速度很快。这对想控制成本的企业是好消息。

三、模型选择会变成工程决策,而非品牌决策。 当切换成本降到很低,选哪个模型会回归到「哪个在我的任务上跑得好、又便宜」。这对台湾企业是好事——不用再赌在单一供应商上。

TheAI学院 总结与评语

这次更新没有华丽的发表会,但它讲了一个很重要的故事:AI 的进步不一定要靠更贵的硬体。

同一副架构、同样的参数量、重练一次后训练,代理能力就从 61.8 到 82.7。这对那些没有无限算力的团队来说,其实是很励志的消息。

评语:当「把训练做对」的价值开始超过「把模型做大」,这场竞赛就从资本游戏变回了工程问题。而工程问题,台湾的团队向来不怕。

给台湾读者的具体建议:如果你在开发 AI 应用,这周拨一小时做一件事——把你目前用的模型,换成这个版本跑一次你自己的核心任务,记下成本与成功率。 不用相信任何评测分数,你的任务跑出来的数字才是真的。至于企业导入,先确认你所属产业对模型来源的合规要求,再谈技术评估。

延伸阅读:Claude Opus 5 发布解析 可以对照闭源阵营的路线;想理解 AI 代理的实作,看 AI Agent 实作指南;台湾自主模型的进展则可参考 雅婷与 TAIDE 的现况

资料来源

依公开资讯整理、以官方为准。评测分数为厂商公布数字,实际表现请以自身任务实测为准。本文不构成投资建议。

常见问题

DeepSeek V4-Flash-0731 跟四月的版本差在哪?

架构与参数量完全没变,都是 284B 总参数、13B 启用的 MoE 模型。差别在于针对代理任务重新做了后训练(post-training),Terminal-Bench 2.1 从四月预览版的 61.8 提升到 82.7。换句话说,这次的进步来自训练方法而非模型设计。

MIT 授权代表我可以商用吗?

MIT 是相当宽松的开源授权,一般允许商业使用、修改与再散布,通常仅要求保留授权声明。但实际使用前仍应详读模型页面随附的完整条款与使用政策,模型权重的授权有时会附加额外的使用限制。涉及商业部署建议咨询法务。

台湾企业自架这个模型实际吗?

284B 总参数的模型即使只启用 13B,载入权重仍需可观的显示记忆体,通常要多卡伺服器等级的硬体。对多数台湾中小企业而言,用 API 或云端托管比自建划算。真正需要自架的情境是资料绝对不能出境的产业,例如金融与医疗的特定业务。

为什么「代理能力」变成竞争重点?

因为使用场景在变。过去比的是回答问题的品质,现在比的是能不能连续执行多个步骤、正确呼叫工具、自己验证结果。Terminal-Bench 这类测验考的正是在终端机环境里完成实际任务的能力,这比单纯的问答更贴近生产环境的需求。

繁體中文版 →