DeepSeek tung ra V4-Flash-0731: Đào tạo lại trên cùng kiến trúc, năng lực AI agent tăng gấp đôi

Vào ngày 31 tháng 7, DeepSeek đã cập nhật phiên bản V4-Flash mà không thay đổi chút nào về kiến trúc hay số lượng tham số. Nhờ quá trình hậu huấn luyện lại, điểm số Terminal-Bench 2.1 đã tăng vọt từ 61.8 lên 82.7, và trọng số vẫn được phát hành trên Hugging Face theo giấy phép MIT. Điều này có ý nghĩa gì đối với các nhà phát triển và doanh nghiệp muốn tự xây dựng mô hình?

Vào ngày cuối cùng của tháng 7, thông báo trên GitHub của rất nhiều kỹ sư Đài Loan đồng loạt hiện lên cùng một tin nhắn: DeepSeek đã cập nhật.

Không có buổi họp báo, không có thông báo trước, trọng số (weights) được đưa thẳng lên Hugging Face.

Điều thú vị nằm ở bảng thông số kỹ thuật — tổng tham số 284B, tham số kích hoạt (activated parameters) 13B, y hệt như phiên bản hồi tháng Tư. Kiến trúc không đổi, kích thước giữ nguyên. Thế nhưng điểm số cho các tác vụ tác tử (agentic tasks) lại tăng gần gấp đôi.

Bối cảnh sự kiện

Dòng V4 của DeepSeek chính thức ra mắt vào ngày 24/04/2026 với hai phiên bản được liệt kê trong tài liệu chính thức: V4-Pro có tổng tham số 1.6T, 49B kích hoạt, nhắm đến mục tiêu đối đầu với các mô hình nguồn đóng hàng đầu; trong khi V4-Flash có tổng tham số 284B, 13B kích hoạt, chuyên về tốc độ và tính kinh tế. Cả hai đều trang bị tiêu chuẩn ngữ cảnh 100k token, hỗ trợ chế độ tư duy (thinking) và phi tư duy, đồng thời tương thích với định dạng API của OpenAI ChatCompletions và Anthropic. Cùng thông báo đó cũng cho biết các dịch vụ cũ deepseek-chatdeepseek-reasoner sẽ ngừng hoạt động sau ngày 24/07/2026.

Bản cập nhật vào ngày 31/07 lần này áp dụng cho dòng V4-Flash, với mã phiên bản là 0731.

Điểm nhấn lần này

  • Kiến trúc hoàn toàn không đổi: Vẫn là mô hình MoE (Mixture of Experts) với tổng tham số 284B và 13B kích hoạt. Phía chính thức giải thích rõ ràng rằng sự tiến bộ đến từ việc huấn luyện hậu kỳ (post-training) lại, chứ không phải do thiết kế mới.
  • Năng lực tác tử (agent) tăng vọt: Đạt 82.7 điểm trên Terminal-Bench 2.1, trong khi phiên bản thử nghiệm hồi tháng Tư chỉ là 61.8.
  • Tác vụ lập trình tiến bộ đồng bộ: Đạt 54.4 điểm trên DeepSWE.
  • Vượt qua cả mô hình lớn hơn của hãng: Trong mọi bài đánh giá tác tử do DeepSeek công bố, phiên bản này đều vượt trội hơn bản thử nghiệm V4-Pro.
  • Trọng số áp dụng giấy phép MIT: Được đưa thẳng lên Hugging Face, đây là một trong những giấy phép mã nguồn mở dễ dãi nhất hiện nay.
  • API hỗ trợ nguyên bản định dạng Responses API và được tối ưu hóa cho Codex.

Tại sao việc "dùng lại kiến trúc cũ để huấn luyện lại" lại đáng chú ý hơn?

Trong hai năm qua, câu chuyện về việc mô hình ngày càng mạnh mẽ hầu như chỉ xo quanh "tham số lớn hơn, dữ liệu nhiều hơn, sức mạnh tính toán đắt đỏ hơn". Lần này thì không.

Động thái này của DeepSeek đã chứng minh một điều: Làm đúng khâu huấn luyện hậu kỳ trên kiến trúc có sẵn có thể mang lại mức lợi ích vượt trội và kinh tế hơn nhiều so với việc dồn dập tăng tham số. Từ 61.8 lên 82.7, mức tăng này được coi là tin lớn trong bất kỳ đợt thay đổi phiên bản nào, thế nhưng họ lại không tốn thêm một xu nào cho việc nghiên cứu phát triển kiến trúc.

Ý nghĩa đối với toàn bộ ngành công nghiệp là: Cuộc đua về năng lực mô hình đang dịch chuyển từ "mô hình của ai lớn hơn" sang "ai hiểu rõ cách huấn luyện tác tử hơn". Ngưỡng cửa của vế sau thấp hơn nhiều, đồng thời điều này cho thấy dư địa bắt kịp của những người đi sau lớn hơn chúng ta tưởng.

Thành thật mà nói, tôi cảm thấy điều này quan trọng hơn nhiều so với việc lại có thêm một mô hình lớn hơn ra đời.

Phân tích tác động thị trường

Đối với người dùng tại Đài Loan

Người dùng thông thường sẽ không cảm nhận được sự thay đổi trực tiếp trong ngắn hạn, nhưng thông qua các dịch vụ bên thứ ba tích hợp DeepSeek, bạn sẽ có cảm giác "trợ lý AI biết cách tự mình hoàn thành công việc hơn". Đây là sự thể hiện trực tiếp của việc năng lực tác tử được nâng cao — ít đi những câu "Tôi giúp bạn liệt kê các bước nhé", và nhiều hơn những câu "Tôi đã làm xong rồi, kết quả ở đây".

Tác động về giá cả cũng là điều đáng chú ý. Các mô hình hiệu suất cao mang tính mã nguồn mở sẽ tiếp tục kéo giá API trên toàn thị trường xuống thấp hơn, đây là tin tốt đối với các doanh nghiệp vừa và nhỏ (SME) và lập trình viên cá nhân tại Đài Loan.

Đối với ứng dụng doanh nghiệp tại Đài Loan

Cơ hội thực sự nằm ở mảng chủ quyền dữ liệu (data sovereignty).

Giấy phép MIT kết hợp với các trọng số có thể tải xuống đồng nghĩa với việc về lý thuyết, bạn có thể đặt mô hình chạy ngay trong phòng máy chủ của riêng mình mà dữ liệu hoàn toàn không rời khỏi biên giới. Đối với các ngành chịu sự giám sát nghiêm ngặt như tài chính, y tế và luật pháp, đây là điều mà các API nguồn đóng không thể mang lại.

Nhưng cũng cần phải nói rõ về cái giá phải trả. Một mô hình có tổng tham số 284B ngay cả khi chỉ kích hoạt 13B, việc nạp trọng số vẫn đòi hỏi lượng bộ nhớ VRAM đáng kể. Trong hầu hết các trường hợp, bạn sẽ cần phần cứng cấp độ máy chủ nhiều card (multi-card) đi kèm với nhân sự vận hành. Đối với phần lớn các doanh nghiệp vừa và nhỏ tại Đài Loan, việc sử dụng API hoặc dịch vụ lưu trữ đám mây vẫn tiết kiệm hơn rất nhiều.

Tình huống thực sự đáng để tự xây dựng hệ thống chỉ có một: Dữ liệu tuyệt đối không được rời khỏi biên giới, và khối lượng sử dụng đủ lớn để bù đắp chi phí phần cứng. Hai điều kiện này thiếu một cũng không được.

Ngoài ra, cần lưu ý về mặt an toàn thông tin và tuân thủ: Việc sử dụng các mô hình từ nhà cung cấp có gốc gác Trung Quốc sẽ vấp phải các quy định và giới hạn bổ sung ở một số ngành nghề và gói thầu chính phủ. Trước khi ứng dụng, hãy xác nhận trước các quy định của ngành bạn đang hoạt động, đừng đợi đến khi kiểm toán mới phát hiện ra vấn đề.

Đối với lập trình viên

Có ba việc thực tế có thể làm ngay:

Một, nếu bạn đang làm về agent, phiên bản này rất đáng để đo lường lại. Sự gia tăng về năng lực tác tử không phải là con số tiếp thị. Terminal-Bench kiểm tra khả năng hoàn thành các tác vụ thực tế trong môi trường dòng lệnh (terminal), rất gần gũi với các kịch bản agent thực tế. Hãy chạy thử một vòng với các tác vụ của riêng bạn để xem liệu nó có thể thay thế mô hình hiện tại hay không.

Thức hai, tính tương thích của định dạng API làm giảm chi phí chuyển đổi. Việc tương thích với các định dạng OpenAI ChatCompletions và Anthropic, cộng thêm việc lần này hỗ trợ nguyên bản Responses API, có nghĩa là bạn có thể dùng những thay đổi rất nhỏ để so sánh các mô hình khác nhau. Nếu bạn muốn so sánh giá và chuyển đổi giữa nhiều mô hình, Hướng dẫn OpenRouter là một khởi đầu thực tế.

Ba, đừng chỉ nhìn vào điểm số do nhà sản xuất công bố. Đây là điều ai cũng biết nhưng cứ mỗi lần là lại có người sập bẫy. Môi trường thử nghiệm, thiết kế câu lệnh (prompt) và chiến lược thử lại (retry strategy) của điểm đánh giá đều sẽ ảnh hưởng đến kết quả; cùng một mô hình nhưng qua tay những người khác nhau có thể cho ra điểm số chênh lệch lớn. Mang tác vụ của riêng bạn vào chạy mới là bài kiểm tra duy nhất có ý nghĩa.

Xu hướng phát triển trong tương lai

Một, huấn luyện hậu kỳ sẽ trở thành chiến trường cạnh tranh mới. Khi lợi ích biên của kiến trúc giảm dần, phương pháp huấn luyện sẽ trở thành nguồn gốc tạo ra sự khác biệt. Điều này cũng có nghĩa là tốc độ lặp lại của mô hình sẽ nhanh hơn — không cần phải huấn luyện trước (pre-training) lại từ đầu, chỉ cần thay đổi công thức huấn luyện hậu kỳ là có thể ra mắt phiên bản mới.

Hai, khoảng cách giữa nguồn mở và nguồn đóng sẽ bị xóa mờ ở một số tác vụ cụ thể. Năng lực tổng quát có thể vẫn còn khoảng cách, nhưng trong các lĩnh vực có thể đánh giá rõ ràng như "viết mã" và "chạy tác vụ tác tử", tốc độ đuổi kịp của các mô hình nguồn mở là rất nhanh. Đây là tin vui cho các doanh nghiệp muốn kiểm soát chi phí.

Ba, việc lựa chọn mô hình sẽ trở thành một quyết định mang tính kỹ thuật thay vì quyết định thương hiệu. Khi chi phí chuyển đổi giảm xuống mức rất thấp, việc chọn mô hình nào sẽ quay trở lại bài toán "mô hình nào chạy tốt trên tác vụ của tôi mà lại rẻ". Đây là điều tốt cho các doanh nghiệp Đài Loan — không còn phải cược vào một nhà cung cấp duy nhất.

Tổng kết và Nhận định từ TheAI學院

Bản cập nhật lần này không có buổi họp báo hào nhoáng, nhưng nó kể một câu chuyện rất quan trọng: Sự tiến bộ của AI không nhất thiết phải dựa vào phần cứng đắt tiền hơn.

Cùng một kiến trúc, cùng số lượng tham số, tiến hành huấn luyện hậu kỳ lại một lần, năng lực tác tử đã vọt từ 61.8 lên 82.7. Đây thực sự là một tin tức truyền cảm hứng cho những đội ngũ không có nguồn lực tính toán vô hạn.

Nhận định: Khi giá trị của việc "làm đúng khâu huấn luyện" bắt đầu vượt qua việc "làm mô hình lớn hơn", cuộc chơi này đã chuyển từ trò chơi tư bản trở lại thành bài toán kỹ thuật. Mà đối với bài toán kỹ thuật, các đội ngũ tại Đài Loan từ xưa đến nay chưa bao giờ sợ cả.

Gợi ý cụ thể dành cho độc giả Đài Loan: Nếu bạn đang phát triển các ứng dụng AI, trong tuần này hãy dành ra một giờ để làm một việc — Thay thế mô hình bạn đang dùng bằng phiên bản này để chạy thử tác vụ cốt lõi của riêng bạn, ghi lại chi phí và tỷ lệ thành công. Đừng tin vào bất kỳ điểm số đánh giá nào, con số chạy ra từ tác vụ của chính bạn mới là sự thật. Còn đối với việc ứng dụng vào doanh nghiệp, trước tiên hãy xác nhận các yêu cầu tuân thủ của ngành bạn đối với nguồn gốc mô hình, sau đó mới bàn đến việc đánh giá kỹ thuật.

Đọc thêm: Bài phân tích ra mắt Claude Opus 5 để đối chiếu với lộ trình của phe nguồn đóng; muốn hiểu về việc triển khai tác tử AI, hãy xem Hướng dẫn triển khai AI Agent; còn về tiến độ của các mô hình nội địa Đài Loan, bạn có thể tham khảo Hiện trạng của Yating và TAIDE.

Nguồn dữ liệu

Được tổng hợp dựa trên thông tin công khai, lấy thông tin chính thức làm chuẩn. Điểm đánh giá là số liệu do nhà sản xuất công bố, hiệu suất thực tế vui lòng dựa trên bài kiểm tra thực tế của chính tác vụ bạn thực hiện. Bài viết này không cấu thành lời khuyên đầu tư.

Câu hỏi thường gặp

DeepSeek V4-Flash-0731 khác biệt thế nào so với phiên bản tháng Tư?

Kiến trúc và số lượng tham số hoàn toàn giữ nguyên, đều là mô hình MoE với tổng số tham số 284B và 13B được kích hoạt. Điểm khác biệt nằm ở chỗ mô hình được hậu huấn luyện chuyên sâu cho các tác vụ agent, giúp điểm Terminal-Bench 2.1 tăng từ 61.8 ở phiên bản xem trước tháng Tư lên 82.7. Nói cách khác, sự tiến bộ lần này đến từ phương pháp huấn luyện chứ không phải thiết kế mô hình.

Giấy phép MIT có nghĩa là tôi có thể sử dụng thương mại không?

MIT là giấy phép mã nguồn mở khá cởi mở, nhìn chung cho phép sử dụng thương mại, chỉnh sửa và phân phối lại, thường chỉ yêu cầu giữ nguyên thông báo bản quyền. Tuy nhiên, trước khi sử dụng thực tế, bạn vẫn nên đọc kỹ các điều khoản đầy đủ và chính sách sử dụng đi kèm trên trang mô hình, vì giấy phép trọng số đôi khi có thể đi kèm các hạn chế sử dụng bổ sung. Đối với việc triển khai thương mại, bạn nên tham khảo ý kiến chuyên gia pháp lý.

Việc doanh nghiệp tự triển khai mô hình này có thực tế không?

Mô hình với tổng số tham số 284B, ngay cả khi chỉ kích hoạt 13B, vẫn đòi hỏi dung lượng bộ nhớ VRAM đáng kể để tải trọng số, thường cần phần cứng cấp máy chủ đa GPU. Đối với phần lớn doanh nghiệp, việc sử dụng API hoặc dịch vụ lưu trữ đám mây sẽ tiết kiệm chi phí hơn là tự xây dựng. Tình huống thực sự cần tự triển khai là đối với các ngành nghề có dữ liệu tuyệt đối không được rời khỏi hệ thống, chẳng hạn như một số nghiệp vụ đặc thù trong lĩnh vực tài chính và y tế.

Tại sao "năng lực agent" lại trở thành trọng tâm cạnh tranh?

Bởi vì bối cảnh sử dụng đang thay đổi. Trước đây, người ta so sánh chất lượng trả lời câu hỏi, nhưng giờ đây họ so sánh khả năng thực thi liên tục nhiều bước, gọi công cụ chính xác và tự xác thực kết quả. Các bài kiểm tra như Terminal-Bench đánh giá chính xác năng lực hoàn thành các tác vụ thực tế trong môi trường dòng lệnh (terminal), điều này sát với nhu cầu thực tế của môi trường sản xuất hơn là việc hỏi đáp đơn thuần.

繁體中文版 →