Gemini 3.5 Pro ra mắt vào tháng 6: 2 triệu token và Deep Think, Google để dành "vũ khí mạnh nhất" đến phút chót

Tại sự kiện I/O 2026, Google đã tung ra bản 3.5 Flash trước và dời dòng Pro chủ lực sang tháng 6. Giờ đây, Gemini 3.5 Pro đã chính thức bước vào giai đoạn xem xét trước dành cho doanh nghiệp trên Vertex AI với ngữ cảnh 2 triệu token và khả năng suy luận Deep Think, nhưng mức giá lại đắt gần gấp mười lần so với bản Flash. Với chiến lược "miễn phí trước, thu phí sau" này, các nhà phát triển và doanh nghiệp tại Đài Loan nên tiếp cận như thế nào?

Gemini 3.5 Pro mở cửa vào tháng 6: 200 triệu token và Deep Think, Google giữ lại "vũ khí mạnh nhất" đến phút chót

Ngày 19 tháng 5, tôi ngồi trước màn hình trong văn phòng tại Đài Bắc để theo dõi buổi phát trực tiếp Google I/O 2026, chờ đợi sự xuất hiện của Gemini 3.5 Pro theo lời đồn. Cuối cùng, Google chỉ tung ra bản 3.5 Flash, vị giám đốc kỹ thuật trên sân khấu chính nói một lúc rồi nhanh chóng lướt qua bản Pro: "Chúng tôi cũng đang dốc sức hoàn thiện 3.5 Pro, nó đã được sử dụng nội bộ và hy vọng sẽ ra mắt vào tháng tới." Câu nói "tháng tới" đó giờ đã thành hiện thực — vào tháng 6, Gemini 3.5 Pro bước vào cuộc chơi với một con số khiến không ít người phải trầm trồ: cửa sổ ngữ cảnh (context window) 200 nghìn token.

Tôi chủ động mổ xẻ vấn đề này bởi vì nhịp độ phát hành lần này của Google bản thân nó đã là một tin tức. Đem bản Flash miễn phí phủ sóng cho hàng tỷ người trên toàn cầu trước, rồi để lại bản Pro ngốn phần cứng và thu phí ra mắt sau đó một tháng, phát hành theo hai giai đoạn. Đây không phải là vấn đề kỹ thuật, mà là nhịp điệu kinh doanh — và các nhóm tại Đài Loan nếu cứ giữ thói quen cũ là "chờ bản mạnh nhất ra rồi tính" thì rất có thể sẽ đánh giá sai lịch trình.

Bối cảnh sự kiện

Hãy làm rõ mốc thời gian trước. Dòng Gemini 3.5 chính thức ra mắt tại Google I/O 2026 vào giờ Đài Loan ngày 19 tháng 5. Sản phẩm mở màn là 3.5 Flash, lên sóng toàn cầu ngay trong ngày, người dùng miễn phí có thể sử dụng thông qua ứng dụng Gemini và chế độ AI của Google Search, còn nhà phát triển thì dùng qua Gemini API, Google AI Studio và Antigravity. Tiêu đề bài viết trên blog chính thức của Google hôm đó được định vị là "frontier intelligence with action" — nhấn mạnh rằng thế hệ mô hình này không chỉ biết trả lời mà còn biết "hành động", tập trung vào năng lực dạng tác nhân (agentic) và các tác vụ dài.

Về phần mẫu flagship 3.5 Pro, Google đã nói rõ trong thông cáo phát hành là "ra mắt vào tháng tới". Đến giữa tháng 6, tình hình là thế này: tính đến ngày 19 tháng 6, 3.5 Pro vẫn đang ở giai đoạn xem xét giới hạn dành cho khách hàng doanh nghiệp của Vertex AI, chưa tiến vào ứng dụng Gemini dành cho người dùng phổ thông, Google AI Studio hoặc gói đăng ký cá nhân. Nói cách khác, những gì bạn đang sử dụng trong ứng dụng điện thoại hiện tại rất có thể vẫn là Flash, chứ không phải Pro.

Khoảng cách này rất quan trọng. Có không ít bài viết trên thị trường đánh đồng "I/O công bố" với "mọi người đều dùng được", nhưng thực tế bản Pro hiện chỉ mở cho các tài khoản doanh nghiệp Vertex AI hiện hữu, thậm chí còn chưa công khai cổng đăng ký tự phục vụ mà phải thông qua quản lý tài khoản của Google Cloud để liên hệ. Trong quá trình tôi kiểm chứng, tôi thấy một số trang web đưa tin ly kỳ lấy nó ra so sánh với những tin đồn về sản phẩm cạnh tranh nào đó, những phần chưa được chính thức xác thực đó tôi sẽ không áp dụng trong bài viết này — chỉ nói những sự kiện có căn cứ.

Điểm nhấn chính

  • Cửa sổ ngữ cảnh 200 nghìn token. Đây là con số gấp đôi bản Flash (100 nghìn), đồng thời cũng là một trong những cửa sổ ngữ cảnh lớn nhất trong số các mô hình tiên tiến cấp độ sản xuất đã được công bố. Quy đổi ra tiếng Trung, ước tính có thể đọc vào hàng triệu chữ cùng một lúc, toàn bộ hệ thống luật pháp, toàn bộ thư viện mã nguồn, hàng trăm trang báo cáo tài chính đều có thể nạp một lượt cho nó.
  • Chế độ suy luận Deep Think. Điểm đáng chú ý là cách thức triển khai: Deep Think không phải là một endpoint mô hình được mở riêng, mà là một công tắc tham số trên API (thinkingConfig). Cùng một ID mô hình (được báo cáo là gemini-3.5-pro-preview-06) xử lý đồng thời các yêu cầu tiêu chuẩn và yêu cầu suy luận sâu, điểm khác biệt là bạn có bật công tắc đó hay không. Đây là thiết kế tiết kiệm công sức cho nhà phát triển, nhưng cũng có nghĩa là chi phí token của suy luận sâu phải tự quản lý.
  • Phát hành theo hai giai đoạn: Flash trước, Pro sau. Bản Flash được đưa lên sóng toàn cầu miễn phí ngay trong ngày, bản Pro hoãn lại một tháng và ưu tiên cho doanh nghiệp trước. Google tương đương với việc cắt đôi thành hai tuyến: "rẻ, đủ nhanh, đủ rộng" và "mạnh nhất, đắt nhất, phục vụ doanh nghiệp trả phí trước".
  • Chỉ số cứng của Flash. Dữ liệu chính thức cho thấy 3.5 Flash đạt 76.2% trên Terminal-Bench 2.1, 1656 Elo trên GDPval-AA, 83.6% trên MCP Atlas, tốc độ xuất bản được cho là nhanh gấp bốn lần so với các mô hình tiên tiến khác, và vượt trội hơn thế hệ trước 3.1 Pro ở nhiều tiêu chuẩn mã hóa và tác nhân.
  • Giá bán đắt gấp gần mười lần Flash. Giá của bản Pro được nhiều phương tiện truyền thông trích dẫn nằm trong khoảng 15 USD cho mỗi triệu token đầu vào và khoảng 60 USD cho token đầu ra, tương đương khoảng gấp mười lần so với 3.5 Flash. Những đối tượng được trải nghiệm bản Pro sớm nhất sẽ là người dùng gói Pro 20 USD/tháng và gói Ultra 250 USD/tháng của Google.

Phân tích tác động thị trường

Đối với người dùng phổ thông tại Đài Loan: Nói thật là trong ngắn hạn, bạn không cần phải lo lắng về việc "Pro chưa có trên App". Đối với việc tra cứu thông tin, viết thư, dịch thuật, tổng hợp biên bản họp hằng ngày, Gemini 3.5 Flash đã miễn phí và đủ nhanh — nó là giá trị mặc định trong App, bạn mở lên là dùng được. Kịch bản thực sự cần đến 200 nghìn token là nhu cầu mức độ nặng như muốn ném cả một cuốn sách, cả một bản hợp đồng, toàn bộ cuộc trò chuyện của cả năm vào để phân tích một lần, người bình thường một tuần cũng chẳng chạm trán mấy lần. Lời khuyên của tôi là: hãy làm quen với bản Flash miễn phí trước, đợi khi nào bản Pro đưa vào gói 20 USD rồi hãy đánh giá có nên nâng cấp hay không, không cần phải vội vàng tranh thủ bản xem xét doanh nghiệp ngay bây giờ.

Đối với ứng dụng doanh nghiệp tại Đài Loan: Đây mới là chiến trường thực sự của đợt phát hành này. 200 nghìn token đối với việc xử lý tài liệu kỹ thuật của ngành luật, kế toán, sản xuất là động lực thực tế — đọc một lần trọn bộ SOP, toàn bộ lô tài liệu bồi thường, toàn bộ email lịch sử của dự án, không cần phải cắt đoạn chắp vá nữa. Nhưng có hai thực tế cần phải suy nghĩ thấu đáo trước. Thứ nhất, bản Pro hiện gắn liền với tư cách doanh nghiệp Vertex AI, không có đường dẫn tự phục vụ công khai, bạn phải thông qua quản lý tài khoản Google Cloud để thương lượng, thời gian chuẩn bị trước khi triển khai phải được đưa vào tiến độ dự án. Thứ thứ hai, mức giá đắt gấp gần mười lần có nghĩa là "việc gì giải quyết được bằng Flash thì đừng cố dồn lên Pro". Kiến trúc thiết thực hơn là phân tầng: các yêu cầu lớn và đơn giản đi đường Flash, những yêu cầu thực sự cần suy luận sâu hoặc ngữ cảnh siêu dài mới định tuyến sang Pro, giữ chi phí nằm ở phần trọng điểm.

Đối với nhà phát triển tại Đài Loan: Việc Deep Think được làm thành công tắc tham số là tin vui đối với việc thực thi kỹ thuật — không cần phải duy trì hai tập hợp định tuyến mô hình, dùng một ID là đi khắp nơi. Nhưng "dễ bật" cũng có nghĩa là "dễ quên tắt", suy luận sâu sẽ rõ ràng tiêu tốn nhiều token hơn, đường cong chi phí sẽ dốc hơn bạn tưởng. Tôi khuyên bạn nên thiết lập Deep Think trong hệ thống thành điều kiện rõ ràng mới kích hoạt, chứ không phải mặc định bật tất cả. Ngoài ra, API thời kỳ xem xét của Pro có thể vẫn sẽ được điều chỉnh, trước khi GA (phát hành chính thức) chính thức, đừng trói chặt các quy trình cốt lõi của môi trường sản xuất vào phiên bản preview. Những ai muốn luyện tay trước có thể dùng Gemini API đã GA và Google AI Studio để xây dựng trước quy trình xử lý ngữ cảnh dài, chờ khi bản Pro mở cửa là có thể chuyển đổi mượt mà.

Xu hướng phát triển tương lai

Tôi cho rằng ba hướng đi này sẽ dần rõ ràng hơn trong nửa cuối năm.

Thứ nhất, cuộc đua vũ trang "độ dài ngữ cảnh" sẽ chuyển từ khoe khoang kỹ thuật sang tính thực tế. 200 nghìn token nghe có vẻ đáng sợ, nhưng thử thách thực sự là "độ chính xác khi truy xuất ngữ cảnh dài" — nhét vào được không có nghĩa là tìm cho chuẩn. Các bên tiếp theo sẽ so kè xem dưới văn bản siêu dài liệu có còn định vị chính xác thông tin hay không, chứ không chỉ là con số kích thước cửa sổ.

Thứ hai, "phát hành theo từng giai đoạn" sẽ trở thành chiêu thức thông thường của các ông lớn. Dùng mô hình nhỏ miễn phí, đủ dùng để chiếm lĩnh thói quen của người dùng trước, rồi giữ lại bản flagship cho doanh nghiệp trả phí, lần này Google đã làm mẫu rất rõ ràng. Đối với các đối thủ như ChatGPT, Claude, Perplexity, thời đại chỉ so sánh thông số đang dần qua đi, thứ họ so kè hiện nay là "tầng miễn phí dùng có tốt không, tầng trả phí có đáng tiền không".

Thứ ba, năng lực tác nhân (agentic) sẽ là ranh giới tiếp theo. Lần này Google liên tục nhấn mạnh "intelligence with action", có nghĩa là mô hình phải tự chạy được quy trình làm việc nhiều bước, điều động công cụ, hoàn thành nhiệm vụ. Ai có thể để AI ổn định "hoàn thành công việc" chứ không chỉ "nói xong lời", người đó sẽ nắm giữ ngân sách doanh nghiệp.

Tóm tắt và Nhận xét từ TheAI Academy

Việc Gemini 3.5 Pro mở cửa vào tháng 6 thoạt nhìn là một mô hình lên sóng, nhưng bên dưới là cảm giác nhịp điệu của Google: dùng Flash miễn phí để phủ rộng quy mô, dùng Pro tính phí để thu tiền doanh nghiệp. 200 nghìn token và Deep Think là thực lực thật sự, nhưng "hiện chỉ có trên bản xem xét doanh nghiệp của Vertex AI" cũng là thực tế phũ phàng, đừng để tiêu đề "I/O đã công bố" đánh lừa mà tưởng rằng ai cũng dùng được.

Nhận xét: Bài học đáng giá nhất mà độc giả Đài Loan nên rút ra lần này không phải là "Google lại ra mắt một mô hình mạnh hơn", mà là "cùng một công ty, thời điểm phát hành bản miễn phí và bản flagship cách nhau cả một tháng". Đối với cá nhân, hãy tận dụng tối đa bản Flash miễn phí; đối với doanh nghiệp, hãy tìm hiểu rõ ngưỡng cửa tiếp cận và chi phí phân tầng của Vertex AI trước khi quyết định có nên theo đuổi bản Pro hay không. Nhóm nào biết tiết kiệm tiền, biết phân luồng, bên đó thắng không phải nhờ mô hình, mà nhờ cách sử dụng.

Gợi ý cụ thể cho độc giả Đài Loan: Một là, nhu cầu hằng ngày hiện tại hãy dùng Gemini Flash miễn phí, không cần phải đợi. Hai là, nếu doanh nghiệp muốn dùng bản Pro, hãy đánh giá xem 200 nghìn token có phải là thứ bạn thực sự cần hay bản Flash đã có thể giải quyết, đừng vì độ dài không dùng đến mà phải trả mức giá gấp mười lần. Ba là, nhà phát triển hãy luyện tập trước quy trình ngữ cảnh dài trên các API đã GA. Để so sánh nhiều công cụ hơn và phân tích tác vụ, bạn có thể tham khảo /tools/tasks của chúng tôi.

Bài viết này liên quan đến giá cả và tính năng sản phẩm của bên thứ ba, nội dung thực tế lấy thông báo chính thức của Google làm chuẩn, không cấu thành bất kỳ khuyến nghị đầu tư hoặc mua sắm nào.

Nguồn dữ liệu

Được tổng hợp dựa trên thông tin công khai, lấy thông tin chính thức làm chuẩn.

Câu hỏi thường gặp

Mọi người hiện đã có thể sử dụng Gemini 3.5 Pro chưa?

Tính đến giữa tháng 6 năm 2026, Gemini 3.5 Pro vẫn chỉ được mở dưới dạng bản xem trước giới hạn dành cho khách hàng doanh nghiệp trên Vertex AI, chưa chính thức có mặt trên ứng dụng Gemini dành cho người dùng phổ thông, Google AI Studio hay các gói đăng ký cá nhân. Hầu hết những gì người dùng thông thường sử dụng trên ứng dụng vẫn là bản 3.5 Flash đã được phát hành miễn phí trên toàn cầu.

Ngữ cảnh 2 triệu token của Gemini 3.5 Pro có tác dụng gì?

2 triệu token tương đương với hàng triệu từ, cho phép đọc cùng lúc toàn bộ bộ luật, cả một kho mã nguồn hoặc hàng trăm trang tài liệu, rất phù hợp cho các lĩnh vực như luật pháp, kế toán, sản xuất – những nơi cần xử lý tài liệu siêu dài. Con số này gấp đôi bản Flash (1 triệu token) và là một trong những ngữ cảnh lớn nhất trong số các mô hình tiên tiến đã được thương mại hóa.

Chế độ Deep Think hoạt động như thế nào?

Deep Think không phải là một mô hình riêng biệt, mà là một công tắc tham số (thinkingConfig) trên API. Cùng một ID mô hình, tùy thuộc vào việc bạn có bật nó hay không mà hệ thống sẽ chuyển đổi giữa suy luận tiêu chuẩn hoặc suy luận chuyên sâu. Điều này rất tiện lợi, nhưng suy luận chuyên sâu sẽ làm tăng đáng kể chi phí token, vì vậy bạn nên thiết lập điều kiện kích hoạt thay vì bật mặc định cho tất cả mọi thứ.

Sự khác biệt giữa 3.5 Flash và 3.5 Pro là gì, tôi nên dùng bản nào?

Bản Flash đã được phát hành miễn phí toàn cầu, có tốc độ nhanh, phù hợp cho hầu hết các tác vụ hàng ngày và số lượng lớn yêu cầu; trong khi đó bản Pro mạnh nhất, có ngữ cảnh dài nhất, nhưng giá cước khoảng gấp mười lần bản Flash và hiện chỉ giới hạn cho doanh nghiệp xem trước. Cách làm thực tế là phân tầng: các yêu cầu đơn giản thì dùng bản Flash, còn khi thực sự cần suy luận chuyên sâu hoặc ngữ cảnh siêu dài thì mới chuyển hướng sang bản Pro.

繁體中文版 →