Gemini 3.5 Pro 六月开闸:200 万 token 与 Deep Think,Google 把「最强」留到最后一手
I/O 2026 上 Google 先放出 3.5 Flash,把旗舰级 Pro 押到六月。如今 3.5 Pro 带着 200 万 token 上下文与 Deep Think 推理进入 Vertex AI 企业预览,定价却是 Flash 的近十倍。这场「先免费、后收费」的节奏,台湾的开发者与企业该怎么接?
Gemini 3.5 Pro 六月开闸:200 万 token 与 Deep Think,Google 把「最强」留到最后一手
五月十九号那天我在台北办公室盯着 Google I/O 2026 的直播,等的是传闻中的 Gemini 3.5 Pro。结果 Google 只端出 3.5 Flash,主舞台的工程主管讲完一段话就把 Pro 轻轻带过:「我们也在全力打磨 3.5 Pro,它已经在内部使用,期待下个月推出。」这句「下个月」现在兑现了——六月,Gemini 3.5 Pro 带着一个会让不少人吸一口气的数字进场:200 万 token 的上下文视窗。
我特地把这件事拆开来看,是因为 Google 这一次的发布节奏本身就是新闻。先把不要钱的 Flash 铺到全球十几亿人手上,再把真正吃硬体、要收费的 Pro 留到一个月后,分两段释出。这不是技术问题,是商业节奏——而台湾的团队如果照着旧习惯「等最强的出来再说」,很可能会错估时间表。
事件背景
先把时间轴对清楚。Gemini 3.5 系列在台湾时间五月十九日的 Google I/O 2026 正式亮相,首发是 3.5 Flash,当天就全球上线,免费用户透过 Gemini App 与 Google 搜寻的 AI 模式都能用,开发者则走 Gemini API、Google AI Studio 与 Antigravity。Google 官方部落格当天的标题就定调为「frontier intelligence with action」——强调的是这一代模型不只会回答,而是会「动手做」,主打 agentic(代理式)能力与长流程任务。
至于旗舰的 3.5 Pro,Google 在发布稿里明说「下个月推出」。到了六月中,情况是这样:截至六月十九日,3.5 Pro 仍处于 Vertex AI 企业客户的限定预览阶段,还没进到一般消费者的 Gemini App、Google AI Studio,或个人订阅方案。换句话说,你现在在手机 App 里用到的,大机率还是 Flash,不是 Pro。
这个落差很重要。市场上有不少文章把「I/O 发表」直接当成「人人可用」,实际上 Pro 目前只开给既有的 Vertex AI 企业帐号,连自助报名的入口都还没有公开,得透过 Google Cloud 的客户经理接洽。我查证过程里看到一些站点绘声绘影地拿它去跟某些竞品的传闻做对比,那些未经官方证实的部分,我这篇就不采用——只讲对得上的事实。
本次重点
- 200 万 token 上下文视窗。 这是 Flash(100 万)的两倍,也是目前已公布的量产级前沿模型里最大的上下文之一。换算成中文,概略是数百万字一次读进去,整套法规、整个程式库、几百页的财报都能一口气喂给它。
- Deep Think 推理模式。 值得注意的是它的实作方式:Deep Think 不是另开一个模型端点,而是 API 上的一个参数开关(thinkingConfig)。同一个模型 ID(报导指为 gemini-3.5-pro-preview-06)同时处理标准请求与深度推理请求,差别在你有没有把开关打开。这对开发者来说是省事的设计,但也代表深度推理的 token 成本要自己控管。
- 先 Flash、后 Pro 的两段式释出。 Flash 当天免费全球上线,Pro 押后一个月、且先给企业。Google 等于把「便宜、够快、够广」与「最强、最贵、先服务付费企业」切成两条线。
- Flash 的硬指标。 官方数据显示 3.5 Flash 在 Terminal-Bench 2.1 拿到 76.2%、GDPval-AA 1656 Elo、MCP Atlas 83.6%,输出速度号称比其他前沿模型快四倍,而且在多项编码与代理基准上赢过上一代的 3.1 Pro。
- 定价是 Flash 的近十倍。 多家媒体引述的 Pro 定价落在每百万输入 token 约 15 美元、输出约 60 美元的区间,大约是 3.5 Flash 的十倍。最先吃到 Pro 的,会是 Google 月费 20 美元的 Pro 方案与 250 美元的 Ultra 方案订户。
市场影响分析
对台湾一般使用者:坦白说,短期内你不太需要为「Pro 还没上 App」焦虑。日常的查资料、写信、翻译、整理会议记录,3.5 Flash 已经免费而且够快——它在 App 里是预设值,你打开就在用。真正需要 200 万 token 的场景,是那种要把整本书、整份合约、整年对话一次塞进去分析的重度需求,一般人一周也碰不到几次。我的建议是:先把免费的 Flash 用熟,等 Pro 进到 20 美元方案再评估要不要升级,不必急着现在去抢企业预览。
对台湾企业应用:这才是这次发布真正的战场。200 万 token 对法律、会计、制造业的技术文件处理是实打实的诱因——一次读完整套 SOP、整批理赔文件、整个专案的历史邮件,不用再切段拼接。但有两个现实要先想清楚。第一,Pro 目前绑定 Vertex AI 企业身分,没有公开自助路径,你得透过 Google Cloud 帐户经理谈,导入前置时间要抓进专案排程。第二,近十倍的定价意味着「能用 Flash 解决的,就别硬上 Pro」。比较务实的架构是分层:大量、简单的请求走 Flash,真正需要深度推理或超长上下文的才路由到 Pro,把成本压在刀口上。
对台湾开发者:Deep Think 做成参数开关这件事,对工程实作是好消息——不用维护两套模型路由,一个 ID 走天下。但「方便开」也代表「容易忘了关」,深度推理会明显吃掉更多 token,成本曲线会比你预期的陡。我会建议在系统里把 Deep Think 设成需要明确条件才触发,而不是预设全开。另外,Pro 的预览期 API 可能还会调整,正式 GA 前不要把生产环境的核心流程死绑在 preview 版本上。想先练手的人,可以拿已 GA 的 Gemini API 与 Google AI Studio 把长上下文的处理流程先架起来,等 Pro 开放再无痛切换。
未来发展趋势
我认为三个方向会在下半年逐渐明朗。
第一,「上下文长度」这场军备竞赛会从炫技转向实用。200 万 token 听起来吓人,但真正的考验是「长上下文的检索准确率」——塞得进去不等于找得准。各家接下来比的会是在超长文本下还能不能精准定位资讯,而不只是视窗大小的数字。
第二,「分段释出」会变成大厂的常规打法。先用免费、够用的小模型占住使用者习惯,再把旗舰留给付费企业,Google 这次示范得很清楚。对 ChatGPT、Claude、Perplexity 这些对手而言,纯比参数的时代正在过去,比的是「免费那一层好不好用、付费那一层值不值得」。
第三,代理式能力(agentic)会是下一个分水岭。Google 这次反复强调「intelligence with action」,意思是模型要能自己跑多步骤工作流、调工具、完成任务。谁能让 AI 稳定地「把事做完」而不只是「把话讲完」,谁就握住企业预算。
TheAI学院 总结与评语
Gemini 3.5 Pro 的六月开闸,表面是一个模型上线,底层是 Google 的节奏感:用免费的 Flash 铺规模,用收费的 Pro 收企业。200 万 token 与 Deep Think 是真本事,但「目前只在 Vertex AI 企业预览」也是真现实,别被「I/O 已发表」的标题骗了以为人人可用。
评语:这次最值得台湾读者学的,不是「Google 又出了更强的模型」,而是「同一家公司,免费版跟旗舰版的释出时间差了一整个月」。对个人,先把免费的 Flash 用到极致;对企业,先搞清楚 Vertex AI 的导入门槛与分层成本,再决定要不要追 Pro。会省钱、会分流的团队,赢的不是模型,是用法。
给台湾读者的具体建议:一,日常需求现在就用免费的 Gemini Flash,不必等。二,企业若要 Pro,先评估 200 万 token 是不是你真的需要的,还是 Flash 就能解,别为用不到的长度付十倍价。三,开发者把长上下文流程先在已 GA 的 API 上练起来。更多工具比较与任务拆解,可以参考我们的 /tools 与 /tasks。
本文涉及第三方产品定价与功能,实际内容以 Google 官方公告为准,不构成任何投资或采购建议。
资料来源
- Gemini 3.5: frontier intelligence with action — Google 官方部落格
- Google launches Gemini 3 Flash / Gemini 3.5 系列报导 — TechCrunch
- Google's Gemini Omni turns images, audio, and text into video — TechCrunch
依公开资讯整理、以官方为准。
常见问题
Gemini 3.5 Pro 现在一般人能用了吗?
截至 2026 年六月中,3.5 Pro 仍只开放给 Vertex AI 企业客户限定预览,尚未进到消费者版的 Gemini App、Google AI Studio 或个人订阅方案。一般使用者在 App 里用到的多半还是已全球免费上线的 3.5 Flash。
Gemini 3.5 Pro 的 200 万 token 上下文有什么用?
200 万 token 约等于数百万字,可一次读入整套法规、整个程式库或几百页文件,适合法律、会计、制造业等需要处理超长文件的场景。它是 Flash(100 万 token)的两倍,也是目前已公布的量产前沿模型中最大的上下文之一。
Deep Think 模式怎么运作?
Deep Think 并非另一个模型,而是 API 上的参数开关(thinkingConfig)。同一个模型 ID 依你是否开启而切换标准或深度推理。方便,但深度推理会明显增加 token 成本,建议设定触发条件而非预设全开。
3.5 Flash 跟 3.5 Pro 差在哪、我该用哪个?
Flash 已免费全球上线、速度快、适合多数日常与大量请求;Pro 最强、上下文最长,但定价约为 Flash 十倍且目前仅限企业预览。务实做法是分层:简单请求走 Flash,真正需要深度推理或超长上下文时才路由到 Pro。