Gemini 3.5 Pro Dilancarkan pada Bulan Jun: 200 Juta Token dan Deep Think, Google Simpan "Yang Terhebat" Sebagai Langkah Terakhir

Pada I/O 2026, Google melancarkan 3.5 Flash terlebih dahulu dan menangguhkan Pro peringkat fliksip ke bulan Jun. Kini, 3.5 Pro hadir dengan konteks 2 million token dan penaakulan Deep Think ke dalam pratonton perusahaan Vertex AI, tetapi harga yang ditetapkan hampir sepuluh kali ganda berbanding Flash. Bagaimanakah pembangun dan syarikat di Taiwan patut menghadapi rentak "percuma dahulu, berbayar kemudian" ini?

Gemini 3.5 Pro Dilancar Bulan Jun: 2 Million Token dan Deep Think, Google Simpan "Aset Terkuat" hingga Detik Akhir

Pada 19 Mei lalu, saya berada di pejabat Taipei sambil memantau siaran langsung Google I/O 2026, menantikan khabar tentang Gemini 3.5 Pro yang hangat diperkatakan. Namun, Google sekadar memperkenalkan versi 3.5 Flash. Selepas menghabiskan satu segmen ucapan, ketua kejuruteraan di pentas utama menyentuh versi Pro secara sepintas lalu: "Kami juga sedang bertungkus-lumus menyempurnakan 3.5 Pro. Ia sudah pun digunakan secara dalaman, dan kami tidak sabar melancarkannya bulan depan." Kata-kata "bulan depan" itu kini menjadi kenyataan—pada bulan Jun, Gemini 3.5 Pro hadir ke gelanggang dengan angka yang pasti membuatkan ramai terkesima: tingkap konteks (context window) sebesar 2 juta token.

Saya sengaja membahagikan topik ini kerana strategi pelancaran Google kali ini sendiri sudah menjadi berita. Mereka melancarkan Flash percuma kepada lebih berbilion pengguna di seluruh dunia terlebih dahulu, kemudian menyimpan versi Pro yang berintensifkan perkakasan dan berbayar untuk sebulan kemudian, melancarkannya dalam dua fasa. Ini bukan isu teknikal, tetapi strategi komersial—dan jika pasukan di Taiwan terus mengikut tabiat lama "tunggu hingga model terkuat keluar barulah bertindak", mereka mungkin akan tersilap menilai jadual waktu.

Latar Belakang Peristiwa

Mari kita selaraskan garis masa terlebih dahulu. Siri Gemini 3.5 secara rasmi didedahkan pada Google I/O 2026 pada 19 Mei waktu Taiwan. Kemunculan sulungnya adalah 3.5 Flash, yang dilancarkan secara global pada hari yang sama. Pengguna percuma boleh menggunakannya melalui aplikasi Gemini dan mod AI Carian Google, manakala pembangun boleh mengaksesnya melalui Gemini API, Google AI Studio, dan Antigravity. Tajuk utama blog rasmi Google pada hari itu menetapkan hala tuju sebagai "frontier intelligence with action" (kecerdasan sempadan dengan tindakan) — menekankan bahawa generasi model ini bukan sekadar menjawab, tetapi mampu "melakukan kerja", dengan fokus pada keupayaan ejen (agentic) dan tugasan proses panjang.

Bagi model flagship 3.5 Pro pula, Google menyatakan secara terus terang dalam kenyataan akhbar mereka bahawa ia akan "dilancarkan bulan depan". Menjelang pertengahan Jun, situasinya adalah seperti berikut: setakat 19 Jun, 3.5 Pro masih berada dalam fasa pratonton terhad untuk pelanggan perniagaan Vertex AI, dan belum lagi memasuki aplikasi Gemini pengguna umum, Google AI Studio, atau pelan langganan peribadi. Dalam erti kata lain, apa yang anda gunakan dalam aplikasi mudah alih anda sekarang berkemungkinan besar masih versi Flash, bukannya Pro.

Jurang ini amat penting. Terdapat banyak artikel di pasaran yang terus menyamakan "pelancaran I/O" dengan "boleh diakses oleh semua orang". Hakikatnya, versi Pro kini hanya dibuka kepada akaun perniagaan Vertex AI sedia ada, dan tiada pautan pendaftaran sendiri yang dibuka kepada umum; anda perlu berurusan dengan pengurus akaun Google Cloud. Semasa proses pengesahan saya, saya melihat beberapa laman web membuat spekulasi liar dengan membandingkannya dengan khabar angin pesaing tertentu. Bahagian yang tidak disahkan secara rasmi itu tidak akan saya ambil pakai di sini—saya hanya membincangkan fakta yang disahkan.

Fokus Utama

  • Tingkap konteks (context window) 2 juta token. Ini adalah dua kali ganda berbanding Flash (1 juta) dan merupakan salah satu tingkap konteks terbesar di kalangan model sempadan peringkat pengeluaran yang diumumkan setakat ini. Diterjemahkan ke dalam bentuk teks, ia membolehkan jutaan patah perkataan dibaca sekaligus; keseluruhan set undang-undang, keseluruhan repositori kod, atau laporan kewangan setebal ratusan halaman boleh disuap kepadanya dalam satu masa.
  • Mod penalaran Deep Think. Apa yang menarik ialah cara ia dilaksanakan: Deep Think bukanlah titik akhir (endpoint) model yang diasingkan, tetapi suis parameter pada API (thinkingConfig). ID model yang sama (dilaporkan sebagai gemini-3.5-pro-preview-06) memproses permintaan standard dan permintaan penalaran mendalam secara serentak; perbezaannya hanya terletak pada sama ada anda memasang suis tersebut atau tidak. Ini adalah reka bentuk yang memudahkan kerja pembangun, tetapi ia juga bermakna kos token untuk penalaran mendalam perlu dikawal sendiri.
  • Pelancaran dua fasa: Flash dahulu, kemudian Pro. Versi Flash dilancarkan secara global secara percuma pada hari yang sama, manakala versi Pro ditangguhkan selama sebulan dan diberikan kepada syarikat perniagaan terlebih dahulu. Google secara berkesan membezakan penawaran kepada dua laluan: "murah, cukup pantas, dan meluas" berbanding "paling kuat, paling mahal, dan diutamakan untuk syarikat berbayar".
  • Petunjuk prestasi utama Flash. Data rasmi menunjukkan bahawa 3.5 Flash mendapat 76.2% pada Terminal-Bench 2.1, 1656 Elo pada GDPval-AA, dan 83.6% pada MCP Atlas. Kelajuan outputnya didakwa empat kali lebih pantas daripada model sempadan yang lain, dan ia mengungguli generasi terdahulu 3.5 Pro dalam pelbagai penanda aras pengekodan dan ejen.
  • Harga hampir sepuluh kali ganda berbanding Flash. Harga versi Pro yang dipetik oleh pelbagai media berada dalam julat sekitar AS$15 setiap juta token input dan AS$60 untuk output, iaitu kira-kira sepuluh kali ganda daripada 3.5 Pro Flash. Golongan terawal yang akan menikmati versi Pro ialah pelanggan pelan Pro bulanan Google sebanyak AS$20 dan pelan Ultra sebanyak AS$250.

Analisis Kesan Pasaran

Bagi pengguna biasa di Taiwan: Terus terang, dalam jangka masa pendek, anda tidak perlu berasa cemas kerana "versi Pro belum masuk ke dalam aplikasi". Untuk carian maklumat harian, menulis e-mel, terjemahan, dan menyusun minit mesyuarat, Gemini 3.5 Flash sudah pun percuma dan cukup pantas—ia adalah tetapan lalai dalam aplikasi, dan anda sedang menggunakannya sebaik sahaja dibuka. Senario yang benar-benar memerlukan 2 juta token adalah keperluan intensif seperti memasukkan keseluruhan buku, keseluruhan kontrak, atau setahun perbualan sekaligus untuk dianalisis, yang jarang ditemui oleh orang biasa dalam seminggu. Cadangan saya ialah: biasakan diri menggunakan Flash percuma dahulu, dan tunggu sehingga versi Pro masuk ke dalam pelan AS$20 sebelum menilai sama ada mahu menaik taraf, tidak perlu terburu-buru merebut akses pratonton perniagaan sekarang.

Bagi aplikasi perniagaan di Taiwan: Di sinilah medan perang sebenar pelancaran kali ini. 2 juta token adalah insentif yang nyata untuk pemprosesan dokumen teknikal dalam industri undang-undang, perakaunan, dan pembuatan—membaca keseluruhan set SOP, kumpulan dokumen tuntutan insurans, atau keseluruhan e-mel sejarah projek sekaligus tanpa perlu memotong dan menyambungkannya. Walau bagaimanapun, dua realiti perlu difikirkan dengan teliti terlebih dahulu. Pertama, versi Pro kini terikat dengan identiti perniagaan Vertex AI dan tiada laluan layan diri awam; anda perlu berunding melalui pengurus akaun Google Cloud, dan masa persediaan integrasi mesti diambil kira dalam jadual projek. Kedua, harga yang hampir sepuluh kali ganda bermakna "apa yang boleh diselesaikan dengan Flash, jangan dipaksa menggunakan Pro". Seni bina yang lebih pragmatik ialah pendekatan berlapis: permintaan yang besar dan mudah menggunakan Flash, manakala permintaan yang benar-benar memerlukan penalaran mendalam atau konteks ultra-panjang disalurkan kepada Pro, bagi memastikan kos dikawal dengan ketat.

Bagi pembangun di Taiwan: Hakikat bahawa Deep Think dijadikan suis parameter adalah berita baik untuk pelaksanaan kejuruteraan—tidak perlu menyelenggara dua set laluan model, satu ID sudah mencukupi untuk semua. Tetapi "kemudahan untuk dihidupkan" juga bermakna "mudah lupa untuk menutupnya". Penalaran mendalam akan dengan ketara memakan lebih banyak token, dan keluk kos akan menjadi lebih curam daripada yang anda jangkakan. Saya mencadangkan agar anda menetapkan Deep Think dalam sistem supaya ia hanya mencetuskan syarat tertentu, bukannya dibiarkan terpasang secara lalai. Di samping itu, API tempoh pratonton Pro mungkin masih akan diselaraskan; sebelum pelancaran rasmi (GA), jangan mengikat secara mati proses teras dalam persekitaran pengeluaran kepada versi pratonton. Sesiapa yang ingin berlatih terlebih dahulu boleh menggunakan API Gemini yang telah mencapai status GA dan Google AI Studio untuk membina aliran proses pemprosesan konteks panjang terlebih dahulu, dan menukar secara lancar apabila versi Pro dibuka kelak.

Trend Pembangunan Masa Depan

Saya percaya tiga arah berikut akan menjadi semakin jelas pada separuh kedua tahun ini.

Pertama, perlumbaan senjata "panjang konteks" akan beralih daripada pameran kemahiran kepada utiliti praktikal. 2 juta token kedengaran menggerunkan, tetapi ujian sebenar ialah "ketepatan carian konteks panjang" — boleh memuatkan tidak bermaksud boleh mencari dengan tepat. Persaingan seterusnya antara pelbagai pihak adalah sama ada mereka masih boleh mencari maklumat dengan tepat di bawah teks ultra-panjang, dan bukan sekadar nombor saiz tingkap konteks.

Kedua, "pelancaran berperingkat" akan menjadi taktik rutin bagi syarikat-syarikat gergasi. Menguasai tabiat pengguna terlebih dahulu dengan model kecil yang percuma dan mencukupi, kemudian menyimpan model flagship untuk syarikat berbayar; Google telah menunjukkan contoh yang amat jelas kali ini. Bagi pesaing seperti ChatGPT, Claude, dan Perplexity, era bersaing semata-mata atas parameter sedang berlalu; persaingan kini adalah tentang "sama ada lapisan percuma itu berguna, dan sama ada lapisan berbayar itu berbaloi".

Ketiga, keupayaan ejen (agentic) akan menjadi garis pemisah seterusnya. Google berulang kali menekankan "intelligence with action" kali ini, yang bermaksud model mesti dapat menjalankan alir kerja pelbagai langkah sendiri, memanggil alatan, dan menyelesaikan tugasan. Sesiapa yang boleh membuatkan AI "menyelesaikan kerja" secara stabil dan bukannya sekadar "menghabiskan kata-kata", dialah yang menguasai bajet perniagaan.

Kesimpulan dan Ulasan Akademi TheAI

Pelancaran Gemini 3.5 Pro pada bulan Jun kelihatan seperti pelancaran model di permukaan, tetapi di dasarnya ia mencerminkan kepekaan rentak Google: menggunakan Flash percuma untuk membina skala, dan menggunakan Pro berbayar untuk mengaut keuntungan perniagaan. 2 juta token dan Deep Think adalah kebolehan sebenar, tetapi "kini hanya dalam pratonton perniagaan Vertex AI" juga merupakan realiti sebenar; jangan tertipu dengan tajuk "I/O telah dilancarkan" dan menganggap ia boleh digunakan oleh semua orang.

Ulasan: Perkara paling berharga yang patut dipelajari oleh pembaca di Taiwan kali ini bukanlah "Google telah mengeluarkan model yang lebih kuat", syarikat yang sama mengambil masa sebulan penuh untuk melancarkan versi percuma dan versi flagship. Bagi individu, gunakan Flash percuma secara maksimum; bagi perniagaan, fahami ambang kemasukan Vertex AI dan kos berlapis terlebih dahulu sebelum memutuskan sama ada mahu mengejar Pro. Pasukan yang tahu cara menjimatkan wang dan mengagihkan aliran kerja bukanlah yang menang kerana model, tetapi kerana cara penggunaannya.

Cadangan khusus untuk pembaca di Taiwan: Pertama, untuk keperluan harian, gunakan Gemini Flash percuma sekarang, tidak perlu menunggu. Kedua, jika syarikat anda mahukan versi Pro, nilai dahulu sama ada 2 juta token itu benar-benar diperlukan oleh anda, atau sama ada Flash sudah mencukupi, jangan bayar harga sepuluh kali ganda untuk panjang yang tidak digunakan. Ketiga, pembangun harus membiasakan diri melatih aliran proses konteks panjang pada API yang telah mencapai status GA terlebih dahulu. Untuk lebih banyak perbandingan alatan dan penguraian tugasan, anda boleh merujuk kepada halaman /tools dan /tasks kami.

Artikel ini melibatkan harga dan fungsi produk pihak ketiga. Kandungan sebenar tertakluk kepada pengumuman rasmi Google dan tidak membentuk sebarang nasihat pelaburan atau perolehan.

Sumber Data

Disusun berdasarkan maklumat awam, versi rasmi diutamakan.

Soalan Lazim

Adakah Gemini 3.5 Pro kini sudah boleh digunakan oleh orang ramai?

Sehingga pertengahan Jun 2026, 3.5 Pro masih terhad kepada pratonton eksklusif untuk pelanggan perusahaan Vertex AI, dan belum memasuki aplikasi Gemini versi pengguna, Google AI Studio, ataupun pelan langganan peribadi. Kebanyakan pengguna biasa yang menggunakannya dalam aplikasi masih menggunakan 3.5 Flash yang telah dilancarkan secara percuma di seluruh dunia.

Apakah kegunaan konteks 2 million token Gemini 3.5 Pro?

2 million token adalah bersamaan dengan berjuta-juta perkataan. Ia boleh membaca keseluruhan set undang-undang, seluruh pustaka kod, atau ratusan halaman dokumen sekaligus, menjadikannya sesuai untuk bidang undang-undang, perakaunan, pembuatan, dan senario lain yang memerlukan pemprosesan dokumen yang sangat panjang. Kapasiti ini adalah dua kali ganda berbanding Flash (1 juta token), dan merupakan salah satu konteks terbesar antara model frontier pengeluaran yang telah diumumkan setakat ini.

Bagaimanakah mod Deep Think beroperasi?

Deep Think bukanlah model yang lain, tetapi suis parameter (thinkingConfig) pada API. ID model yang sama beralih antara penaakulan standard atau mendalam bergantung pada sama ada anda mengaktifkannya. Ia memang mudah, tetapi penaakulan mendalam akan meningkatkan kos token dengan ketara. Adalah disyorkan untuk menetapkan syarat pencetus dan bukannya mendayakannya secara lalai untuk semua keadaan.

Apakah perbezaan antara 3.5 Flash dan 3.5 Pro, dan yang manakah patut saya guna?

Flash telah dilancarkan secara percuma di seluruh dunia, pantas, dan sesuai untuk kebanyakan tugasan harian serta permintaan volum tinggi. Pro pula adalah yang paling berkuasa dengan konteks terpanjang, tetapi harganya adalah kira-kira sepuluh kali ganda berbanding Flash dan kini terhad kepada pratonton perusahaan. Pendekatan yang pragmatik adalah secara bertingkat: gunakan Flash untuk permintaan mudah, dan halakan ke Pro hanya apabila anda benar-benar memerlukan penaakulan mendalam atau konteks yang teramat panjang.

繁體中文版 →