Grok 4.5 Diuji Praktikal Menggunakan Data Cursor: Murah, Jimat Token, Direka Khas untuk Pengekodan Sebenar

Grok 4.5 daripada xAI mengetengahkan satu kelebihan utama: mampu menyelesaikan tugasan aliran kerja panjang dalam pangkalan kod sebenar. Dilatih menggunakan data praktikal pembangun Cursor, jumlah token yang dikeluarkan bagi setiap tugasan hanya satu perempat daripada Opus 4.8, manakala harganya 60% lebih murah—kali ini, ia menyasarkan tugasan harian jurutera perisian.

Satu angka yang tidak mencolok langsung mendedahkan niat sebenar Grok 4.5: untuk setiap purata tugasan, ia hanya menghasilkan 15,954 token output, iaitu kira-kira suku daripada Claude Opus 4.8.

Bagi mereka yang menggunakan AI untuk menulis kod setiap hari dan membayar bil API sendiri, ayat ini diterjemahkan kepada: untuk tugasan yang sama, dompet anda tidak begitu sakit. Grok 4.5, yang dilancarkan oleh xAI pada 8 Julai, meletakkan "murah" dan "penjimatan token" di tempat yang paling ketara, dan kaedah latihannya jelas menyasarkan senario pembangunan sebenar.

Latar Belakang Peristiwa

Grok 4.5 ialah model pertama xAI yang dihasilkan khas untuk pengaturcaraan dan kerja Ejen. Apa yang paling istimewa ialah bahan latihannya—ia menggunakan data operasi pembangun Cursor yang sebenar, serta sekumpulan penanda aras yang direka khusus untuk mengukur "apa yang boleh dilakukan oleh AI dalam pangkalan kod sebenar merentas aliran kerja yang panjang." Ini berbeza dengan laluan masa lalu yang hanya mengejar soalan tunggal atau pilihan ganda: tumpuannya bukan pada sama ada soal jawab pendek itu kelihatan bagus, tetapi sama ada ia boleh bertahan sepanjang keseluruhan tugasan dalam projek sebenar.

Perkara Utama

  • Harga yang agresif: $2 setiap juta token input dan $6 untuk output; jika cache dicapai, input dikurangkan kepada $0.5 (diskaun 25%). Keseluruhan harga adalah lebih daripada 60% lebih rendah daripada Opus 4.8 atau GPT-5.5.
  • Skor penanda aras praktikal: Kadar penyelesaian SWE-Bench Pro sebanyak 64.7% dan Terminal-Bench 2.1 pada 83.3%, kedua-duanya tergolong dalam set soalan "kejuruteraan sebenar".
  • Kedudukan ranking: Menduduki tempat keempat pada Indeks Kecerdasan Artificial Analysis, mengungguli semua model berat terbuka dan lebih tinggi daripada semua siri Gemini.
  • Kecekapan token sebagai nilai jualan: Purata kira-kira 15,954 token output setiap tugasan, iaitu kira-kira 4.2 kali ganda lebih rendah daripada 67,020 Opus 4.8 (tetapan tertinggi)—perbezaan kos akan diperbesarkan apabila dijalankan melalui aliran kerja yang panjang.
  • Konteks dikurangkan kepada 500,000: Berbanding dengan 1 juta token generasi sebelumnya Grok 4.3, ia telah dikurangkan sedikit, yang merupakan pertukaran yang dibuat demi kecekapan dan kos.

Analisis Kesan Pasaran

Bagi pengguna di Taiwan: Jika anda sudah menggunakan alat seperti Cursor, Cline, dan Windsurf, mempunyai satu lagi pilihan model yang murah dan menjimatkan token mungkin akan terus menjimatkan yuran langganan atau API anda selepas pengujian sebenar. Terutamanya pekerja bebas dan pembangun bebas, yang lebih sensitif terhadap setiap dolar.

Bagi syarikat: Kecekapan token tidak begitu ketara pada skala kecil, tetapi apabila ia melibatkan keseluruhan pasukan yang membuat panggilan besar-besaran setiap hari, perbezaan 4 kali ganda dalam token output menjadi sangat ketara pada bil bulanan. Bagi syarikat yang ingin menggunakan pengaturcaraan AI secara meluas ke dalam pasukan kejuruteraan, ini adalah angka yang perlu dikira dengan serius semasa perolehan.

Bagi pembangun: Latihan menggunakan data Cursor sebenar secara teorinya lebih dekat dengan rasa operasi harian; tetapi "data yang dekat dengan alat tertentu" mungkin juga membawa kepada berat sebelah gaya. Sama ada ia benar-benar sesuai dengan timbunan teknologi anda masih memerlukan anda memasukkannya ke dalam projek anda sendiri untuk melihat prestasinya. Konteks dipotong daripada 1 juta kepada 500,000, jadi anda perlu memberi perhatian sama ada ia tidak mencukupi apabila mengendalikan projek monolitik yang besar.

Trend Pembangunan Masa Depan

Pada separuh pertama tahun 2026, teras persaingan untuk model pengaturcaraan telah beralih dengan ketara daripada "skor papan pendahulu" kepada "keupayaan kejuruteraan sebenar + kos setiap tugasan." GPT-5.6, Claude Sonnet 5, dan Grok 4.5 hampir memperkatakan perkara yang sama: bukan siapa yang menjawab dengan paling cantik, tetapi siapa yang boleh menjadi stabil dan menjimatkan dalam aliran kerja sebenar. Ini berita baik untuk pengguna—semua orang mula membandingkan "kepraktisan" dan "nilai untuk wang", dan bukan sekadar tanda aras di atas kertas.

Rumusan dan Ulasan Akademi TheAI

Secara jujur, bahagian paling bijak tentang Grok 4.5 bukanlah penanda aras tertentu yang sangat tinggi, tetapi cara ia membingkai naratifnya sekitar "menjimatkan wang dan token"—ini tepat mengenai kumpulan orang yang menggunakan AI untuk menulis kod setiap hari dan perlu membayar wang mereka sendiri. Latihan dengan data pertempuran sebenar Cursor juga merupakan langkah bijak, jelas bertujuan untuk merampas memori otot jurutera.

Jangan biarkan "tempat keempat" atau nisbah kos yang kelihatan cantik menakutkan anda untuk menukar keseluruhan persediaan; ambil projek sebenar di tangan anda, biarkan ia menjalankan tugasan yang sama dengan model semasa anda, bandingkan kadar kejayaan, token yang digunakan, dan sama ada anda perlu menyelamatkan keadaan, sebelum membuat keputusan.

Cadangan khusus untuk pembaca: Jalankan ujian A/B selama seminggu pada projek kecil bukan teras terlebih dahulu, dan catat kedua-dua angka "kadar kejayaan penyelesaian masalah" dan "jumlah perbelanjaan"—selalunya model murah mengambil lebih banyak masa anda untuk membetulkan pepijat, dan wang yang anda jimatkan akan habis begitu sahaja. Jika anda ingin mencari lebih banyak cara menggunakan pengaturcaraan AI, anda boleh melayari Senario Aplikasi AI kami.

Sumber Data

  • Maklumat Rasmi Pelancaran Grok 4.5 xAI (2026-07-08)
  • Ringkasan Berkaitan DataCamp, BenchLM, dan Artificial Analysis (2026-07)

(Artikel ini disusun berdasarkan maklumat awam dan tertakluk kepada pengumuman rasmi; data penilaian dikemas kini dengan versi, dan prestasi sebenar harus berdasarkan ujian anda sendiri.)

Soalan Lazim

Berapakah perbezaan harga Grok 4.5 berbanding model lain?

Harga rasminya ialah USD 2 bagi setiap juta token input dan USD 6 untuk output, manakala input boleh dikurangkan kepada USD 0.5 apabila cache dicapai. Secara keseluruhan, ia adalah lebih daripada 60% lebih murah berbanding Claude Opus 4.8 atau GPT-5.5. Ditambah pula dengan jumlah token output yang lebih sedikit bagi setiap tugasan, jurang perbelanjaan sebenar untuk aliran kerja yang panjang menjadi lebih ketara.

Adakah Grok 4.5 sesuai digunakan untuk menulis kod?

Ia adalah model pertama daripada xAI yang dibina khas untuk pengekodan dan tugasan Agent, dilatih menggunakan data pembangunan Cursor sebenar, dengan skor SWE-Bench Pro mencapai 64.7%. Walau bagaimanapun, sama ada ia sesuai untuk projek dan tindanan teknologi (tech stack) anda, adalah disyorkan agar anda mengujinya terus pada pangkalan kod anda sebelum membuat keputusan.

Mengapa kapasiti konteks dikurangkan daripada 1 juta kepada 500,000?

Kapasiti konteks Grok 4.5 ialah 500,000 token, iaitu penurunan berbanding model terdahulu Grok 4.3 yang mempunyai 1 juta token. Ini secara umumnya dilihat sebagai pertukaran (trade-off) untuk mendapatkan kecekapan dan penjimatan kos. Anda perlu mengambil perhatian sama ada ia mencukupi semasa mengendalikan projek monolitik berskala besar.

Mengapa kecekapan token itu penting?

Bagi tugasan yang sama, Grok 4.5 menghasilkan purata kira-kira 15,954 token, iaitu kira-kira satu perempat daripada Opus 4.8. Perbezaannya mungkin tidak ketara untuk satu kali penggunaan, tetapi apabila pasukan membuat panggilan API secara besar-besaran, jumlah token output akan memberi impak langsung pada bil API, dan jurang perbezaan kos akan menjadi lebih besar.

繁體中文版 →