Uji Coba Grok 4.5 dengan Cursor untuk Pemrograman: Murah, Hemat Token, Andal untuk Coding Nyata
Grok 4.5 dari xAI fokus pada satu hal: menyelesaikan tugas panjang di dalam codebase nyata. Dilatih menggunakan data praktis pengembang Cursor, token yang dikeluarkan per tugas hanya seperempat dari Opus 4.8, dan harganya 60% lebih murah. Kali ini, mereka mengincar pekerjaan sehari-hari para engineer.
Sebuah angka yang sangat sepele justru paling bisa menjelaskan apa yang ingin dilakukan Grok 4.5: rata-rata hanya 15.954 token keluaran per tugas, atau sekitar seperempat dari Claude Opus 4.8.
Bagi Anda yang setiap hari menggunakan AI untuk membuat kode pemrograman (coding) dan harus membayar tagihan API sendiri, kalimat ini dapat diterjemahkan menjadi: untuk hal yang sama, dompet Anda akan terasa lebih tidak sakit. Grok 4.5 yang diluncurkan oleh xAI pada 8 Juli menempatkan "murah" dan "hemat token" pada posisi yang paling mencolok, dan metode pelatihannya secara terang-terangan ditujukan untuk skenario pengembangan yang nyata.
Latar Belakang Peristiwa
Grok 4.5 adalah model pertama dari xAI yang dibuat khusus untuk pekerjaan pemrograman dan agen (agent). Hal yang paling istimewa adalah materi pelatihannya—model ini menggunakan data operasional pengembang Cursor yang nyata, serta sekumpulan evaluasi yang dirancang khusus untuk mengukur "apa yang dapat dilakukan AI dalam basis kode nyata di seluruh alur kerja jangka panjang". Ini sedikit berbeda dari jalur sebelumnya yang hanya berfokus pada soal tunggal atau soal pilihan ganda: fokusnya bukanlah seberapa indah tanya-jawab singkat tersebut, melainkan apakah model dapat bertahan melalui seluruh tugas dalam proyek nyata.
Poin Utama
- Harga yang berani: $2 per juta token masukan dan $6 untuk keluaran; jika mengenai cache, masukan bahkan didiskon menjadi $0,5 (diskon 25%). Harga keseluruhan lebih dari 60% lebih rendah daripada Opus 4.8 atau GPT-5.5.
- Skor evaluasi tipe pertempuran aktual: Tingkat penyelesaian soal SWE-Bench Pro sebesar 64.7% dan Terminal-Bench 2.1 sebesar 83.3%, yang keduanya merupakan rangkaian soal yang condong ke arah "teknik nyata".
- Peringkat: Berada di posisi keempat pada indeks kecerdasan Artificial Analysis, mengungguli semua model bobot terbuka (open-weights) dan juga lebih tinggi dari semua seri Gemini.
- Efisiensi Token adalah nilai jual: Rata-rata sekitar 15.954 token keluaran per tugas, yang merupakan sekitar 1 dari 4,2 dari 67.020 Opus 4.8 (pengaturan tertinggi) — ketika dijalankan dalam alur kerja jangka panjang, perbedaan biaya akan semakin diperbesar.
- Konteks dikurangi menjadi 500 ribu: Dibandingkan dengan 1 juta token pada generasi sebelumnya Grok 4.3, terjadi pengurangan, yang dapat dianggap sebagai pertukaran demi efisiensi dan biaya.
Analisis Dampak Pasar
Bagi pengguna di Taiwan: Jika Anda sudah menggunakan alat seperti Cursor, Cline, dan Windsurf, memiliki satu pilihan model lagi yang murah dan hemat token sangat mungkin akan langsung menghemat biaya langganan atau API setelah pengujian aktual. Khususnya bagi pekerja lepas dan pengembang independen, sensitivitas terhadap setiap sen uang jauh lebih tinggi.
Bagi perusahaan: Efisiensi token mungkin tidak terlalu terlihat dalam skala kecil, tetapi begitu digunakan oleh seluruh tim dan dipanggil secara masif setiap hari, perbedaan 4 kali lipat pada token keluaran akan sangat terasa pada tagihan bulanan. Bagi perusahaan yang ingin menerapkan pemrograman AI secara besar-besaran ke dalam tim teknik, ini adalah perhitungan yang harus dipertimbangkan secara serius saat melakukan pengadaan.
Bagi pengembang: Dilatih dengan data Cursor yang nyata, secara teoritis model ini lebih mendekati nuansa operasi sehari-hari; tetapi "data yang dekat dengan alat tertentu" juga dapat membawa bias preferensi gaya. Apakah alat ini benar-benar cocok untuk tumpukan teknologi (tech stack) Anda, Anda tetap harus mencobanya di proyek Anda sendiri untuk mengetahuinya. Konteks yang dipangkas dari 1 juta menjadi 50万 (500 ribu) perlu diperhatikan saat menangani proyek monolitik super besar, apakah akan terasa kurang.
Tren Perkembangan Masa Depan
Pada paruh pertama tahun 2026, sumbu persaingan model pemrograman telah beralih dengan jelas dari "skor papan peringkat" ke "kemampuan teknik nyata + biaya per tugas". GPT-5.6, Claude Sonnet 5, dan Grok 4.5 hampir membicarakan hal yang sama: bukan tentang siapa yang menjawab paling indah, melainkan siapa yang dapat melakukannya dengan stabil dan hemat dalam alur kerja yang nyata. Ini adalah kabar baik bagi pengguna—semua orang mulai membandingkan "kepraktisan" dan "kehematan", bukan hanya membandingkan benchmark di atas kertas.
Kesimpulan dan Komentar TheAI学院
Jujur saja, hal paling cerdas tentang Grok 4.5 bukanlah skor benchmark tertentu yang sangat tinggi, melainkan bagaimana mereka membingkai narasinya pada "menghemat uang dan token" — yang tepat mengenai sasaran kelompok orang yang menggunakan AI untuk menulis kode setiap hari dan harus merogoh kocek mereka sendiri. Dilatih dengan data pertempuran aktual Cursor juga merupakan langkah cerdas, yang secara terang-terangan ingin merebut memori otot para insinyur.
Jangan langsung mengganti semuanya hanya karena terkejut oleh "peringkat keempat" atau rasio biaya yang bagus; ambil satu proyek nyata di tangan Anda, biarkan model tersebut menjalankan tugas yang sama dengan model Anda saat ini, bandingkan tingkat keberhasilan, token yang dihabiskan, dan apakah Anda harus turun tangan untuk menyelamatkan kode yang error, baru kemudian ambil keputusan.
Saran konkret untuk pembaca: Lakukan uji A/B terlebih dahulu selama seminggu pada proyek kecil non-inti, catat kedua angka yaitu "tingkat keberhasilan pemecahan masalah" dan "total biaya" — seringkali model yang murah justru membuat Anda menghabiskan lebih banyak waktu untuk memperbaiki bug, sehingga uang yang dihemat akhirnya habis juga. Ingin mencari lebih banyak penggunaan pemrograman AI, silakan jelajahi Skenario Aplikasi AI kami.
Sumber Data
- Informasi Resmi Peluncuran Grok 4.5 xAI (2026-07-08)
- Kompilasi terkait DataCamp, BenchLM, Artificial Analysis (2026-07)
(Artikel ini disusun berdasarkan informasi publik dan tunduk pada pengumuman resmi; data evaluasi diperbarui seiring dengan versi, kinerja aktual harap didasarkan pada pengujian Anda sendiri.)
Pertanyaan yang Sering Diajukan
Berapa selisih harga Grok 4.5 dibandingkan model lain?
Harga resminya adalah $2 per juta token input dan $6 untuk output, yang bisa turun menjadi $0,5 saat cache tercapai. Secara keseluruhan, harganya lebih dari 60% lebih murah daripada Claude Opus 4.8 atau GPT-5.5. Ditambah dengan jumlah token output per tugas yang lebih sedikit, selisih biaya untuk proses panjang menjadi jauh lebih terasa.
Apakah Grok 4.5 cocok digunakan untuk pemrograman?
Model ini adalah model pertama dari xAI yang khusus dirancang untuk pemrograman dan tugas Agent, dilatih menggunakan data pengembangan Cursor yang sesungguhnya, dengan skor SWE-Bench Pro mencapai 64,7%. Namun, untuk kesesuaian dengan proyek dan tech stack Anda, sebaiknya uji langsung pada codebase Anda sebelum memutuskan.
Mengapa kapasitas konteks dikurangi dari 1 juta menjadi 500 ribu?
Grok 4.5 memiliki kapasitas konteks 500 ribu token, lebih kecil dari pendahulunya Grok 4.3 yang sebesar 1 juta token. Hal ini umumnya dianggap sebagai kompromi demi efisiensi dan penghematan biaya. Anda perlu memperhatikan apakah kapasitas ini mencukupi saat menangani proyek monolitik berskala sangat besar.
Mengapa efisiensi token itu penting?
Untuk tugas yang sama, Grok 4.5 rata-rata mengeluarkan sekitar 15.954 token, yaitu sekitar seperempat dari Opus 4.8. Jika dilihat sekilas per tugas mungkin tidak terlalu signifikan, tetapi saat tim melakukan panggilan API secara massal, jumlah token output akan langsung memengaruhi tagihan dan selisih biayanya akan menjadi sangat besar.