Grok 4.5 用 Cursor 實戰數據練出來:便宜、省 token,專打真實寫程式

Grok 4.5 用 Cursor 實戰數據練出來:便宜、省 token,專打真實寫程式

xAI 的 Grok 4.5 主打一件事:在真實程式碼庫裡撐完長流程。用 Cursor 開發者實戰資料訓練、每任務吐的 token 只有 Opus 4.8 的四分之一,價格還低六成——這回它想搶的是工程師的日常。

一個很不起眼的數字,反而最能說明 Grok 4.5 想幹嘛:平均一個任務,它只吐 15,954 個輸出 token,大約是 Claude Opus 4.8 的四分之一。

對天天用 AI 寫程式、又要自己付 API 帳單的人來說,這句話翻譯過來就是:同樣一件事,錢包比較不痛。xAI 在 7 月 8 日推出的 Grok 4.5,把「便宜」和「省 token」放在最顯眼的位置,而且它的訓練方式,擺明是衝著真實開發場景來的。

事件背景

Grok 4.5 是 xAI 第一個專為程式與 Agent 工作打造的模型。最特別的是訓練素材——它用了真實的 Cursor 開發者操作資料,以及一批專門衡量「AI 在真實程式碼庫裡、跨一段長流程能做到什麼」的評測。這跟過去那種刷單題、刷選擇題的路線不太一樣:重點不是短問答漂不漂亮,而是能不能在一個真的專案裡撐完一整段任務。

本次重點

  • 定價很敢:每百萬輸入 token 2 美元、輸出 6 美元;若命中快取,輸入還打到 0.5 美元(七五折)。整體價格比 Opus 4.8 或 GPT-5.5 低超過六成。
  • 實戰型評測成績:SWE-Bench Pro 解題率 64.7%、Terminal-Bench 2.1 拿到 83.3%,都是偏「真實工程」的題組。
  • 排名位置:在 Artificial Analysis 的智慧指數上排到第四,贏過所有開放權重模型,也高於所有 Gemini 系列。
  • Token 效率是賣點:平均每任務約 15,954 輸出 token,約為 Opus 4.8(最高設定)67,020 的 4.2 分之一——長流程跑下來,成本差距會被放大。
  • 上下文縮到 50 萬:相較前代 Grok 4.3 的 100 萬 token 有所縮減,算是為了效率和成本做的取捨。

市場影響分析

對台灣使用者:如果你已經在用 Cursor、ClineWindsurf 這類工具,多一個又便宜又省 token 的模型選項,實測後很可能直接省下一筆訂閱或 API 費用。尤其接案族、獨立開發者,對每一塊錢的敏感度更高。

對企業:token 效率在小規模看不太出來,但一旦是整個團隊、每天大量呼叫,4 倍的輸出 token 差距換算成月帳單就很有感。對要把 AI 編程大規模鋪進工程團隊的公司,這是採購時該認真算的一筆帳。

對開發者:用真實 Cursor 資料訓練,理論上更貼近日常操作手感;但「貼近某一種工具的資料」也可能帶來風格偏好。它到底適不適合你的技術棧,還是得丟進自己的專案跑過才知道。上下文從 100 萬砍到 50 萬,處理超大型單體專案時要留意會不會不夠用。

未來發展趨勢

2026 上半年,程式模型的競爭主軸明顯從「刷榜分數」轉向「真實工程能力 + 每任務成本」。GPT-5.6、Claude Sonnet 5、Grok 4.5 幾乎都在講同一件事:不是誰答得漂亮,而是誰能在真實工作流裡又穩又省。這對使用者是好消息——大家開始比「實用」和「划算」,而不只是比帳面benchmark。

TheAI學院 總結與評語

講真的,Grok 4.5 最聰明的地方不是某個 benchmark 特別高,而是它把敘事講在「省錢省 token」上——這剛好打中每天用 AI 寫程式、又要自己掏錢的那群人。用 Cursor 實戰資料訓練也是聰明棋,擺明要搶工程師的肌肉記憶。

別被「第四名」或漂亮的成本比嚇到就整組換掉;拿你手上真實的一個專案,讓它跟你現在的模型跑同一份任務,比成功率、比花掉的 token、比你要不要回頭救火,再決定。

給台灣讀者的具體建議:先在非核心的小專案上 A/B 測一週,把「解題成功率」和「總花費」兩個數字都記下來——很多時候便宜的模型多花你救 bug 的時間,省下來的錢就吐回去了。想找更多 AI 寫程式的用法,可以逛逛我們的 AI 應用情境

資料來源

  • xAI 官方 Grok 4.5 發表資訊(2026-07-08)
  • DataCamp、BenchLM、Artificial Analysis 相關整理(2026-07)

(本文依公開資訊整理、以官方公告為準;評測數據隨版本更新,實際表現請以自身測試為據。)

常見問題

Grok 4.5 比其他模型便宜多少?

官方定價為每百萬輸入 token 2 美元、輸出 6 美元,命中快取時輸入可降到 0.5 美元。整體約比 Claude Opus 4.8 或 GPT-5.5 低超過六成,加上每任務輸出 token 較少,長流程的實際花費差距更明顯。

Grok 4.5 適合拿來寫程式嗎?

它是 xAI 首個專為程式與 Agent 工作打造的模型,用真實 Cursor 開發資料訓練,SWE-Bench Pro 達 64.7%。但是否適合你的專案與技術棧,建議實際丟進程式碼庫測試後再決定。

為什麼上下文從 100 萬縮到 50 萬?

Grok 4.5 的上下文為 50 萬 token,較前代 Grok 4.3 的 100 萬有所縮減,一般視為換取效率與成本的取捨。處理超大型單體專案時要留意是否足夠。

Token 效率為什麼重要?

同一個任務,Grok 4.5 平均輸出約 15,954 token,約為 Opus 4.8 的四分之一。單次看不明顯,但團隊大量呼叫時,輸出 token 直接反映在 API 帳單上,差距會被放大。