Grok 4.5 用 Cursor 实战数据练出来:便宜、省 token,专打真实写程式

xAI 的 Grok 4.5 主打一件事:在真实程式码库里撑完长流程。用 Cursor 开发者实战资料训练、每任务吐的 token 只有 Opus 4.8 的四分之一,价格还低六成——这回它想抢的是工程师的日常。

一个很不起眼的数字,反而最能说明 Grok 4.5 想干嘛:平均一个任务,它只吐 15,954 个输出 token,大约是 Claude Opus 4.8 的四分之一。

对天天用 AI 写程式、又要自己付 API 帐单的人来说,这句话翻译过来就是:同样一件事,钱包比较不痛。xAI 在 7 月 8 日推出的 Grok 4.5,把「便宜」和「省 token」放在最显眼的位置,而且它的训练方式,摆明是冲着真实开发场景来的。

事件背景

Grok 4.5 是 xAI 第一个专为程式与 Agent 工作打造的模型。最特别的是训练素材——它用了真实的 Cursor 开发者操作资料,以及一批专门衡量「AI 在真实程式码库里、跨一段长流程能做到什么」的评测。这跟过去那种刷单题、刷选择题的路线不太一样:重点不是短问答漂不漂亮,而是能不能在一个真的专案里撑完一整段任务。

本次重点

  • 定价很敢:每百万输入 token 2 美元、输出 6 美元;若命中快取,输入还打到 0.5 美元(七五折)。整体价格比 Opus 4.8 或 GPT-5.5 低超过六成。
  • 实战型评测成绩:SWE-Bench Pro 解题率 64.7%、Terminal-Bench 2.1 拿到 83.3%,都是偏「真实工程」的题组。
  • 排名位置:在 Artificial Analysis 的智慧指数上排到第四,赢过所有开放权重模型,也高于所有 Gemini 系列。
  • Token 效率是卖点:平均每任务约 15,954 输出 token,约为 Opus 4.8(最高设定)67,020 的 4.2 分之一——长流程跑下来,成本差距会被放大。
  • 上下文缩到 50 万:相较前代 Grok 4.3 的 100 万 token 有所缩减,算是为了效率和成本做的取舍。

市场影响分析

对台湾使用者:如果你已经在用 Cursor、ClineWindsurf 这类工具,多一个又便宜又省 token 的模型选项,实测后很可能直接省下一笔订阅或 API 费用。尤其接案族、独立开发者,对每一块钱的敏感度更高。

对企业:token 效率在小规模看不太出来,但一旦是整个团队、每天大量呼叫,4 倍的输出 token 差距换算成月帐单就很有感。对要把 AI 编程大规模铺进工程团队的公司,这是采购时该认真算的一笔帐。

对开发者:用真实 Cursor 资料训练,理论上更贴近日常操作手感;但「贴近某一种工具的资料」也可能带来风格偏好。它到底适不适合你的技术栈,还是得丢进自己的专案跑过才知道。上下文从 100 万砍到 50 万,处理超大型单体专案时要留意会不会不够用。

未来发展趋势

2026 上半年,程式模型的竞争主轴明显从「刷榜分数」转向「真实工程能力 + 每任务成本」。GPT-5.6、Claude Sonnet 5、Grok 4.5 几乎都在讲同一件事:不是谁答得漂亮,而是谁能在真实工作流里又稳又省。这对使用者是好消息——大家开始比「实用」和「划算」,而不只是比帐面benchmark。

TheAI学院 总结与评语

讲真的,Grok 4.5 最聪明的地方不是某个 benchmark 特别高,而是它把叙事讲在「省钱省 token」上——这刚好打中每天用 AI 写程式、又要自己掏钱的那群人。用 Cursor 实战资料训练也是聪明棋,摆明要抢工程师的肌肉记忆。

别被「第四名」或漂亮的成本比吓到就整组换掉;拿你手上真实的一个专案,让它跟你现在的模型跑同一份任务,比成功率、比花掉的 token、比你要不要回头救火,再决定。

给台湾读者的具体建议:先在非核心的小专案上 A/B 测一周,把「解题成功率」和「总花费」两个数字都记下来——很多时候便宜的模型多花你救 bug 的时间,省下来的钱就吐回去了。想找更多 AI 写程式的用法,可以逛逛我们的 AI 应用情境

资料来源

  • xAI 官方 Grok 4.5 发表资讯(2026-07-08)
  • DataCamp、BenchLM、Artificial Analysis 相关整理(2026-07)

(本文依公开资讯整理、以官方公告为准;评测数据随版本更新,实际表现请以自身测试为据。)

常见问题

Grok 4.5 比其他模型便宜多少?

官方定价为每百万输入 token 2 美元、输出 6 美元,命中快取时输入可降到 0.5 美元。整体约比 Claude Opus 4.8 或 GPT-5.5 低超过六成,加上每任务输出 token 较少,长流程的实际花费差距更明显。

Grok 4.5 适合拿来写程式吗?

它是 xAI 首个专为程式与 Agent 工作打造的模型,用真实 Cursor 开发资料训练,SWE-Bench Pro 达 64.7%。但是否适合你的专案与技术栈,建议实际丢进程式码库测试后再决定。

为什么上下文从 100 万缩到 50 万?

Grok 4.5 的上下文为 50 万 token,较前代 Grok 4.3 的 100 万有所缩减,一般视为换取效率与成本的取舍。处理超大型单体专案时要留意是否足够。

Token 效率为什么重要?

同一个任务,Grok 4.5 平均输出约 15,954 token,约为 Opus 4.8 的四分之一。单次看不明显,但团队大量呼叫时,输出 token 直接反映在 API 帐单上,差距会被放大。

繁體中文版 →