一个周末,AI编程工具的格局变了
7月8日晚上,马斯克在X上丢了一句话:
「Based on strong positive feedback from customers in our beta test program, @SpaceXAI will make Grok 4.5 available to the public tomorrow. It is an Opus-class model, but faster, more token-efficient and lower cost.」
这条推文背后,是SpaceXAI(原xAI,2月被SpaceX收购后更名)与Cursor联合训练的第一个模型——Grok 4.5。就在同一天,Cursor官方博客确认模型已在IDE中上线。而第二天(7月9日),OpenAI的GPT-5.6 Sol也正式公开发布。
对于海外华人开发者来说,这是2026年迄今最值得关注的一天:两个顶级编程AI同日开战,而且两个都能在海外直接用。
- Grok 4.5是什么?与Cursor的关系
- 性能实测:与GPT-5.6、Claude Fable 5跑分对比
- 价格对比:为什么说Grok 4.5「便宜到不像Opus级」
- 海外华人怎么用?接入方式与限制一览
- 该选Grok 4.5还是GPT-5.6?三步决策法
- 总结:7月AI编程工具格局已经变了
Grok 4.5是什么?与Cursor的关系
Grok 4.5不是简单的Grok 4.x升级。这是一个1.5万亿参数的MoE(混合专家)模型,由SpaceXAI和Cursor联合训练完成。
关键背景:
- 训练基础设施:在Memphis的Colossus集群(22万+块NVIDIA GPU)上完成训练,其中包括数万块最新的GB300 GPU
- 训练数据:除了常规代码语料,还融入了数万亿条Cursor用户与代码库的真实交互数据——这意味着模型学的不是静态代码,而是开发者怎么改bug、怎么跨仓库搜索、怎么多步编辑的真实行为
- 强化学习:覆盖数十万个任务,重点是多步软件工程和技术工作,采用自动化评分和模型评分
- Cursor收购:6月16日SpaceX宣布以600亿美元全股票交易收购Cursor(Anysphere),Grok 4.5是这个整合战略的第一个产出
马斯克把它称为「Opus级模型」——对标Anthropic的Claude Opus 4.8,这意味着它不只是写代码的工具,还具备复杂推理、知识分析和Agent级任务执行能力。
实际测试中,Grok 4.5确实不止于编程:它能构建包含多工作表公式的Excel模型、在PowerPoint中绘制图表、在Word中撰写长文、甚至根据简单提示直接构建端到端的功能应用。在Rust和C/C++等挑战性语言中也有不错的表现。
性能实测:与GPT-5.6、Claude Fable 5跑分对比
根据Artificial Analysis和Cursor官方公布的数据,Grok 4.5在多项基准测试中的表现如下:
| 基准测试 | Grok 4.5 | GPT-5.5 (xhigh) | Claude Opus 4.8 | Claude Fable 5 |
|---|---|---|---|---|
| Intelligence Index (GDPval-AA v2) | 54分(Elo 1543) | — | 69.2(Elo 1600) | 最高 |
| Terminal-Bench 2.1 | 83.3% | 83.4% | 78.9% | 84.3% |
| SWE-Bench Pro | 64.7% (high) | 58.6% | 69.2% (max) | 80.3% (max) |
| DeepSWE 1.0 | 62.0% (high) | 64.3% | 55.8% | 66.1% |
| SWE-Bench 多语言 | 78.0% | 77.8% | 84.4% | — |
| Coding Agent Index | 76分 | 76分 | — | 最高 |
几个值得注意的点:
- Terminal-Bench 2.1:Grok 4.5拿到83.3%,和GPT-5.5几乎并列,大幅超过Opus 4.8的78.9%。这个测试衡量的是模型在终端环境下的Agent级操作能力——不只是写代码,而是自己开终端、读文档、跑命令、修bug
- SWE-Bench Pro:64.7%虽然不算最高,但考虑到这是「high」档(使用较少推理token),性价比极高。Fable 5的80.3%是「max」档——消耗了4倍以上的token才达到
- SWE-Bench多语言:78.0%超过GPT-5.5,对海外华人开发者尤其有意义——中英混合代码库是我们的日常
- Agent级知识工作:在τ³-Banking测试中,Grok 4.5得分33%,甚至超过了GPT-5.5的31%
一句话总结:Grok 4.5不是最强的,但在速度+成本+能力的平衡点上,它是目前最锋利的刀。
价格对比:为什么说Grok 4.5「便宜到不像Opus级」
Grok 4.5的定价策略非常明确:用一半的价格提供同级能力。
| 模型 | 输入价格 ($/M tokens) | 输出价格 ($/M tokens) | 每任务平均成本 | 每任务Token消耗 |
|---|---|---|---|---|
| Grok 4.5 | $2 | $6 | $2.49 | 1.9M |
| GPT-5.5 (Codex) | — | — | $5.07 | 6.2M |
| Claude Fable 5 (Claude Code) | — | — | $11.80 | 7.2M |
| Claude Opus 4.8 | — | — | 更高 | 更多 |
数字已经很清楚了:
- Grok 4.5每个编码任务平均只消耗1.9M tokens,而Fable 5消耗7.2M、GPT-5.5消耗6.2M——前者用不到后者的三分之一
- 每任务成本$2.49,是Fable 5的五分之一,GPT-5.5的一半
- 输出速度80 TPS(每秒80个token),任务步骤数减半
- 缓存命中还有75%折扣($0.5/M input tokens)
对海外华人开发者来说,这意味着:同样的预算,Grok 4.5能跑5倍的任务。如果你是个人开发者或小团队,这差距够让你从「舍不得用」变成「随便用」。
海外华人怎么用?接入方式与限制一览
好消息是Grok 4.5在海外可以直接使用,不像某些中国AI工具需要翻墙,也不像6月断供的Claude Fable 5需要等出口管制解除。
目前接入方式:
| 接入方式 | 可用性 | 说明 |
|---|---|---|
| Cursor IDE | ✅ 已上线(7月8日) | 桌面端、Web端、iOS端、CLI、SDK均可用;首周双倍用量 |
| Grok Build | ✅ 已上线 | SpaceXAI官方Agent平台,含免费用量 |
| SpaceXAI API控制台 | ✅ 已上线 | API调用,定价$2/$6 |
| xAI CLI | ✅ 免费开始 | x.ai/cli 可免费试用 |
| 欧盟地区 | ❌ 暂不可用 | 预计7月中旬开放 |
⚠️ 重要限制:Grok 4.5目前尚未在欧盟地区开放(包括在SpaceXAI产品和API控制台)。如果你在英国、德国、法国等欧盟国家,需要等到7月中旬。美国、加拿大、澳大利亚、日本、韩国等地不受限制。
Cursor首周提供了双倍用量的优惠,对所有订阅等级(Free/Pro/Business)有效。如果你还没用过Cursor,现在是最好的时机——SpaceX收购Cursor后,这个编程IDE正在变成马斯克AI帝国的核心。
海外华人特别关注:上下文窗口
Grok 4.5的上下文窗口是500K tokens——比Grok 4.3的1M有所缩减,但保留了可配置推理和视觉输入。500K对于大多数编码任务已经足够(约25万字的代码+文档),但如果你需要处理超长代码库,GPT-5.6 Sol可能更适合。
该选Grok 4.5还是GPT-5.6?三步决策法
7月9日同时发布的还有OpenAI的GPT-5.6 Sol(加上Terra和Luna两个辅助模型)。作为海外华人开发者,你怎么选?
我的建议是三步决策法:
第一步:看你的主要任务类型
| 场景 | 推荐 | 理由 |
|---|---|---|
| 日常编码(中小项目) | Grok 4.5 | 便宜、快、token效率高,80 TPS输出 |
| 大型代码库重构(>500K上下文) | GPT-5.6 Sol | 更长的上下文窗口,更强的全局理解 |
| Agent级自动化(跨工具协作) | Grok 4.5 | Terminal-Bench 83.3%+成本低=可频繁调用 |
| 多语言项目(中英混合) | Grok 4.5 | SWE-Bench多语言78%表现突出 |
| Excel/PPT/Word办公任务 | Grok 4.5 | 官方展示了Office场景能力 |
第二步:看你的预算
如果你是个人开发者或自由职业者,每月AI工具预算在$20-50之间:Grok 4.5是唯一能让你「不限量用」的Opus级模型。$2/$6的定价意味着1万条输入token只花2美分。
如果你是企业团队,预算不敏感:GPT-5.6 Sol+Codex的组合在Terminal-Bench上确实更强(约91.9%),适合对代码质量有极致要求的场景。
第三步:看你的工具链
如果你已经在用Cursor:Grok 4.5直接内置,零切换成本。Cursor同时保留了Composer 2.5,两个模型按不同需求选用。
如果你在用ChatGPT/Codex:GPT-5.6 Sol自然是更顺滑的延续。但别忘了Claude Code和Kimi Code也在进化。
我的实际建议:先在Cursor里试一周Grok 4.5(首周双倍用量是免费体验的最佳窗口),然后再决定是否长期切换。
总结:7月AI编程工具格局已经变了
6月份,海外华人还在为Claude Fable 5断供和GPT-5.6限制而焦虑。到了7月9日,格局已经完全不同:
- Grok 4.5:Opus级能力,价格是同级模型的1/5到1/2,Cursor直接内置
- GPT-5.6 Sol:OpenAI旗舰发布,Terminal-Bench ~91.9%,但成本更高
- Claude Fable 5:出口管制已解除,7月起逐步恢复访问(详见6月断供回顾)
- Kimi K3:本月确认发布,中国模型的新变量
海外华人开发者第一次有了三个Opus级编程AI同时可选的局面。价格战已经打响,能力还在快速迭代。
我的行动建议:
- 今天就去Cursor试Grok 4.5——首周双倍用量,不试白不试
- 关注GPT-5.6 Sol的API定价——如果和Grok 4.5差距不大,可以两个都保留
- 不要急着锁定单一模型——2026年的AI工具市场,每月都有新模型发布,灵活切换才是正道
本文发布于2026年7月9日,数据来源为SpaceXAI官方发布、Cursor博客、Artificial Analysis评测及IT之家报道。模型性能数据会随后续更新变化,建议关注AI工具派获取最新评测。
相关阅读:SpaceX 600亿收购Cursor!马斯克All in AI编程 | GPT-5.6发布深度解读:海外华人可用性 | 2026年AI编程工具完整横评