xAI 发布 Grok 4.7:聚焦长时编码与知识工作,性能提升但价格持平
xAI 正式推出 Grok 4.7 模型。该版本被定位为最适合编码及复杂知识工作的模型,具备在困难任务上持续更长时间运行并自我检查的能力。值得注意的是,Grok 4.7 保持了与上一代 Grok 4.6 相同的价格和速度,在其所属类别中具有较强的竞争力。

数据显示,在强调长时编码任务的 CursorBench 4.0 基准测试中,Grok 4.7 在性价比方面处于行业前沿。
技术改进与基准表现
相比 Grok 4.6,Grok 4.7 采用了新的、规模更大的基础模型。通过延长强化学习训练周期,该模型能够处理更复杂的任务组合,并优化了工作验证机制及长上下文管理能力。此外,Grok 4.7 还经过专门训练,以原生方式理解 Grok Bot 的指令集。
| 指标 | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| 输入 Token 价格 ($/百万) | $2 | $2 | $4 | $10 |
| 输出 Token 价格 ($/百万) | $6 | $6 | $20 | $50 |
| 软件工程 (CursorBench 4.0) | 46.3% | 40.4% | 41.7% | 51.8% |
| 软件工程 (DeepSWE v1.1) | 71.0%* | 65.2% | 72.7% | 70.0% |
| 电气工程 (EEBench) | 64.0% | 53.0% | 39.4% | 56.4% |
| 多小时办公工作 (AA Briefcase v1.1) | 1,657 | 1,546 | 1,487 | 1,678 |
| 多小时终端操作 (Terminal-Bench 4.0) | 38.0% | 20.3% | 37.3% | 57.9% |
| 法律工作 (Harvey Legal Agent Benchmark) | 19.6% | 15.8% | 2.5% | 6.7% |
| 临床推理 (HealthBench Professional) | 56.7% | 48.5% | 60.5% | 62.1% |
* 高努力模式得分
在文档创建和演示文稿生成方面,Grok 4.7 也有显著提升。在 GDPval 和 AA 简历基准测试中,模型需处理律师、护士和金融分析师等专业人士的典型任务。结果显示,Grok 4.7 在这两项指标上均优于 Grok 4.6,并与其它前沿模型保持相当的性能水平。
专业知识工作
GDPval
安全架构与网络安全能力
Grok 4.7 基于全新的安全堆栈构建,据称是该公司测试过的在拒绝服务和越狱抵抗方面最强的模型。在生物工作和网络安全等双重用途领域,该模型在保持良性任务实用性的同时,对危险任务实现了安全拒绝,其在 LatchBio 生物安全基准上的领先幅度达到 62.4%。
针对合法应用场景,Grok 4.7 展现出强大的网络防御能力且误拒率较低。在衡量风险与恶意网络任务的 HackerBench v0.3 基准上,其安全性最高,仅允许 3.3% 的风险双重用途提示通过,同时极少阻碍合法的安全研究工作。目前,xAI 已开始向特定的网络安全合作伙伴提供 Grok 4.7 的红队防御研究能力。
定价与可用性
Grok 4.7 现已在 Cursor 和 Grok Build 版本中上线,用户也可通过 Grok API、第三方编码套件以及模型路由器和云平台获取该模型。
定价策略维持不变:每百万输入 Token 收费 2 美元,每百万输出 Token 收费 6 美元。此外,官方还提供一种快速变种,输出速度为两倍,相应地价格也为两倍。
- Console:支持创建 API 密钥
- 免费试用:今日可在 x.ai/build 开始使用 Grok Build





