xAI发布Grok 4.7:长时编码性能提升,价格持平

xAI发布Grok 4.7,聚焦长时编码与知识工作。新模型延长强化学习训练,提升复杂任务处理及自我检查能力。其价格与速度持平上一代,在CursorBench等基准测试中展现高性价比优势。

xAI 发布 Grok 4.7:聚焦长时编码与知识工作,性能提升但价格持平

xAI 正式推出 Grok 4.7 模型。该版本被定位为最适合编码及复杂知识工作的模型,具备在困难任务上持续更长时间运行并自我检查的能力。值得注意的是,Grok 4.7 保持了与上一代 Grok 4.6 相同的价格和速度,在其所属类别中具有较强的竞争力。

Grok 4.7 CursorBench得分46.3%

数据显示,在强调长时编码任务的 CursorBench 4.0 基准测试中,Grok 4.7 在性价比方面处于行业前沿。

技术改进与基准表现

相比 Grok 4.6,Grok 4.7 采用了新的、规模更大的基础模型。通过延长强化学习训练周期,该模型能够处理更复杂的任务组合,并优化了工作验证机制及长上下文管理能力。此外,Grok 4.7 还经过专门训练,以原生方式理解 Grok Bot 的指令集。

指标Grok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
输入 Token 价格 ($/百万)$2$2$4$10
输出 Token 价格 ($/百万)$6$6$20$50
软件工程 (CursorBench 4.0)46.3%40.4%41.7%51.8%
软件工程 (DeepSWE v1.1)71.0%*65.2%72.7%70.0%
电气工程 (EEBench)64.0%53.0%39.4%56.4%
多小时办公工作 (AA Briefcase v1.1)1,6571,5461,4871,678
多小时终端操作 (Terminal-Bench 4.0)38.0%20.3%37.3%57.9%
法律工作 (Harvey Legal Agent Benchmark)19.6%15.8%2.5%6.7%
临床推理 (HealthBench Professional)56.7%48.5%60.5%62.1%

* 高努力模式得分

图注:Grok 4.7、Grok 4.6、GPT-5.6 Sol 及 Fable 5.1 的 Token 价格与基准分数对比。涉及基准包括 CursorBench 4.0、DeepSWE v1.1、EEBench、AA Briefcase v1.1、Terminal-Bench 4.0、Harvey Legal Agent Benchmark 和 HealthBench Professional。

在文档创建和演示文稿生成方面,Grok 4.7 也有显著提升。在 GDPval 和 AA 简历基准测试中,模型需处理律师、护士和金融分析师等专业人士的典型任务。结果显示,Grok 4.7 在这两项指标上均优于 Grok 4.6,并与其它前沿模型保持相当的性能水平。

专业知识工作

GDPval

图注:GDPval、AA 公文包和 EEBench 分数比较,涵盖 Grok 4.7 与 Grok 4.6、Fable 5.1 及 GPT-6 Astra。

安全架构与网络安全能力

Grok 4.7 基于全新的安全堆栈构建,据称是该公司测试过的在拒绝服务和越狱抵抗方面最强的模型。在生物工作和网络安全等双重用途领域,该模型在保持良性任务实用性的同时,对危险任务实现了安全拒绝,其在 LatchBio 生物安全基准上的领先幅度达到 62.4%。

针对合法应用场景,Grok 4.7 展现出强大的网络防御能力且误拒率较低。在衡量风险与恶意网络任务的 HackerBench v0.3 基准上,其安全性最高,仅允许 3.3% 的风险双重用途提示通过,同时极少阻碍合法的安全研究工作。目前,xAI 已开始向特定的网络安全合作伙伴提供 Grok 4.7 的红队防御研究能力。

定价与可用性

Grok 4.7 现已在 Cursor 和 Grok Build 版本中上线,用户也可通过 Grok API、第三方编码套件以及模型路由器和云平台获取该模型。

定价策略维持不变:每百万输入 Token 收费 2 美元,每百万输出 Token 收费 6 美元。此外,官方还提供一种快速变种,输出速度为两倍,相应地价格也为两倍。

  • Console:支持创建 API 密钥
  • 免费试用:今日可在 x.ai/build 开始使用 Grok Build

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读