谷歌发布 Gemini 4 Argon:在18项基准测试中领先或持平13项
谷歌近日揭晓了其最新的前沿 AI 模型 Gemini 4 Argon。根据披露的数据,该模型在18项基准测试中有13项取得领先或与竞争对手持平的成绩,重新确立了其在部分指标上对 OpenAI 和 Anthropic 的优势。

目前,Gemini 4 Argon 仅向受信任的网络安全防御者及少数预发布测试人员开放,更广泛的可用性计划将在后续推出。
基准测试结果对比
据 VentureBeat 报道,谷歌并未宣称 Gemini 4 Argon 在所有基准测试中均获胜。但在公司发布的禁运材料所披露的基准表中,Argon 在更多类别中取得了最高分或并列最高分,表现优于 GPT-6 Astra 和 Claude Opus 5.5。
具体数据如下:
- Gemini 4 Argon:在18项基准测试中,12项独占第一,1项并列第一。
- GPT-6 Astra:3项独占第一,1项与 Argon 并列。
- Claude Opus 5.5:2项独占第一。
尽管这一结果使 Argon 成为谷歌比较集中总领先数最多的前沿模型,但数据显示竞争依然激烈。OpenAI 和 Anthropic 在若干关键技术领域仍保持优势。例如,GPT-6 Astra 在软件、科学终端和计算机使用任务方面仍然领先;而 Claude Opus 5.5 则在终端代理和后训练工作流方面占据上风。
对于企业用户而言,这意味着模型选择仍需依赖具体工作负载,尽管 Argon 为谷歌提供了迄今最有力的整体前沿领导力主张。
输出能力显著提升
Gemini 4 Argon 还大幅扩展了谷歌模型的输出上限。谷歌表示,该模型支持业界领先的 100 万输出令牌(output tokens),较此前 64,000 令牌的限制有显著提升。
这一特性对于代理式软件工程、审计、迁移和法律审查等工作负载具有重要意义。在这些场景中,模型的价值往往取决于其能在交还给人类控制之前维持多长的工作链。





