Mistral发布万亿参数模型Large 4预览版

法国Mistral发布万亿参数模型Large 4预览版。其智能指数38分,虽低于多款中国开源模型,但在网络安全测试中创个人最佳成绩,权重预计本月底开放。

法国 AI 公司 Mistral 本周发布了其万亿参数模型 Large 4 (ML4) 的研究预览版,宣称该模型“推动了开放权重性能的前沿”。独立基准测试机构 Artificial Analysis (AA) 将 ML4 列为美国以外表现最佳的模型之一。尽管在 AA 的综合智能指数中,部分中国开源模型得分更高,但 ML4 在端到端网络安全测试 CyberGym-E2E-AA 中取得了个人最佳成绩。

ML4在CyberGym测试得81.7%

智能指数与主要竞品对比

在 AA 智能指数 v4.3.2 版本中,Mistral Large 4 获得 38 分。这一得分使其成为美国和中国以外的最智能模型,领先于韩国和阿联酋等国家的同类模型。该分数与 OpenAI 的 GPT-6 Luna(最高 38 分)持平,略低于 DeepSeek V4.1 Flash(最高 39 分)。

然而,若放眼全球,至少有五款中国开源模型在综合指数上超越了 ML4:

  • MiMo-V2.6-Pro:46 分
  • Z.ai GLM-5.3 (Max):45 分
  • Kimi K3 (Max):44 分
  • Z.ai GLM-5.3-Flash:42 分
  • DeepSeek V4.1 Flash (Max):39 分

值得注意的是,GLM-5.3-Flash 的总参数量约为 320B(激活参数 18B),远小于 ML4 的 1.05T 总参数(激活参数 49B–52B)。目前 ML4 尚未完全开源,Mistral 表示其权重将于本月底发布。

Model Index Score Parameters (Total/Active) Cost per Index Task Weights Status
Xiaomi MiMo-V2.6-Pro 46 1.0T / 42B $0.13 Open
Z.ai GLM-5.3 (Max) 45 753B / 40B $2.01 Open
Moonshot Kimi K3 (Max) 44 2.8T / 104B $2.00 Open
Z.ai GLM-5.3-Flash 42 320B / 18B $0.25 Open
DeepSeek V4.1 Flash (Max) 39 552B / 16B $0.27 Open
Mistral Large 4 Preview 38 1.05T / 49B–52B $1.13 ($0.57 launch price) Due by end of Oct
DeepSeek V4 Pro 0813 (Max) 36 1.6T / 49B $0.67 Open

成本与效率分析

价格是 ML4 面临的主要挑战之一。根据 AA 数据,运行每个智能指数任务的成本为 1.13 美元,即便在前两周提供 50% 启动折扣后降至 0.57 美元,仍显著高于竞争对手。相比之下,MiMo-V2.6-Pro 的单任务成本仅为 0.13 美元,GLM-5.3-Flash 为 0.25 美元,DeepSeek V4.1 Flash 为 0.27 美元。

高成本部分源于推理需求:AA 指出,运行其指数需要约 2 亿个输出代币,而行业中位数仅为 8100 万。在速度方面,ML4 每秒生成 116.1 个代币,首代币延迟为 1.46 秒,比同层级模型快约 33%,首代币响应速度快 2.6 倍。AA 的速度测试通过 Mistral 官方 API 进行,据称该 API 运行在与训练模型相同的硬件上。

定价细节如下:每百万输入/输出代币分别为 1.36 美元/4.18 美元;每百万缓存输入代币为 0.14 美元。前两周享受 50% 折扣,即 0.68 美元/2.09 美元。

网络安全能力突出

尽管综合智能得分并非顶尖,ML4 在特定领域表现强劲。在 AA 网络指数中,ML4 得分为 50%,与 GLM-5.3-Flash 持平,落后于 MiMo-V2.6-Pro (56%)。但在具体的端到端测试 CyberGym-E2E-AA 中,ML4 以 81.7% 的成绩位列第一,超过了 MiMo-V2.6-Pro (79%)、GPT-6 Luna (78%) 以及 GLM-5.3-Flash (74%)。

AA 预测,一旦权重公开,ML4 将跻身网络指数前三名开源权重模型之列。不过,在其他两项网络安全测试中,ML4 表现一般:DeepsecBench-AA 得分为 16%,CWE-Bench-AA 得分为 51%。

Mistral 声称,ML4 在“网络安全、金融和法律”等企业工作负载上是“最先进的开放模型”。该公司还指出,像 Claude Opus 5.5 和 GPT-6 Astra 这样的前沿封闭模型在同一测试中的得分接近于零。

Model Cyber Index CWE-Bench-AA DeepsecBench-AA CyberGym E2E-AA
Grok 4.7 (x High) 56 68% 27% 74%
Xiaomi MiMo-V2.6-Pro 56 63% 26% 79%
OpenAI GPT-6 Luna (Max) 53 57% 24% 78%
Z.ai GLM-5.3-Flash 50 56% 20% 74%
Mistral Large 4 Preview 50 51% 16% 82%
OpenAI GPT-6 Astra (Max; refused some tasks) 33 63% 37% 0%
Anthropic Claude Opus 5.5 (Max; refused some tasks) 29 58% 27% 1%

多模态与其他基准

在文档和图像推理方面,ML4 在 GDP.pdf 测试中获得 19% 的分数,与 MiMo-V2.6-Pro 持平,但低于 Kimi K3 (22%)。相比上一代 Mistral Large 3,这一成绩提升了 18 个百分点。改进部分归功于 API 升级,现在每次请求可接收 100 张图像,而旧型号仅支持 8 张。ML4 拥有 1.6B 参数的视觉编码器,Mistral 称其在视觉接地方面甚至能超越一些封闭边界模型。

其他关键数据包括:DeepSWE v1.1 得分 61.7%,Coding Agent Index 得分 49.8%,AutomationBench 得分 59.9%,Dense 200 得分 42%,Terminal Board 4.0 得分 27%。在编码代理指数上,ML4 优于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。

技术规格与基础设施

ML4 采用混合专家架构,上下文窗口为 512k 代币,支持文本和图像输入及文本输出。Mistral 首席执行官 Arthur Mensch 透露,该模型完全从零开始训练,使用了位于欧洲自有数据中心内的 3,800 块 NVIDIA Grace Blackwell GPU。这一规模超过去年发布的 Large 3 模型(使用 3,000 块 Nvidia H200,总参数 675B,激活参数 41B)。训练过程持续了大约两个月。

作为 Mistral Compute 计划的一部分,公司已筹集巨额资金,并计划购买 18,000 个 Grace Blackwell 芯片。一旦权重发布,用户可在私有云或本地环境中运行该模型。

目前,由于权重尚未公开,AA 将 ML4 预览版标记为专有模型。随着权重的最终发布,评分可能会重新调整。Mistral 表示,完整的架构细节和额外基准测试结果预计将在 10 月底前公布。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读