法国 AI 公司 Mistral 本周发布了其万亿参数模型 Large 4 (ML4) 的研究预览版,宣称该模型“推动了开放权重性能的前沿”。独立基准测试机构 Artificial Analysis (AA) 将 ML4 列为美国以外表现最佳的模型之一。尽管在 AA 的综合智能指数中,部分中国开源模型得分更高,但 ML4 在端到端网络安全测试 CyberGym-E2E-AA 中取得了个人最佳成绩。

智能指数与主要竞品对比
在 AA 智能指数 v4.3.2 版本中,Mistral Large 4 获得 38 分。这一得分使其成为美国和中国以外的最智能模型,领先于韩国和阿联酋等国家的同类模型。该分数与 OpenAI 的 GPT-6 Luna(最高 38 分)持平,略低于 DeepSeek V4.1 Flash(最高 39 分)。
然而,若放眼全球,至少有五款中国开源模型在综合指数上超越了 ML4:
- MiMo-V2.6-Pro:46 分
- Z.ai GLM-5.3 (Max):45 分
- Kimi K3 (Max):44 分
- Z.ai GLM-5.3-Flash:42 分
- DeepSeek V4.1 Flash (Max):39 分
值得注意的是,GLM-5.3-Flash 的总参数量约为 320B(激活参数 18B),远小于 ML4 的 1.05T 总参数(激活参数 49B–52B)。目前 ML4 尚未完全开源,Mistral 表示其权重将于本月底发布。
| Model | Index Score | Parameters (Total/Active) | Cost per Index Task | Weights Status |
|---|---|---|---|---|
| Xiaomi MiMo-V2.6-Pro | 46 | 1.0T / 42B | $0.13 | Open |
| Z.ai GLM-5.3 (Max) | 45 | 753B / 40B | $2.01 | Open |
| Moonshot Kimi K3 (Max) | 44 | 2.8T / 104B | $2.00 | Open |
| Z.ai GLM-5.3-Flash | 42 | 320B / 18B | $0.25 | Open |
| DeepSeek V4.1 Flash (Max) | 39 | 552B / 16B | $0.27 | Open |
| Mistral Large 4 Preview | 38 | 1.05T / 49B–52B | $1.13 ($0.57 launch price) | Due by end of Oct |
| DeepSeek V4 Pro 0813 (Max) | 36 | 1.6T / 49B | $0.67 | Open |
成本与效率分析
价格是 ML4 面临的主要挑战之一。根据 AA 数据,运行每个智能指数任务的成本为 1.13 美元,即便在前两周提供 50% 启动折扣后降至 0.57 美元,仍显著高于竞争对手。相比之下,MiMo-V2.6-Pro 的单任务成本仅为 0.13 美元,GLM-5.3-Flash 为 0.25 美元,DeepSeek V4.1 Flash 为 0.27 美元。
高成本部分源于推理需求:AA 指出,运行其指数需要约 2 亿个输出代币,而行业中位数仅为 8100 万。在速度方面,ML4 每秒生成 116.1 个代币,首代币延迟为 1.46 秒,比同层级模型快约 33%,首代币响应速度快 2.6 倍。AA 的速度测试通过 Mistral 官方 API 进行,据称该 API 运行在与训练模型相同的硬件上。
定价细节如下:每百万输入/输出代币分别为 1.36 美元/4.18 美元;每百万缓存输入代币为 0.14 美元。前两周享受 50% 折扣,即 0.68 美元/2.09 美元。
网络安全能力突出
尽管综合智能得分并非顶尖,ML4 在特定领域表现强劲。在 AA 网络指数中,ML4 得分为 50%,与 GLM-5.3-Flash 持平,落后于 MiMo-V2.6-Pro (56%)。但在具体的端到端测试 CyberGym-E2E-AA 中,ML4 以 81.7% 的成绩位列第一,超过了 MiMo-V2.6-Pro (79%)、GPT-6 Luna (78%) 以及 GLM-5.3-Flash (74%)。
AA 预测,一旦权重公开,ML4 将跻身网络指数前三名开源权重模型之列。不过,在其他两项网络安全测试中,ML4 表现一般:DeepsecBench-AA 得分为 16%,CWE-Bench-AA 得分为 51%。
Mistral 声称,ML4 在“网络安全、金融和法律”等企业工作负载上是“最先进的开放模型”。该公司还指出,像 Claude Opus 5.5 和 GPT-6 Astra 这样的前沿封闭模型在同一测试中的得分接近于零。
| Model | Cyber Index | CWE-Bench-AA | DeepsecBench-AA | CyberGym E2E-AA |
|---|---|---|---|---|
| Grok 4.7 (x High) | 56 | 68% | 27% | 74% |
| Xiaomi MiMo-V2.6-Pro | 56 | 63% | 26% | 79% |
| OpenAI GPT-6 Luna (Max) | 53 | 57% | 24% | 78% |
| Z.ai GLM-5.3-Flash | 50 | 56% | 20% | 74% |
| Mistral Large 4 Preview | 50 | 51% | 16% | 82% |
| OpenAI GPT-6 Astra (Max; refused some tasks) | 33 | 63% | 37% | 0% |
| Anthropic Claude Opus 5.5 (Max; refused some tasks) | 29 | 58% | 27% | 1% |
多模态与其他基准
在文档和图像推理方面,ML4 在 GDP.pdf 测试中获得 19% 的分数,与 MiMo-V2.6-Pro 持平,但低于 Kimi K3 (22%)。相比上一代 Mistral Large 3,这一成绩提升了 18 个百分点。改进部分归功于 API 升级,现在每次请求可接收 100 张图像,而旧型号仅支持 8 张。ML4 拥有 1.6B 参数的视觉编码器,Mistral 称其在视觉接地方面甚至能超越一些封闭边界模型。
其他关键数据包括:DeepSWE v1.1 得分 61.7%,Coding Agent Index 得分 49.8%,AutomationBench 得分 59.9%,Dense 200 得分 42%,Terminal Board 4.0 得分 27%。在编码代理指数上,ML4 优于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。
技术规格与基础设施
ML4 采用混合专家架构,上下文窗口为 512k 代币,支持文本和图像输入及文本输出。Mistral 首席执行官 Arthur Mensch 透露,该模型完全从零开始训练,使用了位于欧洲自有数据中心内的 3,800 块 NVIDIA Grace Blackwell GPU。这一规模超过去年发布的 Large 3 模型(使用 3,000 块 Nvidia H200,总参数 675B,激活参数 41B)。训练过程持续了大约两个月。
作为 Mistral Compute 计划的一部分,公司已筹集巨额资金,并计划购买 18,000 个 Grace Blackwell 芯片。一旦权重发布,用户可在私有云或本地环境中运行该模型。
目前,由于权重尚未公开,AA 将 ML4 预览版标记为专有模型。随着权重的最终发布,评分可能会重新调整。Mistral 表示,完整的架构细节和额外基准测试结果预计将在 10 月底前公布。





