Mistral Large 4预览版发布:代号Le Chonk

Mistral发布万亿参数模型Large 4预览版。该模型代号“Le Chonk”,拥有49亿活跃参数,性能比肩全球最强开源模型。其完全基于欧洲数据中心训练,在网络安全等领域表现卓越,预计本月底开放权重下载。

Mistral Large 4 预览版发布:代号“Le Chonk”

Mistral AI 今日正式推出其最新旗舰模型 Mistral Large 4(简称 ML4)的公开预览版。该模型被官方命名为“Le Chonk”,旨在突破人工智能在空重性能方面的前沿极限。目前,开发者可通过 Mistral Studio 试用预览 API,完整的模型权重预计将于本月底开放下载。

基于3800块NVIDIA GPU训练

核心参数与性能定位

ML4 是一款拥有 1 万亿总参数、49 亿活跃参数的原生多模态模型。作为 Mistral 迄今为止规模最大、能力最强的产品,其在编码、代理工作流及多模态理解方面表现卓越。

数据显示,ML4 的性能已与全球最强大的开源模型持平,并显著超越美国或欧洲开发的其他开源模型。在网络安全、金融和法律等关键企业级负载上,它被视为当前最先进的开放模型。值得注意的是,在视觉接地(Visual Grounding)等领域,其表现甚至超越了部分闭源模型。

欧洲制造与 AI 主权

ML4 完全基于 Mistral 位于欧洲的数据中心训练而成,使用了 3,800 块 NVIDIA Grace Blackwell GPU,从零开始构建。公开预览版也部署在同一基础设施上。这一里程碑体现了 Mistral 在基础设施、研发及产品层面的长期投入,旨在通过开放权重交付,让客户掌握 AI 自主权。

这种架构对于网络安全领域尤为重要。传统供应商层面的拒绝服务可能阻碍合法的漏洞研究和事件响应,而在危机时刻失去对模型的访问权限本身即构成安全风险。ML4 结合顶级网络性能、开放权重和自动部署能力,使组织能够在自身政策框架下独立执行高级安全任务。

该模型将在全球多个地区提供服务,其中包括受欧洲法律监管且独立于其他数字服务提供商运营的欧洲部署。此外,ML4 的训练数据涵盖 160 多种语言,包括欧盟所有官方语言,具有高度的多语言特性。

垂直领域深度解析

网络安全

ML4 是目前世界上最强大的网络安全 AI 模型之一。在人工分析网络指数(AI Cyber Index)中,该模型在全球排名前五,并在非中国开发的开放权重模型中以巨大优势领先。具体测试显示,ML4 能够复现开源软件中的真实漏洞,并在包含 40 个竞赛提取练习的 Cybench 基准测试中解决了 93% 的挑战,创下开放权重模型的最高分之一。

相比之下,Claude Opus 5.5 和 GPT-6 Astra 等封闭模型在相同测试中得分接近零,原因在于其安全过滤器拒绝执行此类任务。防御软件往往始于证明漏洞的真实性,而 ML4 克服了这一限制。内部测试表明,它在恶意软件分析、漏洞优先级排序及检测规则编写方面具备实际效用,支持私有云或本地部署以满足审计需求。

代理编码

在软件工程、代码库理解和复杂终端工作流方面,ML4 表现出色。其在 DeepSWE v1.1 上的得分为 61.7%,在 SWE-Atlas-QnA 上为 59.4%,在 Terminal Bench 4 上为 28.3%。综合编码代理指数得分为 49.8%,领先于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。

根据 Surge AI 进行的盲测评估,专业注释者对五款模型输出进行打分,ML4 预览版以 3.74 分排名第二,仅次于 Claude Opus 5(4.22 分),但领先于 Kimi K3(3.59)、GLM-5.3(3.60)和 GLM-5.2(3.40)。

通用代理工作流

ML4 能够运行通用代理程序,执行信息收集、工具使用及复杂工作流的成品生成。在 AutomationBench 基准测试中,针对 Gmail、Google Sheets、Slack 和 Salesforce 等应用中的 657 个业务工作流,ML4 获得了 59.9% 的成绩,领先于 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。

在知识工作产出方面,如电子表格、幻灯片和 PDF 生成,ML4 在 AA-Briefcase 长周期知识工作基准测试中达到 1,393 Elo 评分,优于 DeepSeek V4 Pro。

多模态能力

ML4 在多模态图像理解方面实现了质的飞跃,能够对复杂文档、图表和自然图像进行强力推理,适用于工程、制造和地球观测等行业。

该模型将视觉接地与代理能力相结合,例如从千兆像素卫星图像中协助灾难应对团队行动,或对工程图纸进行放大、检查和验证。演示显示,ML4 能处理密集自然场景、检查技术图纸中的机械部件、从 PDF 中提取证据以及扫描大规模地理空间图像。

在视觉接地测试中,ML4 在 Dense 200 数据集上的表现超过 GPT-6-Astra(42% 对比 41%),成为测试中最具能力的模型之一。

科学与数学

结合 Mistral 研究人员在数学、物理和化学领域的专业知识,ML4 擅长数据分析、建模及模拟物理现实等科学任务。在 SciCode-Verified 基准测试中,它是开放权重模型中最先进的技术代表。

在实际应用中,ML4 可一次性生成复杂的 Hartree-Fock 模拟——这是一项由一系列先进程序构建的多步骤化学任务。在形式化推理和应用数学方面,内部人类评估显示,ML4 比 GLM-5.3 提供更精确、结构更清晰的推理,并能维持长期的特定领域应用数学任务,包括涉及前沿理论物理的工作。

SciCode-Verified 测试模型在代码中实现复杂科学工作流程的能力。

根据 GLM-5.3 对 ML4 在 STEM 任务(数学和物理)的内部评估。

知识工作与安全性

针对专业人士的日常任务,ML4 能够创建、编辑和修复复杂的电子表格及文档。经第三方评估机构 vals.ai 测试,在法律和财务代表性任务上,ML4 的表现均超过 GPT-6-Astra。在 Harvey AI 的法律代理基准中,ML4 优于所有开源模型。

在 FinWorkBench 测试中,ML4 展示了处理多步企业财务挑战的能力,包括通过 EDGAR 及同等欧洲数据库搜索公开公司文件和财务报告。动画语义地图追踪显示,与其他顶级开源模型相比,ML4 在证据收集、计算结果和问题解决路径上表现出更高的效率。

模型安全性

ML4 在间接提示注入强度基准测试中处于开源模型前沿,对比对象包括 GLM-5.2、GLM-5.3、Kimi-K2.6、Kimi-K3 和 DS-V4-Pro-0813。在 Lakera 的公开 B3AI 安全基准中,ML4 抵御了 93.3% 的攻击,未发现有竞争对手得分更高。

在用户交互责任性方面,ML4 在 KORA Benchmark 上取得了开源模型最高分 1.691(满分 2,代表“卓越”)。尽管其在网络安全基准上表现强劲,但在 JailbreakBench、StrongREJECT 和 AgentHarm 测试中,ML4 对恶意网络请求的平均拒绝率高于所有其他开源模型。

人类偏好评估

内部专家评估比较了 Mistral Large 4 与 GLM-5.3。结果显示,在 CAD 和 STEM 领域,专家更偏爱 ML4;而在财务和编码方面,两者表现相当或接近。

规模化强化学习训练

Mistral 采用强化学习(RL)技术以适应模型能力的快速迭代。随着模型增强,训练任务的难度和范围也随之增加。其 RL 库设计便于添加新环境,共享接口允许单次训练运行整合从单轮聊天到复杂科学问题解决、安全对齐及长期工具使用的任务。这些环境共享代码沙箱、网络搜索和外部 API 等资源。

运行时,自动扩展的 Actor 机队并行生成数万个轨迹,同时异步进行模型训练。管道优化支持数百万代币的长轨迹预算,并通过两阶段新方法最小化策略偏离,实现稳定的长期 RL。在当前规模(3k GPU)下,一次训练运行每天生产约 33 亿个代币。训练奖励在几个代表性环境中随时间增加,表明模型正在学习解决日益复杂的任务。

改进并非局限于训练环境,而是转移至下游评估,归功于监督微调和 RL 两个后期训练阶段。

未来规划

ML4 是 Mistral 路线图中的首个里程碑,得益于其 30 亿欧元的 D 轮融资——这是欧洲科技公司迄今最大的一轮股权融资。资金已用于大幅扩大欧洲数据中心的计算能力,更多数据将在未来几个月投入使用。

随着基础设施规模的扩大,预计未来几周和几个月内模型性能将有显著提升。月底前将公布完整权重、更多架构细节及额外基准测试结果。ML4 也将成为新一代专用和优化 Mistral 模型的基础。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读