Mistral发布万亿参数开放模型Large 4

Mistral发布万亿参数开放模型Large 4。该模型采用MoE架构,运行时仅激活约49亿参数,可在8路高端GPU集群部署。作为欧洲主权AI成果,其性能在非中国开源模型中领先,预计一个月内开放下载。

欧洲人工智能公司 Mistral 近日宣布推出其迄今规模最大的开放权重模型——Mistral Large 4。该模型拥有 1 万亿参数,因其庞大的体量被内部戏称为“Le Chonk”。尽管名称颇具趣味,但这一发布标志着法国 AI 开发者在开源领域的重要里程碑。

运行仅需激活49亿参数

在架构设计上,Mistral Large 4 采用了多模态、推理能力以及专家混合(MoE)结构。为了平衡性能与服务成本,模型在运行时仅激活约 49 亿个参数。虽然官方未公布具体的硬件最低要求,但该模型体积相对可控,可在配备 Nvidia HGX B300 或 AMD MI355X 等高端 GPU 的 8 路服务器集群上运行。

训练基础设施方面,Mistral 披露该模型是在其位于欧洲的数据中心内完成的。训练过程使用了大约 3,800 颗 Grace Blackwell GPU,相当于约 52 个 NVL72 机架的计算资源。数据涵盖超过 160 种语言,并结合了监督预训练与强化学习技术。此举体现了 Mistral 对“主权人工智能”理念的践行,即满足在欧洲境内训练和部署前沿级模型的需求。

目前,Mistral Large 4 处于预览阶段,预计将在一个月内通过 Hugging Face 及其他模型商店正式开放下载。第三方评测机构 Artificial Analysis 的早期测试显示,该模型在整体智能排名中略逊于 OpenAI 和 Anthropic 的旗舰产品,大致位于 DeepSeek V4.1 Flash 与 OpenAI 入门级 GPT6 Luna 模型之间。然而,在非中国开发的开放权重模型中,Mistral Large 4 表现突出,超越了美国同类最强开源模型。

Mistral 官方发布的基准测试则呈现出更乐观的结果。数据显示,在编码、代理任务、金融及法律等领域,新模型的表现可与阿里巴巴、Moonshot、Z.AI 和 DeepSeek 等中国顶级模型相媲美。此外,Mistral 特别强调了该模型在网络安全领域的优势。据称,Le Chonk 在 Artificial Analysis 的新型网络指数等安全基准中表现强劲,且较少拒绝执行合法的漏洞研究和事件响应任务。Mistral 指出,这种结合顶级网络性能、开放权重和自主部署能力的特性,有助于组织在自身政策框架下运行先进的安全工作,避免因供应商层面的拒绝服务而带来的安全风险。

此次发布是 Mistral 上月完成 3 亿欧元(约合 34 亿美元)D 轮融资后的首个成果。公司表示,随着持续应用强化学习技术,模型性能有望进一步提升,暗示未来可能推出 Mistral Large 4.1 版本。目前,用户可通过 Mistral API 提前体验该模型。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读