Mistral发布万亿参数模型ML4,仅用4000块GPU训练

Mistral发布万亿参数模型ML4,仅用4000块GPU训练。该模型主打开放权重与安全审计,聚焦网络安全、金融及芯片设计领域,由ASML和三星支持,旨在开辟AI第三种路径。

Mistral AI 发布 Mistral Large 4:万亿参数多模态模型,主打“人工智能第三种方式”

法国人工智能实验室 Mistral AI 于周二正式发布了其最新的大型多模式模型 Mistral Large 4(ML4)。该模型拥有 1 万亿个参数,旨在超越来自美国和中国的竞争对手。法国总统马克龙将这一举措描述为“人工智能的第三种方式”,试图在封闭式与开放式人工智能模型的激烈竞争中开辟新的路径。

仅用4000块GPU完成训练

开放权重计划与安全考量

尽管 ML4 体量巨大,但它目前并非完全开放的重量级模型。现阶段,用户仅能通过公共端点访问该模型。Mistral AI 表示,计划在完成安全测试后的三周内提供模型权重。

公司强调,将与可信合作伙伴及政府合作,确保开源权重可用于防御目的。Mistral AI 指出,近期安全问题日益严峻,特别是在其核心受众——企业和机构中。同时,相比封闭模型,开放权重模型更容易进行审计。

训练效率与算力投入

一个关键的幕后细节是,ML4 完全基于 Mistral 自有的算力进行训练。据该公司 Stock 透露,训练过程仅使用了 4,000 块 NVIDIA GPU。这一数量比中国竞争对手少两到三倍,也显著低于闭源竞争对手的投入规模。

市场定位与应用场景

虽然基准测试结果尚未公布,但 Mistral 希望 ML4 能在开放式重量模型中排名第一,尤其是在中国市场以外的领域。Stock 表示,通过专注的训练策略,该模型有望在特定关键领域优于封闭模式,其多式联运能力也将进一步增加价值。

根据斯托克的说法,ML4 的主要优化用例包括网络安全、金融以及芯片设计。这些领域正是 Mistral 两大主要支持者的核心业务:荷兰光刻机巨头 ASML 领导了其 C 轮融资,而三星电子则在上个月以 21 亿欧元(约合 243.9 亿美元)领投了 D 系列融资。

Mistral AI 试图通过此次发布表明,其决定接纳中国模型并非仅仅转向成为一个简单的推断提供商,而是希望被视作一个前沿的人工智能实验室。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读