盖茨基金会联合60家机构建AI语言数据联盟

盖茨基金会联合60家机构建AI语言数据联盟。该联盟旨在扩大语言数据规模,计划五年内惠及超30亿人,以解决因训练数据缺乏代表性导致的误译等问题,推动AI工具在贫困社区的公平应用。

盖茨基金会联合 Anthropic、Google 等组建联盟,旨在构建更具代表性的人工智能语言数据集

2026 年 9 月 21 日,盖茨基金会宣布启动一项新的合作伙伴关系,召集包括 Anthropic、Google、OpenAI 基金会及其他数十个组织在内的共 60 家机构。该联盟由前沿人工智能实验室、科技公司、慈善机构等组成,致力于扩大人工智能工具中可用的语言数据规模,以应对全球不平等问题。

五年内惠及超30亿人

根据周一发布的公告,通过协调现有的各项努力,该联盟的目标是在五年内使超过 30 亿人受益。盖茨基金会首席执行官兼董事会成员马克·苏兹曼(Mark Suzman)表示,这项工作必须“全速前进”。他指出,政府应在监管网络安全和儿童发展影响的同时,将人工智能的人道主义应用扩展到目前被排除在外的贫困社区。

“即使人工智能现在被冻结——尽管我不期望也不要求这样做——我们也希望利用现有可用的工具来构建这些语言集并使其可用,”苏兹曼在接受美联社采访时说道。

这一合作举措紧随上周发布的“守门人”报告之后。在该报告中,基金会承诺投入 10 亿美元用于以人工智能为重点的项目,旨在改善健康结果、升级教育工具,并为世界各地的小农户提供信息支持。报告警告称,缺乏代表性的语言数据可能导致模型出现严重误译,例如将一名马拉维孕妇所说的“水已经破裂”错误翻译。

Mozilla 数据集团首席执行官 E.M 指出,许多人工智能工具的“原罪”在于其训练数据主要取自互联网。作为非营利组织 Mozilla.org 的子公司,Mozilla 数据集团正在开发一个数据共享平台,旨在帮助社区根据自身条件上传文化和语言数据集,而非在未获明确同意的情况下从网络抓取数据。

“互联网不是一个具有代表性的空间,”E.M 质问道,“为什么你会认为从一个主要在 Reddit 上训练出来的系统中,能得到具备文化多样性和代表性的结果?”

苏兹曼透露,联盟的具体治理细节仍在敲定中。盖茨基金会可能会鼓励合作伙伴在必要时填补更大的空白。

作为联盟成员之一,谷歌一直在资助一项名为 Project Vaani 的工作,旨在收集印度每个地区超过 150,000 小时的音频数据。谷歌高级副总裁 James Manyika 表示,该项目凸显了收集语言内部方言语音数据的必要性。为实现这一目标,谷歌正与当地合作伙伴合作,在现场录制语音。

Anthropic 此前曾发表文章呼吁整个行业合作以减缓技术进步的潜在风险,该公司已与基金会合作加快疫苗开发,并加强其聊天机器人的本地作物数据集建设。Anthropic 实用部署主管艾丽莎白·凯利(Elizabeth Kelly)承认,该公司的产品“特别落后于许多非洲语言”。

“我们非常清楚,除非我们能够正确地理解这些语言,否则我们无法实现我们希望看到的任何好处,”凯利表示。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读