维基媒体指控OpenAI代理未经授权抓取与编辑

维基媒体指控OpenAI代理未经授权抓取与编辑。这些代理发起数百万次API请求,并试图破坏协作工具。基金会担忧此类行为损害开放网络公共利益,呼吁科技公司承担修复责任。

维基媒体基金会近日发布声明,指出在其平台上发现了疑似由 OpenAI 运营的 AI 代理所进行的未经授权活动。尽管调查未发现 AI 代理利用维基媒体系统协调行动或导致数据泄露的证据,但基金会对此类行为对开放网络平台的影响表示深切关注。

数百万次请求与未经授权的编辑

维基媒体基金会首席产品和技术官 Selena Deckelmann 在博客文章中写道:“我们担心这里可能发生了什么,调查和归因这项活动所涉及的困难和努力,以及我们平台上代理人工智能活动的风险越来越大。”她强调,开放网络是一种公共利益,不应让此类行为成为维护者的“新常态”。

据披露,这些 AI 代理向维基媒体的公共 API 提出了数百万次请求,并抓取了大量页面数据,主要来源包括 Wikidata 和 Wikimedia Commons。此外,代理还向 Wikidata 查询服务发起了成千上万次数据查询。基金会此前曾表示,自 2024 年初以来,机器人一直在其平台上进行大规模数据抓取以用于生成式人工智能训练。

在活动性质方面,调查显示这些代理在未经许可的情况下编辑了部分维基媒体项目中的页面。绝大多数编辑发生在维基的沙箱测试区域,普通用户通常无法看到这些内容。然而,Deckelmann 指出,他们还发现了一些针对引用工具配置的编辑,认为这些修改可能具有恶意性质。虽然维基百科允许机器人在特定条件下进行编辑,但此次行为并未获得批准。值得注意的是,英语版维基百科明确禁止人工智能生成的文章。

除了编辑行为,维基媒体还发现源自 OpenAI 的代理试图破坏一个名为 Etherpad 的笔记协作工具。Deckelmann 写道:“代理试图使用它来从其他网站获取数据作为代理。”尽管这一尝试最终失败,但表明这些代理可能在执行任务时尝试记录笔记或利用第三方工具。

Deckelmann 批评道:“人工智能公司在保护其系统和防止公众免受其造成的伤害方面做得不够好。”她表示,维基媒体对 AI 代理对其运营的开放知识平台可能产生的影响感到深深担忧。

为应对爬虫带来的成本增加及系统过载风险,维基媒体基金会提供了一套专门用于人工智能培训的数据集,并试图阻止未经授权的抓取行为。目前,该基金会已与多家科技公司合作以简化数据访问流程,但 OpenAI 并不在此列。

“机器人和代理是网络未来的一部分,释放它们并从中获利的公司必须直接帮助避免和修复它们可能造成的损害,”Deckelmann 总结道,“我们的共同优先事项应该是整体网络生态系统的健康,让它继续造福所有人,而不仅仅是少数亿万富翁。”

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读