“为AI训练数据付费”
生成式AI走红引发数据所有权之争

[大科技格局巨变]②“数据免费共享”?开始算账的企业们 View original image

围绕生成式人工智能(AI)的竞争,引爆了数据所有权之争。试图让AI学习更多数据的开发商,与希望向其收取数据使用费的企业正面交锋。争夺最多数据并需要这些数据的科技企业之间的“拔河”,正在进一步演变为与媒体等传统机构之间的冲突。


“只让大科技公司赚得盆满钵满”……不惜打官司

当地时间本月20日,美国信息技术专业媒体《连线》(Wired)报道,Stack Overflow计划在年内向开发大规模AI模型的企业收取数据费用。Stack Overflow是一个拥有超过2000万名开发者、共享编程信息的社区。Stack Overflow首席执行官(CEO)Prashanth Chandrasekar强调称:“为大规模语言模型(LLM)提供‘燃料’的平台理应获得回报,这有助于维持高质量数据,也将有利于未来的AI。”

[大科技格局巨变]②“数据免费共享”?开始算账的企业们 View original image

Reddit也表示,将从今年6月起向商业性使用其对话数据的AI开发商收取费用。Reddit是一家美国社交媒体平台,每天访问量超过5700万。Reddit CEO Steve Huffman在一次采访中直言:“没有必要把Reddit的数据免费送给世界上最大的一些公司。”


Twitter CEO Elon Musk甚至预告将提起诉讼,理由是微软(Microsoft,MS)非法使用Twitter数据来训练AI。双方矛盾始于今年2月,Twitter将可访问其数据的开发工具改为收费服务,随后微软将Twitter从其广告平台中移除,Twitter于是暗示将采取法律行动。


传统媒体机构也开始发声。包括《纽约时报》在内、汇集了北美2000多家媒体的新闻媒体联盟(News Media Alliance,NMA)于本月20日发布了《AI原则》。该原则明确指出:“生成式AI擅自使用NMA内容属于侵犯财产权行为,不得在未经许可的情况下使用,且应给予合理补偿。”通俗来说,如果向AI提问后得到的答案,其实是把媒体报道拿来“念一遍”,那么就应当支付版权费用。


数据来源一片“黑箱”……用免费数据赚钱

此前,包括开发出ChatGPT的OpenAI在内,谷歌(Google)、Meta等公司主要依赖互联网上汇集的数据。要开发生成式AI,必须让其学习海量数据,因此广泛利用了社交媒体对话和个人内容、开发代码、媒体报道、学术论文等。近期,美国《华盛顿邮报》联合AI研究人员对用于谷歌大语言模型的数据集进行分析后发现,主要来源是专利信息网站、在线百科全书等。在排名靠前的网站中,一半是新闻媒体,还包括50多万个个人博客。


问题在于,即便是公开在网上的内容,未经许可使用是否合适。OpenAI从最新模型GPT-4开始,甚至连使用了哪些数据都不再公开。企业还利用这样训练出的AI进行商业化。例如,微软推出了学习了开源社区中代码的AI工具“GitHub Copilot”。该AI为用户提供编程辅助服务,每人每月收费19美元。由此引发舆论反弹,认为大科技公司是在用未经付费、擅自使用的数据大发“横财”。



专家认为,围绕数据所有权的信息技术企业大战已经打响。掌握大量数据的一方与试图将其用于AI的一方之间,正展开激烈角逐。首尔女子大学信息保护学科教授 Kim Myeongju 表示:“依据合理使用原则,为公共目的(新技术开发)而容忍数据使用的氛围正在瓦解。要厘清企业使用了哪些数据、侵犯了哪些权利,本身就是极其复杂的问题,因此相关争论还将持续下去。”


本报道由人工智能(AI)翻译技术生成。

版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。