AI内容“水印”普及……抹掉就行?
Anthropic因欧盟AI法案实施引入水印
更改单词和句子即可规避……移除技术也已出现
难以实现完全识别
为生成式人工智能制作的内容添加水印的趋势,正扩展至整个人工智能行业。此举旨在通过建立识别人工智能生成内容的机制来提升透明度,但随着可规避检测的方法和技术同步发展,有观点指出,其作为完善识别手段仍存在局限。
据行业消息,Anthropic为应对本月2日生效的《欧洲联盟人工智能法案》透明度义务,已开始对Claude模型应用机器可读水印。这种方式会在文本本身留下可由专用检测器识别、但人类阅读时无法察觉的痕迹。Anthropic计划未来逐步为所有人工智能模型应用水印,并公开供第三方核验的检测工具及技术文件。
水印的引入正成为全行业趋势。谷歌正通过SynthID,为Gemini生成的文本和图像添加水印。OpenAI则在图像中应用记录内容来源信息的内容来源与真实性联盟(C2PA)元数据。人工智能音乐服务Suno、新闻通讯服务Substack等也在识别由人工智能制作的内容。
不过,业内认为,仅通过更改词语或句子结构便可规避检测,因此人工智能企业的这些努力难以取得完全效果。Anthropic所采用的文本水印,是指人工智能选择词语时略微提高特定词语被选中的概率,从而在整篇文章中留下统计模式的方法。检测器通过分析特定词语被选择的频率,判断是否存在水印。
人工智能检测企业GPTZero首席技术官Alex Choi指出:“若经过同时改变词语和句子结构的高强度‘改写’,水印将难以保留。”谷歌也曾在公布SynthID时表示,对于短文本、经改写或翻译的文本,以及针对事实性问题的回答,检测性能可能下降。
还有担忧认为,水印可能降低生成内容的质量。首席技术官Alex Choi称,人为调整人工智能原本准备选择的词语概率,可能会限制词语选择,并提及文本质量下降的可能性。
使水印失效的技术也在不断发展。其中具有代表性的是“水印窃取”,即反向推断水印生成规则。瑞士苏黎世联邦理工学院研究团队曾试验一种攻击方式:反复向应用水印的人工智能提问,以推测其规则。结果显示,攻击者以不足50美元的成本,清除现有水印或在人类撰写的文章中植入虚假水印,平均成功率达到80%。
面向普通用户的去除工具也已出现。今年6月,开发平台GitHub公开了一款用于移除人工智能生成图像标识的开源工具。该技术可去除包括谷歌SynthID等不可见水印、内容来源与真实性联盟(C2PA)元数据以及水印标识在内的信息。
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。