[封锁DeepSeek]②
从用户个人信息到输入数据、序列号通通收集
无可停止数据收集的“退出(opt-out)”设置
应用下载被拦截但现有用户不受影响
网页仍可持续访问

OpenAI只拿“令牌”…DeepSeek却整套获取用户信息 View original image

中国生成式人工智能“DeepSeek”与其他人工智能服务不同的特点在于,它在收集用户信息时不经过只识别必要信息的“去标识化(Tokenization)”过程,而是“整包”收集用户信息。


汇集全部用户信息

18日的DeepSeek个人信息处理方针显示,其可以原样收集“文字、聊天记录、上传文件”等用户输入信息,以及“设备和网络信息、位置信息、支付信息”等自动收集信息。注册时填写的姓名、出生日期、电子邮箱地址等账户信息也在收集范围之内。


尤其是在DeepSeek刚推出初期,甚至连键盘输入模式都进行收集,引发争议。14日,该公司才将键盘输入模式从收集对象中排除。键盘输入模式不仅可以用来识别具体个人,还可能被用来推断密码等用户输入的重要信息,因此被归类为敏感信息。


这与其他人工智能企业的信息收集方式存在差异。OpenAI的ChatGPT同样会收集用户输入的文本、上传的文件、设备标识符等信息,但会经过一个使其无法识别是从谁那里收集来的“去标识化(Tokenization)”过程。“去标识化”是一种仅安全利用必要信息的方法。例如,便利店小票上不显示完整卡号,只显示最后4位数字,方式类似。经过这一过程,用户可识别信息被删除,只保留输入数据本身,用于服务改进。


人工智能业界一位相关人士就DeepSeek的个人信息处理方针指出,“可以理解为我输入的所有数字化信息都会被对方拿走”,并表示,“在美国等发达国家,个人信息保护法对利用特定个人数据有明确监管规定,因此基本不可能像这样进行收集和利用”。


OpenAI只拿“令牌”…DeepSeek却整套获取用户信息 View original image

未注明信息使用期限,也没有拒绝权

不提供拒绝收集、以避免将用户输入信息用于生成式人工智能训练的“选择退出(Opt-out)”设置,也被指是问题所在。包括ChatGPT在内的Gemini(Google)、Clova X(Naver)等人工智能服务,如果用户选择拒绝,就不会将对话内容和输入数据用于人工智能服务改进。用户可以在各服务设置中轻松选择“选择退出”选项。但DeepSeek并未提供此类服务设置。这意味着用户在使用服务过程中输入的所有信息都会被统统当作用于服务改进的数据来加以利用。


对收集数据的保存期限也不明确。DeepSeek在个人信息处理方针中,对信息保存期限仅表述为“在提供服务所需的期间内”。对于已收集数据的删除期限,也只是含糊地写着“在不再需要时”。相较之下,ChatGPT和Clova X将用户输入数据的保存期限设定为最长30天。Gemini则允许用户自行设定数据保存期限,Clova X还提供用户可自行删除曾输入数据的功能。


个人信息存储在中国境内服务器

DeepSeek的个人信息和数据存储在中国境内服务器这一点也引发担忧。仅从DeepSeek条款来看,将个人信息传输至中国是被允许的。条款中写道:“服务器位于中华人民共和国,用户个人数据可以在中国境内本公司服务器进行处理和存储。”


但问题在于,按照中国现行法律,一旦国家机关要求提供存储在本国服务器上的信息,相关企业必须予以提供。这意味着难以消除信息外泄的忧虑。个人信息保护委员会已经表示,经确认,DeepSeek用户信息已被传输给中国社交媒体服务TikTok母公司“字节跳动”。韩国科学技术院(KAIST)人工智能研究生院责任教授Jang Dongin也表示:“DeepSeek已经事先告知,将自行使用所收集的个人信息,因此必须提高警惕。”



由于个人信息保护委员会向DeepSeek发出建议,目前新应用下载已被叫停,但此次措施的实效性预计仍将引发争论。已经下载DeepSeek应用的用户仍可继续使用该应用,而且DeepSeek网页也被排除在本次措施对象之外。根据应用分析服务WiseApp·Retail的数据,DeepSeek应用上个月第四周的用户数量为121万人。在同期生成式人工智能应用中,这一数字仅次于ChatGPT的493万人,位居第二。个人信息保护委员会相关人士表示:“对于已经下载并在使用(DeepSeek应用)的用户,企业方面实际上没有特别可采取的措施,因此每位用户在输入个人信息时必须格外谨慎”,“互联网本身的性质决定了要进行封堵并不容易。”


本报道由人工智能(AI)翻译技术生成。

版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。

不容错过的热点