内容
(一)数据爬取对平台造成竞争损害
平台通过公开数据吸引用户流量,继而贩卖或转化用户注意力获取商业利益。当数据被他人爬取后用于同类经营,平台原本能够获得的用户注意力便可能被分散或稀释,导致潜在的竞争损害。
首先,认定竞争损害范围的前提是“数据利用的市场同一性”。只有足以对权利人的数据经营活动产生市场替代效应的数据爬取行为,才可能产生竞争损害。而市场替代效应的发生,要求被爬取数据在经营时所面向的市场与爬取方将数据投入的市场属于同一市场。
其次,认定竞争损害程度的标准是“足以引发流量分流”。在数据引导流量变现的商业模式下,数据必须以规模化态势持续吸引用户注意力,直到产生用户黏性。对少量零散数据的爬取并不足以争夺权利人基于大数据集吸引的用户流量,不构成竞争损害型侵权。如果爬取的数据内容对用户具有更强的“吸引力”,则引发用户流量分流的可能性更高,造成竞争损害的数据爬取数量要求也就更低;反之亦然。
(二)数据爬取对平台数据运营造成干扰
由于网站服务器负载能力有限,爬虫程序的高频率访问可能使平台网站访问过载、发生拥堵甚至瘫痪,干扰平台通过数据引导流量变现。判断数据爬取对平台是否造成干扰损害,关键在于数据爬取是否不合理地加重了平台服务器的运维负担。这取决于爬虫程序访问的频率、时长,以及平台网站服务器自身的负载能力等多种因素,但考虑到网站服务器性能的下降将迫使用户放弃继续访问网站,进而导致用户流量显著流失,因此可以直接根据平台是否遭受用户流量损失进行判断。在技术层面,这一事实可借助网站的服务器日志并对比之前正常的访问情况加以推定。
(三)数据爬取损害个人信息权益
一方面,在“合理范围内”爬取公开个人数据不属于对个人信息权益的损害。《个人信息保护法》第27条确立了已公开个人信息可在“合理范围内”自由处理的规则。个人信息数据公开与否的判断应当采客观标准,即数据客观上可被不特定主体自由访问,故本条中的“个人自行公开”包括个人“有意”或“无意”自行公开。另一方面,前述判断并不当然否认此时数据财产权益因数据爬取而可能遭受的损害。《个人信息保护法》确立了个人信息权益优于数据财产权益的价值立场,个人信息处理者不得以数据财产权益对抗个人信息权利主体。但是,第三方基于公开个人信息的合理处理规则爬取数据,并非个人信息权利积极行使的体现,因此并不具有对抗平台数据财产权的优先性。
(一)爬取方损害数据财产权益的过错认定
无论是数据爬取行为造成竞争损害,还是对平台运营造成干扰,都属于对数据财产权益的侵害,应当适用《民法典》第1165条第1款的一般过错责任规则,具体则需要判断行为人是否违反注意义务。
第一,关于数据爬取引发竞争损害的过错认定。(1)如果爬取者的数据爬取行为确实或相当可能引发竞争损害,则说明其充分具备将数据用于经营的能力,可以预见自己的行为会对原平台造成竞争损害,因此应当认定其有过错。(2)不能仅以数据爬取遵守了平台的机器人协议为由,当然地否定行为人存在过错。引发竞争损害的直接原因是爬取方将数据投入同一市场进行经营,而平台允许一定范围内的数据被爬取,并不意味着也允许行为人将爬取而来的数据用于竞争性经营。
第二,关于数据爬取干扰平台运营的过错认定。只要数据爬取的频率没有超过平台网站通过机器人协议和反爬虫措施所划定的可容忍限度与访问限制,都可以认为其是被平台网站所允许的,因而爬取方并不具有过错;反之亦然。因为机器人协议不属于私法契约,违反机器人协议爬取数据至多说明行为人存在过错,在爬取的数据量不大的情况下,数据爬取客观上并未不当加重平台的运维负担,没有造成损害后果,并不构成侵权。
第三,关于个人授权对数据爬取致损过错认定的影响。(1)对竞争损害型侵权而言:在可携带权的范围之内,行为人基于用户个人授权爬取个人信息数据,系个人信息权利行使的体现,不应允许平台通过阻滞数据转移这类有损用户个人信息权益的方式来维持其竞争利益,即便造成原平台的竞争损害,也不构成竞争损害型侵权。(2)对干扰型侵权而言:可携带权的行使本身存在频率上的合理限制,此时数据爬取对平台数据运营所可能造成的干扰并不能被个人授权所正当化,数据爬取仍应尊重平台机器人协议和反爬虫措施的访问限制,否则将成立过错。
(二)爬取方损害个人信息权益的过错认定
爬取个人数据属于对个人信息的处理,根据《个人信息保护法》第69条第1款,爬取方对个人信息权益的损害承担过错推定责任。值得注意的是,即便平台未将某些明显超出“合理范围”的个人信息数据(如已公开的敏感个人信息)纳入机器人协议中“禁止爬取的数据范围”,爬取方也不得据此主张其爬取该类数据的行为无过错。因为个人信息权益是具有对世效力的人格权益,爬取方应当预见并避免此种对敏感个人信息的不适当爬取,否则即是对注意义务的违反,存在过错。
(三)平台未尽个人信息保护义务的过错认定
《个人信息保护法》第51条规定,个人信息处理者有义务“防止未经授权的访问”。考虑到个人在个人信息处理关系中的弱势地位,即便此种场景下侵犯个人信息权益的处理者是数据爬取者而非平台,但仍宜准用《个人信息保护法》第69条第1款,要求平台承担过错推定责任:一方面,平台在他人不当爬取数据的情形下,只需要证明其已将不宜被爬取的数据纳入机器人协议中禁止爬取的范围,并在现有技术水平之下采取了必要的防护措施,通常即可证明自身无过错。另一方面,《个人信息保护法》第51条属于保护性规范,平台违反规范本身即可推定为有过错。
(一)爬取方对平台的侵权责任
无论构成竞争损害型侵权抑或干扰型侵权,爬取方均需就数据爬取行为所造成的损害进行赔偿。数据爬取对数据财产权益的侵害往往表现为用户流量损失,可以参照“用户流量损失=用户流量×广告加载率×广告费率”的计算公式。在干扰型侵权中,平台如有其他因维护服务器运转而在合理范围内额外支出的人员或设备费用等,也可一并纳入损害赔偿的范围。
在损害赔偿之外,平台不能请求数据爬取方返还数据。因为数据具有可复制性,数据爬取并不使权利人丧失数据。数据被爬取后又恰好因其他原因而毁损灭失的,毁损灭失与爬取之间已无因果关系,同样不涉及返还。在竞争损害型侵权中,平台可以要求爬取方删除数据,实现“停止侵害”,否则表现为数据竞争性利用、截取用户流量的侵权行为仍会持续。在干扰型侵权中,平台不得要求爬取方删除数据,因为无论爬取方事后是否删除数据,均与干扰运营所产生的损害之停止或弥补无涉。
(二)爬取方对个人信息主体的侵权责任
在超出“合理范围”爬取公开个人信息数据构成侵权的场合,个人可以请求爬取方损害赔偿以及删除数据。如果爬取方将爬取的公开个人数据作为语料投入生成式AI大模型训练,仍可通过重新训练的方式,以实现数据删除的效果。此时删除个人信息仅仅是成本过高,并非《个人信息保护法》第47条第2款“从技术上难以实现”,爬取方不应推辞。同时,《民法典》第580条第1款对非金钱债务的“履行费用过高”抗辩难以在此处适用。因为个人信息删除请求权是一种人格权请求权,爬取方删除个人信息的义务也就不是与“非金钱债权”对应的“非金钱债务”。如果确因语料短缺等因素,例外地允许服务提供者以“履行费用过高”为由不对AI进行重新训练,其仍应按照《民法典》第577条“采取补救措施”并承担由此产生的损害赔偿责任。
(三)平台违反个人信息保护义务时对个人的侵权责任
在他人爬取个人数据而平台未尽个人信息保护义务的场合,数据爬取方是直接侵权人,应当为数据爬取造成的个人信息权益损害承担全部责任,平台则类推适用《民法典》第1198条第2款“承担相应的补充责任”,并对数据爬取方享有追偿权。因为平台的个人信息保护义务与一般安全保障义务相似,均处于直接侵权人、保护义务人、受害人的三方利益结构中,在《民法典》第1198条第2款的体系效应下,个人信息保护义务人应当仅根据其过错和原因力大小承担相应责任。并且,被爬取的数据处于公开状态,此时平台的个人信息保护义务与公共场所管理人的安全保障义务相似。
在数据爬取的竞争损害型侵权中,竞争损害要求数据爬取后利用在相同的数据经营市场,并足以引发用户流量分流。但在可携带权范围内,用户个人的授权可使这类数据爬取正当化。损害数额可根据用户流量损失计算,此外平台还可请求爬取方删除数据。
在数据爬取的干扰型侵权中,干扰损害的认定关键在于数据爬取是否不合理地加重了平台服务器的运维负担,可直接根据平台是否遭受用户流量损失进行判断。平台有权请求爬取方赔偿用户流量损失及维持服务器运转额外支出的合理费用,但不能请求删除或返还数据。
对于个人信息权益,爬取方对超出公开个人信息合理处理范围的数据爬取损害承担过错推定责任,若其将数据用于AI大模型训练,可以“履行费用过高”为由不删除个人数据,但需采取补救措施并进行损害赔偿;未尽到个人信息保护义务的平台在过错范围内承担补充责任。
文献链接:《论公开个人数据爬取行为的侵权责任》
(本文文字编辑彭睿。本文为中国民商法律网“原创标识”作品。凡未在“中国民商法律网”微信公众号正式发布的文章,一律不得转载。)