随着信息时代的蓬勃发展,海量数据的采集、存储、清洗、挖掘技术的发展日益成熟,从中可以获取巨大价值的信息。但是在数据处理的过程中,会出现数据安全难以保障和隐私泄露的风险。所以保持数据的高价值性,同时保障数据安全,防止敏感信息泄漏是当今大数据时代需要解决的关键性问题。本文对三种隐私保护的关键技术--数据脱敏,差分隐私和K匿名化技术进行浅析。
一.数据脱敏
数据脱敏就是通过对敏感数据的一系列处理如数据转换、数据失真等降低数据的敏感度,保护用户的敏感信息,当然也会保留一定的可用性和统计性。它的灵活性非常高,是工业界处 理敏感数据的一种常用的技术手段。广义上来讲,人脸打码就是一种图片的脱敏手段,它是通过对部分重要信息进行模糊化处理来达到对信息的隐私保护。在脱敏的技术中有一些典型的脱敏方法,在使用时要根据特定场景来定夺具体使用哪种脱敏方法,要满足脱敏等级、使用目标等。基本的脱敏方法有8种:
取整:通过数值或日期数据的取整,如13:58→14:00。
量化:通过量化间距,调整数据失真程度,如39→40
屏蔽:隐藏部分数据,如身份证号,电话号,如186xxxx6666.
截断:数据尾部截断,如135-6899-898→135-6899
唯一替换:对照替换表将敏感数据进行替换,如132→XAC
哈希:将输入映射成为固定长度的字符串。6-aqL.
重排:将数据库的某一列值进行重排。22-14-512→ 512-22-14
FPE 加密:明文和密文格式不变,属于统一集合。13288668→13355689
2)场景用例
现如今,网络安全已经从传统的安全保护发展成以数据为中心的网络安全保护,其防控目标和防控对象也会发生相应改变。传统安全是以数据不受攻击为目标的防护,而以数据为中心的安全是以大数据安全使用为目标的防护;传统数据安全是以对外部黑客或入侵者的防控为主要的对象,而大数据安全以能接触到数据的内部人员和调用数据的上层应用的防控为主要的对象。
在企业中,有些业务需要企业内部人员调用数据库的数据进行处理,那么就会有隐私泄露的风险,为了防止内部人员泄露隐私,保护数据的使用安全,就可以对数据项逐个进行加密,当业务人员需要访问核心客户数据库时,服务器将会根据业务人员的权限,对数据的颗粒度进行管理和脱敏的处理。比如要获取客户的合作信息,其中涉及到客户隐私如身份证号、电话等,就可以对用户的身份证、电话的中间几位进行屏蔽处理,这样业务人员只能进行正常的业务操作而无法获取用户的隐私信息,保证数据的安全。
二.差分隐私
差分隐私保护是基于添加噪声的隐私保护方法,它通过添加满足特定分布的随机噪声使数据失真,达到隐私保护的目的,当然也会保持某些数据或数据属性不变,保证处理后的数据仍然具有统计特性[1]。差分隐私方法定义了严格的攻击模型,并对隐私泄露风险进行了严谨的数学证明和定量化表示[1]。具体的公式为:设有随机算法 M,PM 为 M 所有可能输出构成的集合的概率,对于任意两个邻近数据集D 与 D’以及 PM 的任意子集 SM,若算法 M 满足于[2]:
■
则称算法M提供-e 差分隐私保护。
2)场景用例
假设一所医院提供了医疗信息统计接口,黑客可以通过统计接口获取该院患有糖尿病的总人数为60人,之后得知病人A去该院就诊,当黑客再次连接接口查看总人数时,发现患有糖尿病的总人数为61人,那就可以怀疑病人A患有糖尿病。病人A的就诊隐私就存在泄露的风险。
在差分隐私的保护下,在数据库中添加或删除一条记录,不会影响输出的结果,它需要保持两个相邻数据库概率分布几乎相同,通过在最终的查询结果中加入噪音,使得结果在一定范围内失真,从而抵抗差分攻击引起的隐私泄露。在上述的场景中,黑客无法通过任何已知记录的敏感属性推测出其他未知记录的敏感属性[3],使得用户的信息得到保护。
三.K匿名化
K匿名化技术可以保证存储在数据集中的每条个体数据对于敏感属性不能与其他K-1个个体相区别,即K匿名机制要求同一个准标识符至少要有K条记录,使得观察者无法通过准标识符连接记录。其中准标识符指可以和外部表连接来识别个体的最小属性值。
在数据的隐私保护中,第一步需要对能够直接识别出个体身份的标识符进行脱敏操作,使得攻击者无法直接定位个体。但攻击者可以连接多表通过分析多个准标识列的属性值识别个体,并且与大数据平台进行匹配获取个体敏感数据。为了避免这种情况的发生,会对准标识列的数据进行脱敏操作,例如下文实例的泛化操作。
2)场景用例
假设有一张基本信息表,其中表的属性名{姓名,年龄,性别,邮政编码};还有一张医疗信息表,其中表的属性名{年龄,性别,邮政编码,疾病情况};医疗信息表将姓名进行加密,留下不具备定位个体的准标识列的属性。黑客可以链接两张表,匹配出个体姓名,进而获得患病情况得到病人隐私。所以仅对数据进行简单的匿名化处理必然会引起隐私泄露。为了避免这种情况的发生,可以对准标识列进行泛化操作如将医疗信息表({年龄,性别,邮政编码,疾病情况})的数据元组泛化为:{2*,男,100**,糖尿病};{2*,女,100**,感冒};{3*,男,333**,流感};{3*,男,333**,皮肤病}等。经过泛化后,就有多条记录的准标识列的属性值相同,K匿名要求至少有K-1条记录的准标识列属性值与该记录相等,这种特性会使得黑客无法确定特定个体的相关记录,从而保护了用户隐私。
参考文献:
[1]李杨,郝志峰,温雯,谢光强.差分隐私保护k-means聚类方法研究[J].计算机科学,2013,40(03):287-290.
[2]赵意. 社交网络中基于隐私的链路预测算法研究[D].北京建筑大学,2016.
[3]叶云,余勇,黄刘生,石聪聪,李尼格,怀梦迪.一种基于top-m D~k-Outlier的隐私保护异常数据检测算法[J].小型微型计算机系统,2016,37(12):2638-2642.