随着大数据时代的发展,云计算、云存储等大数据技术在医学上的应用日渐成熟,大量的医疗数据结合数据预处理、数据挖掘、智能分析等技术,帮助人们从大量、复杂的数据集中挖掘出有价值的信息,对医疗诊断、疾病预测等方面都有很大的帮助。本文从分析大数据的处理框架入手,结合医疗数据的特点,剖析了关联规则挖掘算法在医疗的应用。
一.大数据的处理框架:
医疗大数据处理的基本流程:在合适工具的帮助下,对采集到广泛的异构医疗数据进行预处理,并且根据数据的特性对其进行存储,根据需求选用合适的数据挖掘技术对医疗数据进行分析处理,从中得出有价值的知识,最后使用恰当的方式将结果呈现给用户。其中具体包括三个步骤:
1)数据的预处理
先对医疗数据进行完整、一致性的检查,对其中的噪声数据进行处理。由于患病情况和治疗医生存在差异,导致小部分数据的表达和病案记录存在不确定性和主观性,容易导致病例脱失、过程中断以及病案数据的偏差和残缺等现象[2]。对这些数据在预处理阶段就需要进行处理。
2)数据的分析
当我们获得预处理过的数据后,可以根据用户的需求使用数据挖掘、机器学习、数理统计等技术进行分析处理,探寻其中的规律和模式。可以极大的提升疾病预警、医生诊断、用药决策等的效率。
3)数据解释
最后将分析结果通过可视化或人机交互等技术展示给用户,让用户充分理解表达的信息。
二.医学数据的特点:
1)数据的复杂多样性:医疗类的数据产生于医院运营的各个环节,这些数既包括结构化数据比如病人的信息、治疗情况等,也包括一些非结构化的数据比如医学影像、脑信号等,而数据之间又常常会出现复杂的关联性,增加了对数据分析的难度。
2)数据的安全性:医用大数据被挖掘、分析后的价值巨大,但是也随之伴随病人的隐私泄露的风险,防止隐私泄露,维护信息安全是又一重要的举措。
3)数据的时效性:医学数据具有非常强的时效性,数据会随着患者、疾病等的改变而变化,所以及时对数据进行分析和处理,保证数据的可用性是十分必要的。
三.关联规则挖掘算法:
1)算法基本思想:
发现频繁项集:
从指定的数据库中获取数据,生成候选1项集,进行支持度计数,与min_support count比较,并将值小于它的项进行修剪,得到频繁1项集。对频繁1项集进行拆分与组合形成候选2项集。之后不断进行迭代,使用频繁N项集生成候选N+1项集,直到不能产生新的候选集为止。
生成关联规则:
在这一阶段使用的初始数据是最大频繁项目集N的集合。定义关联规则如N1→N2,这一规则与min_confidence进行比较,最终筛选获得满足min_support和min_confidence的关联规则,即为强关联规则。
其中支持度(support)可以表示为 Sum(X)与全体事务集D中的项集的比值[4]。记为:
Support(X)=Sum(X)/|D|。
置信度(confidence)可表示为X和Y同时出现的次数与只有X出现的次数的比值。记为:
Confidence(X→Y)=support(X∪Y)/support(X)。
2)在医学上的应用实例:
比如选取门诊病例电子化[1]的小部分数据进行分析,针对病人的症状及疾病进行数据的关联规则挖掘分析。
如下图是将每一位病人的电子病历数据转换为可供挖掘处理的形式,其中每一行代表一位病人的患病数据,为了使实验没有误导性,使用A代表疾病,S代表症状。其中min_support count
=3,min_confidence=75%。最终结果如下图。
第一条数据结果S2→A1;S1的可信度为75%。假设S2代表症状是鼻塞,S1代表症状是咳嗽,A1代表疾病为感冒,该关联规则的涵义为当病人出现鼻塞时,那么它有很大概率会有咳嗽的症状并且很有可能是由感冒引起的。
一般而言,当病人去看病时,都会将症状告诉医生,医生也会通过病人所描述的症状去询问相关联的症状,来判断病情,进行诊断。但是如果病人由于特殊情况没有全部告诉医生自己的症状或者医生有时候大意忘记主动询问症状那就可能会导致疾病误判,使得病人遭受病痛折磨,甚至会有生命危险。
如果可以将医院中数百万条病历数据进行大数据的处理与分析,得到各个症状、疾病之间的强关联关系,就可以辅助医生进行诊断,有时还可以通过关联关系从已有的病情去预测可能会发生的疾病,当然仍需要医生根据自己的专业素质去进行诊断治疗。
数据挖掘技术在医学领域得到了广泛的应用,随着信息时代的蓬勃发展,医学信息也在大幅增长,这些医学大数据与数据挖掘的结合,能够帮助人们从复杂的数据中挖掘出有价值的信息,加速医学成果转化,为医疗行业开拓新的时代[3]。
参考文献:
[1]王华.关联规则挖掘及在医学信息处理中的应用研究[D].合肥工业大学,2006.
[2]任芳,刘硕.数据挖掘技术在医学信息中的广泛应用[J].中国多媒体与网络教学学报(上旬刊),2019(06):9-10.
[3]孙雪松. 数据挖掘在医学大数据研究中的应用[N]. 中国信息化周报,2018-06-11(012).
[4]赵济朋.基于Hadoop对Apriori算法的改进与研究[D].西北师范大学,2016.