基于Mahout的相似重复数据清洗策略研究  被引量:2

在线阅读下载全文

作  者:李碧秋 王佳斌 

机构地区:[1]华侨大学工学院,福建泉州362021

出  处:《科技与创新》2020年第20期15-18,共4页Science and Technology & Innovation

基  金:华侨大学研究生科研创新基金资助项目(编号:18014084003)。

摘  要:针对在海量日志记录中无法有效抽取高价值的数据问题,提出一种基于Mahout的k-means短文本聚类清洗算法,利用开源机器学习算法库Mahout,将文本聚类与数据清洗相结合,通过聚类检测相似重复记录,有效提升重复数据清洗速率。实验结果表明,该方法在保证较高查全率与查准率的同时,比传统相似重复数据清洗算法更具有扩展性,这对大数据的处理有较强的实用意义。

关 键 词:数据清洗 K-MEANS 相似重复记录 文本聚类 

分 类 号:TP311.13[自动化与计算机技术—计算机软件与理论]

 

参考文献:

正在载入数据...

 

二级参考文献:

正在载入数据...

 

耦合文献:

正在载入数据...

 

引证文献:

正在载入数据...

 

二级引证文献:

正在载入数据...

 

同被引文献:

正在载入数据...

 

相关期刊文献:

正在载入数据...

相关的主题
相关的作者对象
相关的机构对象