检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
机构地区:[1]宁波大学通信技术研究所,浙江宁波315211 [2]浙江省移动网应用技术重点实验室,浙江宁波315211
出 处:《数据通信》2016年第2期10-12,54,共4页
摘 要:为获得微博中的热点话题,本文设计并实现了一个基于Hadoop微博热点话题挖掘系统,包含数据采集、数据预处理、数据存储、热点话题挖掘四个子系统。面对庞大数据量,采用HDFS分布式存储;在TF-IDF算法的基础上做出了改进,本文提出影响度的概念;针对单节点数据处理的性能瓶颈,对改进后的TF-IDF算法和经典关联规则挖掘算法Apriori进行了Map R educe化设计。实验结果表明,该系统能高效率地采集微博数据,同时能够提取微博热点话题。并且当数据量变大,该系统较单节点有明显时间优势。
关 键 词:HADOOP 微博 热点话题挖掘 MAP REDUCE TF-IDF APRIORI
分 类 号:TP393.092[自动化与计算机技术—计算机应用技术] TP391.1[自动化与计算机技术—计算机科学与技术]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:3.144.162.109