基于全局性确定聚类中心的文本聚类  被引量:5

Text clustering based on global center-determination

在线阅读下载全文

作  者:陈建超[1] 胡桂武[1] 杨志华[2] 严桂夺[3] 

机构地区:[1]广东商学院数学与计算科学学院,广州510320 [2]广东商学院信息学院,广州510320 [3]华南理工大学计算机科学与工程学院,广州510640

出  处:《计算机工程与应用》2011年第10期147-150,共4页Computer Engineering and Applications

基  金:国家自然科学基金No.60873088;广东省自然科学基金(No.06301003)~~

摘  要:文本聚类关键是有效解决特征词向量选择及特征词权重计算方法、文本相似度计算方法、聚类中心确定等三个问题。针对相关算法在三个关键环节上存在的问题,提出了适合自由文本特点的特征词权重计算方法和文本相似度计算方法;在此基础上提出了改进的CBC算法,从全局上自适应地确定文本集中的各个聚类中心。算法在实验中准确地确定了各个聚类中心,并在两个文本集上分别获得88.50%和94.00%的聚类准确率。The three key points of text clustering are feature selection and weight calculation,texts similarity calculation and cluster center determination.This paper proposes two new methods based on the characteristic of free texts for feature-weight calculation and texts similarity calculation separately.Then an improved CBC algorithm is proposed to determine the cluster centers adaptively and globally.This algorithm produces all cluster center correctly,and obtains precision of 88.50% and 94.00% for two different text-set separately.

关 键 词:文本聚类 全局性 聚类质心 特征词集 

分 类 号:TP301[自动化与计算机技术—计算机系统结构]

 

参考文献:

正在载入数据...

 

二级参考文献:

正在载入数据...

 

耦合文献:

正在载入数据...

 

引证文献:

正在载入数据...

 

二级引证文献:

正在载入数据...

 

同被引文献:

正在载入数据...

 

相关期刊文献:

正在载入数据...

相关的主题
相关的作者对象
相关的机构对象