检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
机构地区:[1]西北民族大学中国民族语言文字信息技术国家民委教育部重点实验室,兰州730030
出 处:《华中师范大学学报(自然科学版)》2014年第1期37-41,共5页Journal of Central China Normal University:Natural Sciences
基 金:甘肃省自然科学基金项目(1107RJZA157)
摘 要:话题检测的提出是为了帮助人们从海量的新闻报道中发现未知的新话题,其中文本聚类算法的研究,是实现藏文新闻文本的话题检测技术的核心.本文提出一种聚类算法,是基于简易聚类算法的改进,首先改进了文本顺序对聚类结果产生的影响,其次通过确定种子话题,来确定话题的类别.本研究的聚类算法在较小规模的语料中比改进前源算法有一定程度的提高.本文的研究对象是藏文网站中的新闻文本.Topic detection was raised in order to help people find an unknown news topic from vast amounts of news reports,and the research of clustering algorithm is the core content to realize topic detection technology based on Tibetan news text.This paper proposes a clustering algorithm is based on simple clustering algorithm.First of all,this algorithm improves the impact that the different text order causes the difference of the clustering results.Secondly,introducing the concept of seed topic,this algorithm determines the subject category through the number of seed topic.The new clustering algorithm of this study has a certain degree of increase,compared with the previous algorithm,in a smaller corpus.The research object of this paper is the text of Tibetan news website news.
分 类 号:TP391.43[自动化与计算机技术—计算机应用技术]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:18.220.204.192