检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
机构地区:[1]曲靖师范学院计算机科学与工程学院,云南曲靖655011
出 处:《计算机系统应用》2010年第8期229-230,211,共3页Computer Systems & Applications
基 金:曲靖师范学院基金(2008QN007);云南省教育厅研究课题(09C0188)
摘 要:中文分词技术是机器翻译、分类、搜索引擎以及信息检索的基础,但是,互联网上不断出现的新词严重影响了分词的性能,为了提高新词的识别率,建立待分词内容的后缀数组,然后计算其公共前缀共同出现的次数,采用阈值对其进行过滤筛选出候选词语,实验结果表明,该方法在新词识别方面有一定的优势。Chinese word segmentation technology is the basis of machine translation,classification,search engines,as well as information retrieval.But the Internet emerging new words have seriously affected the performance of word segmentation.To improve the recognition rate of new words,suffix array is used in this paper,and the number of length of common prefix is calculated.The candidates on their words are filtered out by the threshold.Experimental results show that the new word recognition method has advantages.
分 类 号:TP391.1[自动化与计算机技术—计算机应用技术]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.222