中文分词和词性标注模型  被引量:11

Model of Chinese Words Segmentation and Part-of-Word Tagging

在线阅读下载全文

作  者:刘遥峰[1] 王志良[1] 王传经[1] 

机构地区:[1]北京科技大学信息工程学院

出  处:《计算机工程》2010年第4期17-19,共3页Computer Engineering

基  金:国家"863"计划基金资助项目"智能感知与先进计算技术"(2007AA01Z160);北京市自然科学基金资助重点项目"基于情绪认知模型的个性化数字教育关键技术研究"(KZ200810028016)

摘  要:构造一种中文分词和词性标注的模型,在分词阶段确定N个最佳结果作为候选集,通过未登录词识别和词性标注,从候选结果集中选优得到最终结果,并基于该模型实现一个中文自动分词和词性自动标注的中文词法分析器。经不同大小训练集下的测试证明,该分析器的分词准确率和词性标注准确率分别达到98.34%和96.07%,证明了该方法的有效性。This paper proposes a model of Chinese words segmentation and part-of-word tagging. In the words segmentation stage, the top N segmentation results are confirmed as the candidate. The final result among these candidates is gotten after unknown words recognition and part-ofword tagging. A Chinese lexical analyzer is developed. This model with different size of training set is tested. The lexical analyzer's accuracy of words segmentation and part-of-word is 9834% and 96.07%. This proves the effectiveness of the method.

关 键 词:分词 词性标注 最短路径 

分 类 号:TP18[自动化与计算机技术—控制理论与控制工程]

 

参考文献:

正在载入数据...

 

二级参考文献:

正在载入数据...

 

耦合文献:

正在载入数据...

 

引证文献:

正在载入数据...

 

二级引证文献:

正在载入数据...

 

同被引文献:

正在载入数据...

 

相关期刊文献:

正在载入数据...

相关的主题
相关的作者对象
相关的机构对象