基于无向图序列标注模型的中文分词词性标注一体化系统被引量：12

Joint Chinese Word Segmentation and POS Tagging System with Undirected Graphical Models

机构地区：[1]教育部-微软语言语音重点实验室哈尔滨工业大学,哈尔滨150001

出　　处：《电子与信息学报》2010年第3期700-704,共5页Journal of Electronics & Information Technology

基　　金：国家自然科学基金(60773069;60973169)资助课题

摘　　要：在中文词法分析中,分词是词性标注必须经历的阶段。为了能在分词阶段就充分利用词性标注的信息和减少两阶段错误的累计,最好的方法是将两个阶段,整合到一个架构中。该文以无向图模型为基础,将分词和词性标注有机地统一在一个序列标注模型中。由于可以采用更深层次的依赖关系作为特征,一体化系统在1998年人民日报语料上取得了97.19%的分词精确率和95.34%的词性标注精确率,是目前同类系统,在这一语料上取得的最好结果。For Chinese Part-Of-Speech（POS） tagging,word segmentation is a preliminary step.To reduce accumulated errors between two steps and improve the segmentation performance by utilizing POS information,segmentation and POS tagging can be performed simultaneously.In this paper,a joint segmentation and POS tagging system is proposed based on undirected graphical models which can make full use of the dependencies between the two stages.In the joint system,segmenting and tagging are viewed as the sequence labeling;moreover any connected sub-graph can be viewed as a certain dependency which can be used to find the final opinion labeling.The joint model achieves high performances with 97.19% in segmentation precision and 95.34% in POS tagging precision,which are the state-of-art performances for Chinese word segmentation and tagging on 1998-year People＇s Daily corpus.

关键词：中文分词词性标注一体化系统无向图模型

分类号：TP391[自动化与计算机技术—计算机应用技术]

参考文献：

正在载入数据...

二级参考文献：

正在载入数据...

耦合文献：

正在载入数据...

引证文献：

正在载入数据...

二级引证文献：

正在载入数据...

同被引文献：

正在载入数据...

高级检索 检索式检索

时间限定

期刊范围

学科限定全选

高级检索 检索式检索

时间限定

期刊范围

学科限定全选

基于无向图序列标注模型的中文分词词性标注一体化系统被引量：12

我的收藏

参考文献：

二级参考文献：

耦合文献：

引证文献：

二级引证文献：

同被引文献：

相关期刊文献：

相关的主题

相关的作者对象

相关的机构对象

下载全文

高级检索检索式检索

时间限定

期刊范围

学科限定全选

高级检索 检索式检索

时间限定

期刊范围

学科限定全选

基于无向图序列标注模型的中文分词词性标注一体化系统 被引量：12

我的收藏

参考文献：

二级参考文献：

耦合文献：

引证文献：

二级引证文献：

同被引文献：

相关期刊文献：

相关的主题

相关的作者对象

相关的机构对象

下载全文

用户登录

高级检索检索式检索

基于无向图序列标注模型的中文分词词性标注一体化系统被引量：12