基于最大熵模型的冠词错误纠正系统  

Article Error Correction System Based on Maximum Entropy Model

在线阅读下载全文

作  者:陈朝才 吴敏[1] 吴桂兴[2] 郭燕[2] 

机构地区:[1]中国科学技术大学现代教育技术中心,合肥230026 [2]中国科学技术大学苏州研究院,苏州235123

出  处:《计算机系统应用》2015年第8期85-90,共6页Computer Systems & Applications

摘  要:研究了英语语法中冠词错误的计算机自动纠正.首先对冠词使用的错误进行定义分类,并考虑到可能出现冠词缺失的情况,通过采用基于最大熵模型的分类器,选择包含上下文、上下文词性、短语结构等特征,在训练集上进行模型预的训练,然后使用模型对于输入句子进行预测并纠正存在的使用错误.在NUCLE语料的实验中,给出了语料处理、模型特点、训练语料的大小对于测试集效果的影响,并且比较了自然语言处理中非常通用的朴素贝叶斯模型的结果,还根据英语语法中存在的错误特点对模型进行改进,最后在测试数据达到35.48%的F值,相较于CoNLL2013的shared task中最好结果有小幅提升.Computer automation correction of article errors in English grammar is been studied. First we define the categories of article errors, and missing articles is also included, by using a maximum entropy model, extracting features covering context, part of speech, noun phrase structure and so on, training the model on the training corpus, then use the model to predict and correct the article errors of an input sentence. In the experiment on NUCLE corpus, effects of corpus preprocess, model types and the size of the training corpus are discussed. We make a comparison with the popular Naive Bayes model, at last we introduce the characters of English grammar to improve the model, a F-score of 35.48% is achieved, the result is slightly better than the best result in Co NLL 2013 shared task.

关 键 词:冠词错误 计算机自动纠正 最大熵模型 

分 类 号:TP391.1[自动化与计算机技术—计算机应用技术]

 

参考文献:

正在载入数据...

 

二级参考文献:

正在载入数据...

 

耦合文献:

正在载入数据...

 

引证文献:

正在载入数据...

 

二级引证文献:

正在载入数据...

 

同被引文献:

正在载入数据...

 

相关期刊文献:

正在载入数据...

相关的主题
相关的作者对象
相关的机构对象