检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
机构地区:[1]中国科学技术大学现代教育技术中心,合肥230026 [2]中国科学技术大学苏州研究院,苏州235123
出 处:《计算机系统应用》2015年第8期85-90,共6页Computer Systems & Applications
摘 要:研究了英语语法中冠词错误的计算机自动纠正.首先对冠词使用的错误进行定义分类,并考虑到可能出现冠词缺失的情况,通过采用基于最大熵模型的分类器,选择包含上下文、上下文词性、短语结构等特征,在训练集上进行模型预的训练,然后使用模型对于输入句子进行预测并纠正存在的使用错误.在NUCLE语料的实验中,给出了语料处理、模型特点、训练语料的大小对于测试集效果的影响,并且比较了自然语言处理中非常通用的朴素贝叶斯模型的结果,还根据英语语法中存在的错误特点对模型进行改进,最后在测试数据达到35.48%的F值,相较于CoNLL2013的shared task中最好结果有小幅提升.Computer automation correction of article errors in English grammar is been studied. First we define the categories of article errors, and missing articles is also included, by using a maximum entropy model, extracting features covering context, part of speech, noun phrase structure and so on, training the model on the training corpus, then use the model to predict and correct the article errors of an input sentence. In the experiment on NUCLE corpus, effects of corpus preprocess, model types and the size of the training corpus are discussed. We make a comparison with the popular Naive Bayes model, at last we introduce the characters of English grammar to improve the model, a F-score of 35.48% is achieved, the result is slightly better than the best result in Co NLL 2013 shared task.
分 类 号:TP391.1[自动化与计算机技术—计算机应用技术]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.57