检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
作 者:李艳翠[1,2] 冯文贺[3] 周国栋[1] 朱坤华[2]
机构地区:[1]苏州大学计算机科学与技术学院,苏州215006 [2]河南科技学院信息工程学院,新乡453003 [3]河南科技学院人文学院,新乡453003
出 处:《北京大学学报(自然科学版)》2013年第1期7-14,共8页Acta Scientiarum Naturalium Universitatis Pekinensis
基 金:国家863计划(2012AA011102);国家自然科学基金(90920004)资助
摘 要:根据篇章分析的任务和实践,结合传统研究,提出汉语的基本篇章单位为子句,并从结构、功能、形式等方面给出其定义。分析了逗号与子句的关系,并在标注语料上进行了基于逗号的汉语子句识别研究。首先手工标注了CTB6.0中前100篇文档的逗号是否为子句边界的信息,在标注结果中抽取句法、词汇、长度等特征进行实验,子句识别准确率为90%。然后利用信息增益选出贡献最大的9个特征,使用它们也可获得较高的子句识别准确率。最后仅使用词法信息,子句识别准确率可达84.5%。实验证明子句的定义合理,基于逗号的子句识别在理论上和实验上均可行。According to the task of Chinese discourse analysis and practice, combined with t;aditional study, the authors propose clause as basic discourse unit and give its definition from the structure, function, form etc. The authors analyse the relationship between the comma and clause, and research clause identification using comma on annotation corpus. The corpus labeled whether each comma can be regarded as clause boundary information extract from CTB6.0, and have total of 2171 commas in 1348 sentences. The authors extract syntax, vocabulary, length features for experiment, and clauses identification accuracy can reach 90%. Nine greatest contribution features are chosen by information gain, they can obtain high clauses identification accuracy. Finally only using morphology feature, the accuracy can reach 84.5%. Experiments show that the definition of clause is reasonable and identification clause based on the comma is feasible.
分 类 号:TP391.1[自动化与计算机技术—计算机应用技术]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.15