基于最大熵的汉语篇章结构自动分析方法  被引量:9

Automatically Parsing Chinese Discourse Based on Maximum Entropy

在线阅读下载全文

作  者:涂眉 周玉[1] 宗成庆[1] 

机构地区:[1]中国科学院自动化研究所模式识别国家重点实验室,北京100190

出  处:《北京大学学报(自然科学版)》2014年第1期125-132,共8页Acta Scientiarum Naturalium Universitatis Pekinensis

基  金:国家自然科学基金(61003160);863计划(2011AA01A207);中国科学院西部行动计划(KGZD-EW-501)资助

摘  要:在标有复句逻辑语义关系的清华汉语树库上,研究汉语篇章语义片段自动切分以及篇章关系的自动标注方法。通过比较不同序列标注模型对汉语篇章语义单元切分的性能,提出基于最大熵模型的汉语篇章结构分析方法。实验结果表明,篇章语义单元自动切分的F值能达到89.1%,当篇章语义结构树的高度不超过6层时,篇章语义关系标注的F值为63%。The authors focus on how to segment semantic units in Chinese discourse and how to label relations among semantic units automatically. During the parsing process, several sequence labelling methods are compared for discourse segmentation, while a maximum entropy-based training and decoding algorithm is specially proposed. Experiments are done based on Tsinghua Chinese Treebank, which is annotated with logical and semantic relations at complex-sentence level. Experimental results show that F-score of discourse segmentation reaches 89.1%. When parsing discourses with no more than 6 relations included, the labeling F-score can achieve 63%.

关 键 词:语义片段自动切分 篇章结构分析 逻辑语义关系 树库 

分 类 号:TP391.1[自动化与计算机技术—计算机应用技术]

 

参考文献:

正在载入数据...

 

二级参考文献:

正在载入数据...

 

耦合文献:

正在载入数据...

 

引证文献:

正在载入数据...

 

二级引证文献:

正在载入数据...

 

同被引文献:

正在载入数据...

 

相关期刊文献:

正在载入数据...

相关的主题
相关的作者对象
相关的机构对象