限定领域口语对话系统中超出领域话语的对话行为识别  被引量:3

Dialogue Act Recognition for Out-of-Domain Utterances in Spoken Dialogue System

在线阅读下载全文

作  者:黄沛杰[1] 王俊东[1] 柯子烜 林丕源[1] 

机构地区:[1]华南农业大学数学与信息学院,广东广州510642

出  处:《中文信息学报》2016年第6期182-189,200,共9页Journal of Chinese Information Processing

基  金:国家自然科学基金(71472068);广东省大学生科技创新培育专项项目(pdjh2016b0087)

摘  要:由于领域外话语具有内容短小、表达多样性、开放性及口语化等特点,限定领域口语对话系统中超出领域话语的对话行为识别是一个挑战。该文提出了一种结合外部无标签微博数据的随机森林对话行为识别方法。该文采用的微博数据无需根据应用领域特点专门收集和挑选,又与口语对话同样具有口语化和表达多样性的特点,其训练得到的词向量在超出领域话语出现超出词汇表字词时提供了有效的相似性扩展度量。随机森林模型具有较好的泛化能力,适合训练数据有限的分类任务。中文特定领域的口语对话语料库测试表明,该文提出的超出领域话语的对话行为识别方法取得了优于最大熵、卷积神经网络等短文本分类研究进展中的方法的效果。Due to the short length,diversity,openness and colloquial features of out-of-domain(OOD)utterances,such dialogue act(DA)recognition for OOD utterances remains a challenge in domain specific spoken dialogue system.This paper proposes an effective DA recognition method using the random forest and external information.The unlabeled Weibo dataset,which is not domain specific yet possesses the similar characteristic of colloquialism and diversity with the spoken dialogue,is used to train the word embedding by unsupervised learning method.The trained word embedding provides similar computing for out of vocabulary(OOV)words in the training and test OOD utterances.The evaluation on a Chinese dialogue corpus in restricted domain shows that the proposed method outperforms some state-of-the-art short text classification methods for DA recognition.

关 键 词:对话行为识别 超出领域话语 随机森林 词向量 口语对话系统 

分 类 号:TP391[自动化与计算机技术—计算机应用技术]

 

参考文献:

正在载入数据...

 

二级参考文献:

正在载入数据...

 

耦合文献:

正在载入数据...

 

引证文献:

正在载入数据...

 

二级引证文献:

正在载入数据...

 

同被引文献:

正在载入数据...

 

相关期刊文献:

正在载入数据...

相关的主题
相关的作者对象
相关的机构对象