检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
机构地区:[1]华南农业大学数学与信息学院,广东广州510642
出 处:《中文信息学报》2016年第6期182-189,200,共9页Journal of Chinese Information Processing
基 金:国家自然科学基金(71472068);广东省大学生科技创新培育专项项目(pdjh2016b0087)
摘 要:由于领域外话语具有内容短小、表达多样性、开放性及口语化等特点,限定领域口语对话系统中超出领域话语的对话行为识别是一个挑战。该文提出了一种结合外部无标签微博数据的随机森林对话行为识别方法。该文采用的微博数据无需根据应用领域特点专门收集和挑选,又与口语对话同样具有口语化和表达多样性的特点,其训练得到的词向量在超出领域话语出现超出词汇表字词时提供了有效的相似性扩展度量。随机森林模型具有较好的泛化能力,适合训练数据有限的分类任务。中文特定领域的口语对话语料库测试表明,该文提出的超出领域话语的对话行为识别方法取得了优于最大熵、卷积神经网络等短文本分类研究进展中的方法的效果。Due to the short length,diversity,openness and colloquial features of out-of-domain(OOD)utterances,such dialogue act(DA)recognition for OOD utterances remains a challenge in domain specific spoken dialogue system.This paper proposes an effective DA recognition method using the random forest and external information.The unlabeled Weibo dataset,which is not domain specific yet possesses the similar characteristic of colloquialism and diversity with the spoken dialogue,is used to train the word embedding by unsupervised learning method.The trained word embedding provides similar computing for out of vocabulary(OOV)words in the training and test OOD utterances.The evaluation on a Chinese dialogue corpus in restricted domain shows that the proposed method outperforms some state-of-the-art short text classification methods for DA recognition.
关 键 词:对话行为识别 超出领域话语 随机森林 词向量 口语对话系统
分 类 号:TP391[自动化与计算机技术—计算机应用技术]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:3.148.113.167