基于词嵌入扩充的口语对话文本领域分类∗
2016-05-16杨萌萌黄浩
新疆大学学报(自然科学版)(中英文) 2016年2期
杨萌萌,黄浩
(新疆大学信息科学与工程学院,新疆乌鲁木齐830046)
0 引言
口语对话是指人与计算机之间以某种形式通过语音进行信息交换的过程.典型的口语对话系统主要包括以下五个组成部分:自动语音识别、口语理解、对话管理、语言生成和语音合成.口语理解是实现口语对话系统的关键技术之一,它的任务是对用户的口语化输入和意图进行解析和理解并从用户输入语句中抽取关键信息.口语理解方法[1]主要包含三种:基于规则的方法、基于统计的方法以及两者的结合.口语对话系统可分为两种:限制域口语对话系统和开放域口语对话系统.由于限制域口语对话系统应用的局限性,对开放域口语对话系统的研究越来越受关注.开放域口语对话系统是针对某几个领域口语对话进行综合的系统,要提高开放域口语对话系统的有效性,首先需要对语音识别后的口语对话文本进行正确的领域分类.SVM具有较好的分类性能,但需要对训练数据进行大量人工标注.针对以上问题,本文提出了无监督的概率生成模型LDA主题分类方法,同时针对数据稀疏的问题,采用word2vec对类似于短文本的口语对话文本进行语义扩充,将短文本转化为长文本,使LDA模型更加有效地估计出口语对话文本的隐含主题.
1 相关工作
目前,常见的口语对话系统领域分类方法是SVM,Wu Weilin等人提出了基于SVM的弱监督学习方法[2],采用弱监督的SVM对口语对话文本进行主题……
登录APP查看全文