APP下载

基于词嵌入扩充的口语对话文本领域分类∗

2016-05-16杨萌萌黄浩

新疆大学学报(自然科学版)(中英文) 2016年2期
关键词:分类文本方法

杨萌萌,黄浩

(新疆大学信息科学与工程学院,新疆乌鲁木齐830046)

0 引言

口语对话是指人与计算机之间以某种形式通过语音进行信息交换的过程.典型的口语对话系统主要包括以下五个组成部分:自动语音识别、口语理解、对话管理、语言生成和语音合成.口语理解是实现口语对话系统的关键技术之一,它的任务是对用户的口语化输入和意图进行解析和理解并从用户输入语句中抽取关键信息.口语理解方法[1]主要包含三种:基于规则的方法、基于统计的方法以及两者的结合.口语对话系统可分为两种:限制域口语对话系统和开放域口语对话系统.由于限制域口语对话系统应用的局限性,对开放域口语对话系统的研究越来越受关注.开放域口语对话系统是针对某几个领域口语对话进行综合的系统,要提高开放域口语对话系统的有效性,首先需要对语音识别后的口语对话文本进行正确的领域分类.SVM具有较好的分类性能,但需要对训练数据进行大量人工标注.针对以上问题,本文提出了无监督的概率生成模型LDA主题分类方法,同时针对数据稀疏的问题,采用word2vec对类似于短文本的口语对话文本进行语义扩充,将短文本转化为长文本,使LDA模型更加有效地估计出口语对话文本的隐含主题.

1 相关工作

目前,常见的口语对话系统领域分类方法是SVM,Wu Weilin等人提出了基于SVM的弱监督学习方法[2],采用弱监督的SVM对口语对话文本进行主题……

登录APP查看全文

猜你喜欢

分类文本方法
分类算一算
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
用对方法才能瘦
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
四大方法 教你不再“坐以待病”!
捕鱼
如何快速走进文本